Cerebras corta ao meio o próprio fosso competitivo e chama isso de ganho de 5 vezes
Para a SemiAnalysis, são as GPUs da Nvidia, e não os wafers da Cerebras, que servem o GPT-6.1 Sol Ultrafast da OpenAI. A Cerebras respondeu sem desmentido, e sim com um redesenho que mantém no próprio silício apenas a metade de decodificação (decode) da inferência — na semana em que a ação caiu abaixo dos US$ 185 do preço de IPO.
Vincent Jiang · 2 min read
A acusação que ninguém desmentiu
A SemiAnalysis publicou em 30 de setembro que o GPT-6.1 Sol Ultrafast da OpenAI roda em GPUs da Nvidia com tamanho de lote (batch) baixo, e não no silício da Cerebras 12. Lote baixo é o regime para o qual a Cerebras foi construída: poucas requisições simultâneas, cada uma respondida com rapidez 2. Os materiais do DevDay da OpenAI, divulgados um dia antes, colocaram o Astra Ultrafast no ar, chamaram a versão do 6.1 Sol de "em breve", fixaram o nível em seis vezes as tarifas padrão da API e não citaram nenhum chip 3.
O papel CBRS recuou para cerca de US$ 181, abaixo dos US$ 185 do IPO de maio 45. A OpenAI é o maior cliente da Cerebras em receita contratada 15. A prévia do nível, apresentada em agosto sobre o GPT-5.6 Sol, rodou em hardware da Cerebras a até 750 tokens por segundo 3; a versão agora prometida atinge no máximo 300 3. Nenhuma das duas empresas confirmou ou desmentiu a afirmação 14.
O pré-preenchimento sai de cena
A Cerebras respondeu em 1º de outubro com um redesenho, não com um desmentido. Seu post sobre desagregação entrega o pré-preenchimento (prefill), a primeira metade da inferência e a mais pesada em computação, a aceleradores de parceiros — mostra sistemas AWS Trainium e Helios, da AMD, alimentando um pool de decodificação da Cerebras — e relata ganho de capacidade de 5 vezes em testes iniciais com a mesma área de wafer 6. O número é alegado pela própria empresa e não foi verificado. Na parte que os wafers mantêm, eles seguem vencendo: a vazão de decodificação no GPT-oss-120B é de 1.669 tokens de saída por segundo, contra 708 do rival mais próximo, em números da Artificial Analysis reproduzidos pelo post 6.
A metade que a Cerebras manteve: a decodificação segue mais de duas vezes mais rápida que a de qualquer rival
Data
| Tokens de saída por segundo | |
|---|---|
| Cerebras | 1,669 t/s |
| SambaNova | 708 t/s |
| Groq | 475 t/s |
| Microsoft Azure | 319 t/s |
| Nebius | 294 t/s |
| Baseten | 293 t/s |
Meio fosso competitivo, vendido a crédito
A arquitetura mais estreita já circula pelos revendedores. A Gimlet Labs planeja 100 megawatts de capacidade da Cerebras e, em conjunto com a empresa, mira até 3 mil tokens por segundo 78. O pedido da General Compute, o primeiro saque de uma linha de dívida de até US$ 400 milhões concedida pela Upper90, entra em operação no primeiro trimestre de 2027 910. Os dois ficam atrás de OpenAI, G42 e AWS na fila por suprimento, diante de US$ 25,4 bilhões em obrigações de desempenho remanescentes no segundo trimestre, enquanto a receita de nuvem e serviços da própria Cerebras, em alta de 281% na comparação anual para US$ 126,0 milhões, vende ao lado deles 78.
O relógio corre junto com os chips. Comunicados do Form 144 referentes a vendas propostas que somam US$ 84,3 milhões, do COO e do CFO, foram registrados em 29 de setembro no âmbito de planos de negociação adotados em 30 de junho — e cerca de 19,4 milhões de ações ficaram elegíveis para venda na manhã seguinte 411. Proposta não é venda, e os planos antecedem a queda 4.
À espera do veredito
Dois fatos vão definir o preço da ação: qual silício a OpenAI apontar para o 6.1 Sol Ultrafast e se o ganho de 5 vezes sobrevive à concorrência em produção. A Nvidia já transforma a desagregação em produto, como recurso de fornecedor único, em seu roteiro Rubin 8. A Cerebras segue dona da metade mais rápida da inferência; nesta semana, o mercado começou a precificar quanto vale a outra metade.
Deepdive
AI-generated from this story and its cited sources. Not investment advice.



