OpenAI transformou velocidade em produto seis vezes mais caro; a questão de US$ 48 bilhões é quem fornece os chips que o atendem
O DevDay da OpenAI transformou o Ultrafast em nível disponível a seis vezes o preço, no mesmo dia em que uma publicação especializada afirmou que ele roda em chips da Nvidia e um executivo da Cerebras registrou venda de ações. A conversão do backlog segue o calendário da OpenAI; o canal financiado das neoclouds é a parte que a Cerebras controla.
Richard Tang · 4 min read
O Ultrafast virou produto disponível no DevDay da OpenAI, em 29 de setembro: até 300 tokens de saída por segundo, cobrado a seis vezes as tarifas padrão de API, já em operação para o GPT-6 Astra, com a versão GPT-6.1 Sol prevista para os próximos dias 1. Desenvolvedores agora otimizam três variáveis — inteligência, custo e latência —, e a que sustenta um múltiplo de preço é a velocidade 1. Quem fornece essa velocidade virou uma afirmação que vale US$ 48 bilhões para uma fabricante de chips — e esta semana ela foi posta à prova 2.
A carga de trabalho que paga o múltiplo é a programação por agentes
Quem paga o prêmio de seis vezes é a carga de trabalho dos agentes. Um agente de programação faz centenas ou milhares de chamadas de inferência em sequência, e cada uma delas está no caminho crítico 3. O exemplo prático da General Compute: um agente que precisa de 400 chamadas ao modelo leva cerca de 20 minutos a 100 tokens por segundo — e menos de 7 minutos a 300 3.
Na ponta lenta, o desenvolvedor sai e volta depois; na rápida, ele continua acompanhando 3. Essa mudança de comportamento é o que o prêmio compra — e é por isso que o silício por trás do Ultrafast importa.
De repente, o silício por trás do nível é a questão
Em agosto, o Ultrafast era uma prévia limitada que rodava o GPT-5.6 Sol em hardware da Cerebras a até 750 tokens por segundo — cerca de 14 vezes a velocidade padrão 14. O nível lançado esta semana chega ao pico de 300, trocando velocidade de manchete por uma inteligência mais recente, no enquadramento da VentureBeat 1. Depois, na noite do lançamento, a SemiAnalysis publicou que o GPT-6.1 Sol Ultrafast roda com baixo tamanho de lote (batch size) em GPUs da Nvidia, não da Cerebras — o regime que prioriza latência, justamente aquele em que a memória no chip da Cerebras deveria manter sua vantagem 56. É uma única publicação especializada, não uma confirmação — e a Cerebras até agora não confirmou nem negou qualquer papel no atendimento ao nível 6. O mercado não esperou: a ação caiu cerca de 7% em 30 de setembro 6.
Nível Ultrafast em produção da OpenAI tem pico abaixo da prévia de agosto rodada na Cerebras
Data
| Value | |
|---|---|
| Celeris-1 | 1,491 tok/s |
| Mercury 2 | 769 tok/s |
| GPT-5.6 Sol Ultrafast (ago, Cerebras) | 750 tok/s |
| GPT-6 Astra Ultrafast (set) | 300 tok/s |
| Gemini 3.5 Flash | 201 tok/s |
O que os detentores de CBRS têm de fato
Antes da queda, o The Motley Fool colocava a Cerebras perto dos US$ 48 bilhões em valor de mercado 2. O registro por trás desse preço mostra um backlog de US$ 25,4 bilhões, com parcela significativa atrelada a um único acordo com a OpenAI — e apenas cerca de 22% dele, aproximadamente US$ 5,6 bilhões, com conversão esperada até 30 de junho de 2028, em um cronograma que o cliente pode alterar 2. No mesmo dia do lançamento do Ultrafast, o executivo Dhiraj Mallick registrou a intenção de vender 396 mil ações por US$ 77,9 milhões, no âmbito de um plano de negociação (trading plan) adotado em 30 de junho, depois de vender 38.889 ações por US$ 8.642.077,14 em 18 de agosto: venda para o lado comprador em duas datas 7. Postagens de investidores no r/CBRS_stock liam o Ultrafast como silício da Cerebras e apontavam compras de opções de compra (calls); foi essa crença — não a evidência — que se reprecificou nesta semana 8.
Só cerca de um quinto do backlog de US$ 25,4 bilhões da Cerebras deve se converter até meados de 2028
Data
| Value | |
|---|---|
| Backlog total | $25.4B |
| Conversão posterior | $19.8B |
| Conversão até 30 de junho de 2028 | $5.6B |
A parte que a Cerebras controla
A resposta da empresa é uma distribuição que não depende das escolhas da OpenAI sobre como servir seus modelos. A General Compute, uma neocloud voltada a chips alternativos, assinou um acordo plurianual para implantar sistemas da Cerebras dedicados à programação por agentes, lastreado na linha de crédito de US$ 400 milhões obtida junto à Upper90 em julho, com capacidade a partir do primeiro trimestre de 2027 3. A formulação da própria General Compute é a frase mais certeira da saga: chips vencem pela capacidade implantada, e capacidade implantada é um problema de financiamento antes de ser um problema de engenharia 3. Os credores bancam o hardware; a Cerebras recebe pela velocidade, em contratos que a OpenAI não controla 9.
O que está provado, e o que está no preço
Provado: a velocidade vende com prêmio, os agentes são a carga de trabalho que paga por ele e já existe um canal financiado para distribuir a velocidade da Cerebras sem passar pela OpenAI. Não provado: que o nível principal precise da Cerebras para ser servido. A OpenAI colocou em produção um teto mais lento do que o de sua própria prévia de agosto, e seus contratos de backlog deixam o cronograma nas mãos do cliente. Dois testes vêm a seguir: onde o GPT-6.1 Sol Ultrafast vai aterrissar, e se os racks de 2027 encontram compradores.
A própria divisão em níveis é inequivocamente boa para a adoção, já que agentes que terminam em minutos mantêm as pessoas no circuito e tiram mais trabalho da espera humana. Mas, com essa avaliação, a Cerebras está precificada como a empresa que os serve. A OpenAI provou que velocidade vende; não provou que cabe à Cerebras cobrar o prêmio.
Deepdive
AI-generated from this story and its cited sources. Not investment advice.


