Benchmark de 4,8x da Cognition comprova vazão de tokens, não trabalho de agente mais barato
O primeiro cliente da Vera Rubin na CoreWeave publicou um benchmark de vazão de 4,8x, mas nenhum número de custo — enquanto a CoreWeave elevou os preços de GPU em 35% desde julho. O número de que os acionistas da CRWV precisam, o custo por sessão concluída do Devin, não aparece em nenhum comunicado.
Vincent Jiang · 3 min read
Cognition costuma anunciar seus marcos com números na mão. No dia 8 de setembro, foi a vez da Série E: mais de US$ 2 bilhões captados a uma avaliação de US$ 48 bilhões, e a receita anualizada (run-rate), informada pela própria empresa, subiu de US$ 492 milhões em maio para quase US$ 900 milhões 1. No dia 29 de setembro, foi a vez da parceria com a MongoDB, vendendo o Devin como o motor das migrações corporativas 2. E no dia 30 de setembro, na conferência Fully Connected da CoreWeave, tornou-se o primeiro cliente do mundo a rodar cargas de trabalho em produção na Vera Rubin NVL72, da Nvidia: vazão total de tokens (throughput) de até 4,8x nas cargas de inferência do SWE-2 contra a linha de base GB200 NVL72, e de 3,8x em aprendizado por reforço 134.
Um benchmark sem fatura
Os comunicados trazem as mesmas lacunas: nenhum número absoluto de vazão, nenhum preço, nenhum consumo de energia, nenhum detalhe de configuração suficiente para reproduzir a comparação e nenhuma contagem de tarefas concluídas 1. O comunicado da CoreWeave apresenta os resultados como "benchmarks independentes", mas quem os executou foram os próprios engenheiros da Cognition, contra uma linha de base na própria nuvem da CoreWeave 4. A única tradução em dinheiro é verbal: Chen Goldberg, vice-presidente executivo de produtos e engenharia da CoreWeave, disse que os ganhos significam mais sessões simultâneas do Devin por GPU e "custo menor por sessão", e nenhum dos comunicados divulgou esse custo 34.
Dois ganhos divulgados, uma linha de base, nenhum custo à vista
Data
| Vazão de tokens, múltiplo da linha de base GB200 | |
|---|---|
| Linha de base GB200 | 1x |
| Inferência SWE-2 no Vera Rubin (Cognition) | 4.8x |
| Tokens de saída de RL no Vera Rubin (Cognition) | 3.8x |
A conta mais pesada é a da CoreWeave
As apostas estão lançadas em duas contas. A Cognition precisa mostrar que os US$ 2 bilhões captados compram computação que barateia as longas execuções de agentes, ao mesmo tempo em que define o preço do Devin contra o Claude Code e o Cursor 1. A conta da CoreWeave é mais pesada: a empresa diz ter, para cada megawatt de capacidade, demanda dez vezes maior, e mantém firme a meta de construir 8 GW até 2030; depois da conferência, a Cantor Fitzgerald manteve a recomendação de compra acima da média (overweight) e o preço-alvo de US$ 176 para a ação 5. Essa expansão está sendo financiada tendo por lastro evidências de demanda cujo primeiro dado público é um benchmark de autoria do próprio cliente e do próprio fornecedor. Os detentores de CRWV são quem paga a conta.
Quanto custa uma sessão é o número que falta
Vazão não é economia. Se uma sessão do Devin consumir mais tokens, um ganho de 4,8 vezes em tokens por segundo encolhe para algo bem menos impressionante no custo por tarefa concluída. E a CoreWeave aumentou os preços em 25% desde julho, mais outros 10% por cima, segundo a nota da Cantor 5. A afirmação da própria CoreWeave em nível de silício — vazão de tokens 10 vezes maior por megawatt que a do GB200, medida com o DeepSeek R1 — é um número de eficiência, não uma fatura. E ela consta do mesmo comunicado que não traz um único número de custo 4. Na véspera, a Cognition havia vendido o mesmo agente para o funil de migração do MongoDB, prometendo que um trabalho que levava de cinco a seis horas agora leva pouco mais de uma hora 2. A verdadeira questão da semana é se os cortes de preço por tarefa na programação com IA estão sendo bancados pela eficiência ou pelo capital. Até que uma das duas empresas publique o custo por sessão no Vera Rubin frente ao GB200, o mercado está precificando o múltiplo, não o custo. Vazão não é economia.
Deepdive
AI-generated from this story and its cited sources. Not investment advice.



