Benchmark de 4,8x da Cognition comprova vazão de tokens, não trabalho de agente mais barato

O primeiro cliente da Vera Rubin na CoreWeave publicou um benchmark de vazão de 4,8x, mas nenhum número de custo — enquanto a CoreWeave elevou os preços de GPU em 35% desde julho. O número de que os acionistas da CRWV precisam, o custo por sessão concluída do Devin, não aparece em nenhum comunicado.

Ler o original

Vincent JiangVincent Jiang · 3 min read
Share
Rack Nvidia DGX GB200 fotografado em toda a sua altura, classe de sistema NVL72 da geração anterior usada como linha de base no benchmark da Cognition com a Vera Rubin
1 / 6Slide 1 of 6
Um rack Nvidia DGX GB200, o sistema NVL72 da geração anterior cuja vazão é a linha de base de 1,0x no benchmark da Cognition com a Vera Rubin. Os novos racks Vera Rubin NVL72 que rodam o Devin na CoreWeave não foram mostrados publicamente.

Cognition costuma anunciar seus marcos com números na mão. No dia 8 de setembro, foi a vez da Série E: mais de US$ 2 bilhões captados a uma avaliação de US$ 48 bilhões, e a receita anualizada (run-rate), informada pela própria empresa, subiu de US$ 492 milhões em maio para quase US$ 900 milhões 1. No dia 29 de setembro, foi a vez da parceria com a MongoDB, vendendo o Devin como o motor das migrações corporativas 2. E no dia 30 de setembro, na conferência Fully Connected da CoreWeave, tornou-se o primeiro cliente do mundo a rodar cargas de trabalho em produção na Vera Rubin NVL72, da Nvidia: vazão total de tokens (throughput) de até 4,8x nas cargas de inferência do SWE-2 contra a linha de base GB200 NVL72, e de 3,8x em aprendizado por reforço 134.

Um benchmark sem fatura

Os comunicados trazem as mesmas lacunas: nenhum número absoluto de vazão, nenhum preço, nenhum consumo de energia, nenhum detalhe de configuração suficiente para reproduzir a comparação e nenhuma contagem de tarefas concluídas 1. O comunicado da CoreWeave apresenta os resultados como "benchmarks independentes", mas quem os executou foram os próprios engenheiros da Cognition, contra uma linha de base na própria nuvem da CoreWeave 4. A única tradução em dinheiro é verbal: Chen Goldberg, vice-presidente executivo de produtos e engenharia da CoreWeave, disse que os ganhos significam mais sessões simultâneas do Devin por GPU e "custo menor por sessão", e nenhum dos comunicados divulgou esse custo 34.

Dois ganhos divulgados, uma linha de base, nenhum custo à vista

0x2x4x6xLinha de base GB200Inferência SWE-2 no Vera Rubin (Cognition)Tokens de saída de RL no Vera Rubin (Cognition)3.8x4.8x
Data
Vazão de tokens, múltiplo da linha de base GB200
Linha de base GB2001x
Inferência SWE-2 no Vera Rubin (Cognition)4.8x
Tokens de saída de RL no Vera Rubin (Cognition)3.8x
Todos os valores são vazões de tokens expressas em múltiplos da linha de base GB200 NVL72, a comparação definida pela metodologia declarada do benchmark: a linha de base está em 1,0x por definição, e os ganhos divulgados pela Cognition no Vera Rubin NVL72 foram medidos contra ela [1][4]. Os dois ganhos são benchmarks ligados ao fornecedor, sem números absolutos, preços ou consumo de energia publicados. Fontes: RuntimeWire [1]; Business Wire via Yahoo Finance [4].1,4

A conta mais pesada é a da CoreWeave

As apostas estão lançadas em duas contas. A Cognition precisa mostrar que os US$ 2 bilhões captados compram computação que barateia as longas execuções de agentes, ao mesmo tempo em que define o preço do Devin contra o Claude Code e o Cursor 1. A conta da CoreWeave é mais pesada: a empresa diz ter, para cada megawatt de capacidade, demanda dez vezes maior, e mantém firme a meta de construir 8 GW até 2030; depois da conferência, a Cantor Fitzgerald manteve a recomendação de compra acima da média (overweight) e o preço-alvo de US$ 176 para a ação 5. Essa expansão está sendo financiada tendo por lastro evidências de demanda cujo primeiro dado público é um benchmark de autoria do próprio cliente e do próprio fornecedor. Os detentores de CRWV são quem paga a conta.

Quanto custa uma sessão é o número que falta

Vazão não é economia. Se uma sessão do Devin consumir mais tokens, um ganho de 4,8 vezes em tokens por segundo encolhe para algo bem menos impressionante no custo por tarefa concluída. E a CoreWeave aumentou os preços em 25% desde julho, mais outros 10% por cima, segundo a nota da Cantor 5. A afirmação da própria CoreWeave em nível de silício — vazão de tokens 10 vezes maior por megawatt que a do GB200, medida com o DeepSeek R1 — é um número de eficiência, não uma fatura. E ela consta do mesmo comunicado que não traz um único número de custo 4. Na véspera, a Cognition havia vendido o mesmo agente para o funil de migração do MongoDB, prometendo que um trabalho que levava de cinco a seis horas agora leva pouco mais de uma hora 2. A verdadeira questão da semana é se os cortes de preço por tarefa na programação com IA estão sendo bancados pela eficiência ou pelo capital. Até que uma das duas empresas publique o custo por sessão no Vera Rubin frente ao GB200, o mercado está precificando o múltiplo, não o custo. Vazão não é economia.

Deepdive

AI-generated from this story and its cited sources. Not investment advice.

Reader comments

0 comments

    Sign up

    Get your curated digest

    After email confirmation, you will receive a daily digest of the most relevant news that matter to your portfolio