El 4,8x de Cognition demuestra caudal de tokens, no trabajo de agentes más barato

El primer cliente de Vera Rubin de CoreWeave publicó un banco de pruebas con un caudal de tokens de 4,8x, pero sin ninguna cifra de coste, al tiempo que la empresa ha subido un 35% el precio de sus GPU desde julio. El dato que necesitan los accionistas de CRWV —el coste por sesión de Devin completada— no figura en ninguna parte de los comunicados.

Leer el original

Vincent JiangVincent Jiang · 3 min read
Share
Un rack Nvidia DGX GB200 fotografiado en todo su alto, la clase de sistemas NVL72 de la generación anterior que el banco de pruebas de Vera Rubin de Cognition tomó como línea base
1 / 6Slide 1 of 6
Un rack Nvidia DGX GB200, el sistema NVL72 de la generación anterior cuyo caudal es la línea base de 1,0x del banco de pruebas de Vera Rubin de Cognition. Los nuevos racks Vera Rubin NVL72 que ejecutan Devin en CoreWeave no se han mostrado en público.

Cognition tiene la costumbre de anunciar sus hitos con cifras de por medio. El 8 de septiembre fue una ronda Serie E: más de 2.000 millones de dólares captados a una valoración de 48.000 millones, con unos ingresos a ritmo anual (run-rate) que, según la propia compañía, crecían de 492 millones de dólares en mayo a casi 900 millones 1. El 29 de septiembre llegó un acuerdo con MongoDB para vender Devin como el motor de las migraciones empresariales 2. Y el 30 de septiembre, en la conferencia Fully Connected de CoreWeave, se convirtió en el primer cliente del mundo que ejecuta cargas de trabajo en producción sobre el Vera Rubin NVL72 de Nvidia, con un caudal total de tokens (throughput) de hasta 4,8x en sus cargas de inferencia SWE-2 frente a la línea base del GB200 NVL72, y de 3,8x en aprendizaje por refuerzo 134.

Un banco de pruebas sin factura

En los comunicados faltan siempre las mismas cosas. Ni cifras absolutas de caudal, ni precios, ni consumo energético, ni detalles de configuración suficientes para reproducir la comparación, ni recuento de tareas completadas 1. El comunicado de CoreWeave califica los resultados de «pruebas independientes», pero las ejecutaron los propios ingenieros de Cognition frente a una línea base alojada en la nube de la propia CoreWeave 4. La única traducción a dinero es verbal: Chen Goldberg, vicepresidenta ejecutiva de producto e ingeniería de CoreWeave, dijo que las mejoras permiten ejecutar más sesiones simultáneas de Devin por GPU y «un coste por sesión más bajo», y ese coste no lo ha publicado ningún comunicado 34.

Dos mejoras comunicadas, una línea base y ningún coste a la vista

0x2x4x6xLínea base GB200Inferencia SWE-2 en Vera Rubin (Cognition)Tokens de salida de aprendizaje por refuerzo en Vera Rubin (Cognition)3.8x4.8x
Data
Caudal de tokens, múltiplo de la línea base GB200
Línea base GB2001x
Inferencia SWE-2 en Vera Rubin (Cognition)4.8x
Tokens de salida de aprendizaje por refuerzo en Vera Rubin (Cognition)3.8x
Todos los valores son caudal de tokens expresado en múltiplos de la línea base GB200 NVL72, la comparación que define la metodología declarada del banco de pruebas: la línea base se sitúa en 1,0x por definición, y las mejoras comunicadas por Cognition en Vera Rubin NVL72 se miden frente a ella [1][4]. Ambas mejoras son bancos de pruebas vinculados al proveedor, sin cifras absolutas, precios ni consumo energético publicados. Fuentes: RuntimeWire [1]; Business Wire vía Yahoo Finance [4].1,4

El libro de cuentas más pesado es el de CoreWeave

Hay dos libros de cuentas en juego. Cognition necesita demostrar que los 2.000 millones de dólares de su ronda compran capacidad de cómputo que abarata las ejecuciones largas de agentes, mientras fija el precio de Devin frente a Claude Code y Cursor 1. El libro de CoreWeave pesa más. La compañía dice que la demanda multiplica por diez cada megavatio de capacidad y se mantiene firme en su objetivo de despliegue de 8 GW para 2030. Tras la conferencia, Cantor Fitzgerald mantuvo su recomendación de sobreponderación (overweight) y su precio objetivo de 176 dólares para el valor 5. Esa rampa se financia sobre la base de pruebas de demanda cuyo primer dato público es un banco de pruebas escrito a cuatro manos entre el cliente y el proveedor. Son los accionistas de CRWV quienes lo respaldan.

Cuánto cuesta una sesión, la cifra que falta

El caudal no es economía. Si una sesión de Devin consume más tokens, una mejora de 4,8x en tokens por segundo se queda en algo mucho menos vistoso medida en coste por tarea completada. CoreWeave, además, ha subido los precios un 25% desde julio y encima otro 10%, según la nota de Cantor 5. La afirmación de la propia compañía a nivel de silicio —un caudal de tokens por megavatio diez veces superior al del GB200 con DeepSeek R1— es una cifra de eficiencia, no una factura, y aparece en el mismo comunicado que omite cualquier dato de coste 4. Mientras tanto, el día anterior Cognition había vendido ese mismo agente en el embudo de migraciones de MongoDB, prometiendo que un trabajo que antes llevaba entre cinco y seis horas ahora tarda poco más de una 2. La verdadera pregunta de la semana es si las bajadas de precio por tarea en la programación con IA se están financiando con eficiencia o con capital. Hasta que una u otra publique el coste por sesión en Vera Rubin frente al GB200, el mercado pone precio al múltiplo, no al coste. El caudal no es economía.

Deepdive

AI-generated from this story and its cited sources. Not investment advice.

Reader comments

0 comments

    Sign up

    Get your curated digest

    After email confirmation, you will receive a daily digest of the most relevant news that matter to your portfolio