Figure compromete 3.500 millones en cómputo mientras sus robots fallan el 44 % de las pruebas

Figure asegura que Helix 2.5 superó 237 de las 420 pruebas de todo o nada realizadas en 30 hogares del área de la Bahía de San Francisco que no había visto nunca, frente al 9 % alcanzado sin preentrenamiento con Index [1][2]. Según Reuters, la compañía ha comprometido capacidad de cómputo de Nscale por valor de 3.500 millones de dólares, casi el doble de los 1.900 millones que ha captado en toda su historia [7][8][9].

Leer el original

In this storyTSLANVDA
Vincent JiangVincent Jiang · 3 min read
Share
Figure AI
1 / 6Slide 1 of 6
Figure AI

Solo el preentrenamiento con Index pasa del 9 % al 56 %

Figure asegura que Helix 2.5 entró en 30 hogares del área de la Bahía de San Francisco que no había visto nunca, realizó tres tareas domésticas con un único punto de control (checkpoint) sin modificar y superó 237 de las 420 pruebas a ciegas 123. La calificación no admitía puntuación parcial: entre 13 y 15 juguetes dentro de la cesta, cada toalla doblada, el edredón sin arrugas 1. Una política gemela entrenada desde cero con idénticos datos aprobó un 9 %; la gemela preentrenada con Index, un 56 %, y Figure sostiene que el preentrenamiento con su conjunto de vídeos humanos fue la única variable experimental 134. Todos los números proceden del informe de la propia Figure; ningún evaluador externo ha repetido la prueba 3.

El dinero descansa en una predicción de la pérdida con cuatro decimales

La afirmación más contundente está debajo de la demo: Figure entrenó cuatro modelos con volúmenes de datos de Index que variaban en un factor de ocho y asegura que, antes de comenzar el entrenamiento, predijo con cuatro decimales la pérdida de predicción de acciones de su mayor ejecución: una ley de escalado de la transferencia de humano a humanoide que la empresa presenta como la primera medida en un humanoide 14. Si la curva se mantiene, el rendimiento de la siguiente duplicación de vídeo humano puede ponerse precio antes de pagar el entrenamiento 2. La rivalidad con el Optimus de Tesla se plantea en los mismos términos: un pulso de fosos defensivos de datos, los kilómetros que acumula la flota de Tesla contra el vídeo pagado de Figure 5. Index añade unos 35 minutos de experiencia humana nueva cada segundo, y su contador público marcaba 24.593.204 subidas el 24 de septiembre, frente a más de 16 millones de vídeos cuando la aplicación se lanzó el 25 de agosto 1468.

El otro 44 %

Bajo ese mismo baremo de todo o nada, el robot falló el 44 % de sus pruebas: la recogida de juguetes aprobó un 40 %; doblar toallas, un 62 %; hacer la cama, un 67 % 23. El máximo responsable de Sunday Robotics, Tony Zhao, replicó en cuestión de horas: «fallar la mitad de las veces no es "hacer un trabajo realmente útil"» 2. Su contracifra —778 de 785 dobleces, un 99,1 %— cuenta prendas sueltas, no tareas enteras, de modo que las dos varas de medir no se pueden comparar directamente 2. El otro pagador de la evaluación fueron los 30 hogares que prestaron sus habitaciones: pisos de alquiler temporal con los juguetes colocados para la escena, despejados por definición, sin mascotas y sin montones de ropa pendiente. Esas son las condiciones bajo las que se califica ese 44 % 2.

La recogida de juguetes es la tarea más débil: aprueba dos de cada cinco pruebas

0%20%40%60%80%Recogida de juguetes40%Doblar toallas62%Hacer la cama67%las 420 pruebas: 56 %
Data
Value
Recogida de juguetes40%
Doblar toallas62%
Hacer la cama67%
Porcentaje de pruebas de todo o nada aprobadas por tarea en la evaluación «zero-shot» (sin ajuste previo) de Figure en 30 hogares. La línea del 56 % es la media de las 420 pruebas a ciegas. Las cifras son de la propia Figure, recogidas por Forbes y TechRepublic; ningún evaluador externo las ha repetido.2,3

La factura llega antes que la prueba

Figure ha captado 1.900 millones de dólares a lo largo de su historia, poco más de 1.000 millones de ellos el pasado septiembre con una valoración de 39.000 millones, y nunca ha hecho pública su cifra de ingresos 89. El 3 de septiembre comprometió 3.500 millones de dólares en capacidad de cómputo de Nscale, con la intención de escalarlo por encima de los 6.000 millones y con hasta 100.000 GPU de Nvidia que no llegarán antes del segundo semestre de 2027; en el mismo acuerdo, Nscale pasó a ser accionista 789.

El compromiso de cómputo de Figure casi duplica todo el dinero que ha captado en su historia

  • Estimate
$0B$2B$4B$6BCapital captado en total$1.9BCómputo comprometido con Nscale$3.5Blas primeras GPU llegan en el 2.º semestre de 2027Intención de escalar por encima$6B
Data
Value
Capital captado en total$1.9B
Cómputo comprometido con Nscale (estimate)$3.5B
Intención de escalar por encima$6B
En miles de millones de dólares. Capital captado en total hasta septiembre de 2026; compromiso plurianual de cómputo firmado el 3 de septiembre de 2026; la cifra de 6.000 millones es una intención declarada de escalar, no un gasto contratado.7,8,9

Antes de que llegue una sola GPU, conviene vigilar dos cosas: si la siguiente duplicación de Index mueve la cifra del 56 % y si Figure, Sunday Robotics y 1X (el tercer bando humanoide en la disputa por los benchmarks) ejecutan alguna vez un único benchmark neutral de tareas domésticas 2. La propia Figure reconoce que la conclusión no es que la robótica humanoide esté resuelta 1. La apuesta dice que esa moneda al aire tiene una ley de escalado.

How this brief was made

Become a contributor

Reporting on the business of AI and want it read? We take pitches from outside contributors who bring primary sources and a number worth arguing about.

Share

Deepdive

AI-generated from this story and its cited sources. Not investment advice.

Reader comments

0 comments

    Sign up

    Get your curated digest

    After email confirmation, you will receive a daily digest of the most relevant news that matter to your portfolio