Figure compromete US$ 3,5 bilhões em computação enquanto seu robô falha em 44% dos testes
A Figure afirma que o Helix 2.5 passou em 237 dos 420 testes de tudo ou nada realizados em 30 casas inéditas na Baía de São Francisco, ante 9% sem o pré-treinamento com o Index [1][2]. Segundo a Reuters, a empresa comprometeu US$ 3,5 bilhões em computação da Nscale — quase o dobro dos US$ 1,9 bilhão captados em toda a sua história [7][8][9].
Vincent Jiang · 3 min read
Só o pré-treinamento com o Index fez a taxa de sucesso saltar de 9% para 56%
A Figure afirma que o Helix 2.5 entrou em 30 casas que nunca tinha visto, na Baía de São Francisco, na Califórnia, executou três tarefas domésticas a partir de um único checkpoint, sem qualquer ajuste, e passou em 237 de 420 testes às cegas 123. A correção não admitia pontos parciais: todos os 13 a 15 brinquedos no cesto, cada toalha dobrada, o edredom liso 1. Uma política gêmea treinada do zero com dados idênticos obteve 9% de aprovação; a gêmea pré-treinada com o Index alcançou 56% — e a Figure garante que o pré-treinamento com sua base de vídeos de humanos foi a única variável experimental 134. Todos os números vêm do relato da própria Figure; nenhum avaliador externo repetiu o teste 3.
O dinheiro se apoia numa previsão de perda com quatro casas decimais
A tese mais afiada está uma camada abaixo da demonstração: a Figure treinou quatro modelos com uma variação de oito vezes no volume de dados do Index e afirma ter previsto, antes de começar o treinamento e com quatro casas decimais, a perda de previsão de ações de sua maior rodada — uma lei de escala de transferência humano-humanoide que a empresa diz ser a primeira medida em um humanoide 14. Se a curva se sustentar, o retorno da próxima duplicação do vídeo humano pode ser precificado antes de a rodada ser paga 2. A rivalidade com o Optimus, da Tesla, é enquadrada do mesmo modo: um duelo de fossos de dados, de um lado os quilômetros rodados pela frota da Tesla, de outro os vídeos pagos da Figure 5. O Index acrescenta cerca de 35 minutos de nova experiência humana por segundo, e seu contador público marcava 24.593.204 uploads em 24 de setembro, ante mais de 16 milhões de vídeos no lançamento do aplicativo, em 25 de agosto 1468.
Os outros 44%
Sob a mesma régua de tudo ou nada, o robô falhou em 44% das tentativas: arrumar brinquedos passou em 40% dos casos, dobrar toalhas em 62% e fazer a cama em 67% 23. O CEO da Sunday Robotics, Tony Zhao, respondeu em poucas horas: "falhar metade do tempo não é 'fazer trabalho realmente útil'" 2. O contraponto numérico dele — 778 dobras em 785, ou 99,1% — conta peças isoladas de roupa, não tarefas completas, de modo que as duas métricas não se comparam diretamente 2. O outro pagador da avaliação foram as 30 famílias que emprestaram seus cômodos: imóveis de aluguel de curta temporada cenografados com brinquedos, enxutos por definição, sem animais de estimação e sem pilhas de roupa — as condições sob as quais os 44% são medidos 2.
Arrumar brinquedos é a tarefa mais fraca: passa em duas de cada cinco tentativas
Data
| Value | |
|---|---|
| Arrumar brinquedos | 40% |
| Dobrar toalhas | 62% |
| Fazer a cama | 67% |
A conta chega antes da prova
A Figure captou US$ 1,9 bilhão ao longo de sua história — pouco mais de US$ 1 bilhão deles em setembro do ano passado, numa avaliação de US$ 39 bilhões — e nunca divulgou receita 89. Em 3 de setembro, a empresa comprometeu US$ 3,5 bilhões em computação da Nscale, com intenção de escalar para além de US$ 6 bilhões, e os até 100 mil GPUs da Nvidia não chegam antes do segundo semestre de 2027; no mesmo acordo, a Nscale tornou-se acionista 789.
O compromisso de computação da Figure é quase o dobro de todo o dinheiro que a empresa já captou
- Estimate
Data
| Value | |
|---|---|
| Capital captado ao longo da vida | $1.9B |
| Computação da Nscale comprometida (estimate) | $3.5B |
| Intenção de escalar para além | $6B |
Duas coisas merecem acompanhamento antes que chegue um único GPU: se a próxima duplicação do Index move os 56%, e se Figure, Sunday e 1X (a terceira facção humanoide na disputa de benchmarks) algum dia concordam em rodar um único benchmark neutro de tarefas domésticas 2. A própria Figure admite que o ponto não é que a robótica humanoide esteja resolvida 1. A aposta é que o cara ou coroa tem uma lei de escala.
How this brief was made
01Gathered & sourced396 channels · 1,625 articles▾
Agents swept 396 channels and ingested 1,625 articles, then de-duplicated and ranked them for signal.
02Verified & cross-validated9 claims · 33 data feeds▾
Every one of 9 load-bearing claims was checked against primary sources, with 33 live data feeds reconciling the figures and charts.
- 1Figure, "Helix 2.5: Zero-Shot 30-Home Generalization", 17 September 2026
- 2Forbes, John Koetsier, "Figure's Billion-Dollar Physical AI Bet Delivered A 6X Jump In Robot Chore Success", 21 September 2026
- 3TechRepublic, Aminu Abdullahi, "Figure's Robot Entered 30 Unseen Homes and Succeeded 56% of the Time", 21 September 2026
- 4Unite.AI, Orion Sato, "Figure Introduces Helix 2.5, Tested Zero-Shot in 30 Unseen Homes", 17 September 2026
- 5Benzinga (via MSN), Surbhi Jain, "Tesla's Optimus has a new problem: Figure's humanoid is getting better at the unknown", 18 September 2026
- 6Figure, Index app page, live contributor counters, fetched 24 September 2026
- 7Reuters, "AI cloud firm Nscale commits compute worth $3.5 billion for Figure's robotics ambitions", 3 September 2026
- 8Forbes, John Koetsier, "How Figure Committed $3.5 Billion For AI Compute After Raising Only $1.9 Billion", 4 September 2026
- 9eWeek, Matt Gonzales, "Figure AI Commits $3.5B to Nscale Compute for Its Humanoid Robot Push", 4 September 2026
03Reviewed & edited2 human editors▾
2 editors read the draft against the evidence, tuned the framing, and signed off before it shipped.
Become a contributor
Reporting on the business of AI and want it read? We take pitches from outside contributors who bring primary sources and a number worth arguing about.
Deepdive
AI-generated from this story and its cited sources. Not investment advice.



