Figure compromete US$ 3,5 bilhões em computação enquanto seu robô falha em 44% dos testes

A Figure afirma que o Helix 2.5 passou em 237 dos 420 testes de tudo ou nada realizados em 30 casas inéditas na Baía de São Francisco, ante 9% sem o pré-treinamento com o Index [1][2]. Segundo a Reuters, a empresa comprometeu US$ 3,5 bilhões em computação da Nscale — quase o dobro dos US$ 1,9 bilhão captados em toda a sua história [7][8][9].

Ler o original

In this storyTSLANVDA
Vincent JiangVincent Jiang · 3 min read
Share
Figure AI
1 / 6Slide 1 of 6
Figure AI

Só o pré-treinamento com o Index fez a taxa de sucesso saltar de 9% para 56%

A Figure afirma que o Helix 2.5 entrou em 30 casas que nunca tinha visto, na Baía de São Francisco, na Califórnia, executou três tarefas domésticas a partir de um único checkpoint, sem qualquer ajuste, e passou em 237 de 420 testes às cegas 123. A correção não admitia pontos parciais: todos os 13 a 15 brinquedos no cesto, cada toalha dobrada, o edredom liso 1. Uma política gêmea treinada do zero com dados idênticos obteve 9% de aprovação; a gêmea pré-treinada com o Index alcançou 56% — e a Figure garante que o pré-treinamento com sua base de vídeos de humanos foi a única variável experimental 134. Todos os números vêm do relato da própria Figure; nenhum avaliador externo repetiu o teste 3.

O dinheiro se apoia numa previsão de perda com quatro casas decimais

A tese mais afiada está uma camada abaixo da demonstração: a Figure treinou quatro modelos com uma variação de oito vezes no volume de dados do Index e afirma ter previsto, antes de começar o treinamento e com quatro casas decimais, a perda de previsão de ações de sua maior rodada — uma lei de escala de transferência humano-humanoide que a empresa diz ser a primeira medida em um humanoide 14. Se a curva se sustentar, o retorno da próxima duplicação do vídeo humano pode ser precificado antes de a rodada ser paga 2. A rivalidade com o Optimus, da Tesla, é enquadrada do mesmo modo: um duelo de fossos de dados, de um lado os quilômetros rodados pela frota da Tesla, de outro os vídeos pagos da Figure 5. O Index acrescenta cerca de 35 minutos de nova experiência humana por segundo, e seu contador público marcava 24.593.204 uploads em 24 de setembro, ante mais de 16 milhões de vídeos no lançamento do aplicativo, em 25 de agosto 1468.

Os outros 44%

Sob a mesma régua de tudo ou nada, o robô falhou em 44% das tentativas: arrumar brinquedos passou em 40% dos casos, dobrar toalhas em 62% e fazer a cama em 67% 23. O CEO da Sunday Robotics, Tony Zhao, respondeu em poucas horas: "falhar metade do tempo não é 'fazer trabalho realmente útil'" 2. O contraponto numérico dele — 778 dobras em 785, ou 99,1% — conta peças isoladas de roupa, não tarefas completas, de modo que as duas métricas não se comparam diretamente 2. O outro pagador da avaliação foram as 30 famílias que emprestaram seus cômodos: imóveis de aluguel de curta temporada cenografados com brinquedos, enxutos por definição, sem animais de estimação e sem pilhas de roupa — as condições sob as quais os 44% são medidos 2.

Arrumar brinquedos é a tarefa mais fraca: passa em duas de cada cinco tentativas

0%20%40%60%80%Arrumar brinquedos40%Dobrar toalhas62%Fazer a cama67%todas as 420 tentativas: 56%
Data
Value
Arrumar brinquedos40%
Dobrar toalhas62%
Fazer a cama67%
Percentual de testes de tudo ou nada aprovados, por tarefa, na avaliação zero-shot da Figure em 30 casas. A linha dos 56% é a média das 420 tentativas às cegas. Os números são da própria Figure, noticiados pela Forbes e pela TechRepublic; nenhum avaliador externo os refez.2,3

A conta chega antes da prova

A Figure captou US$ 1,9 bilhão ao longo de sua história — pouco mais de US$ 1 bilhão deles em setembro do ano passado, numa avaliação de US$ 39 bilhões — e nunca divulgou receita 89. Em 3 de setembro, a empresa comprometeu US$ 3,5 bilhões em computação da Nscale, com intenção de escalar para além de US$ 6 bilhões, e os até 100 mil GPUs da Nvidia não chegam antes do segundo semestre de 2027; no mesmo acordo, a Nscale tornou-se acionista 789.

O compromisso de computação da Figure é quase o dobro de todo o dinheiro que a empresa já captou

  • Estimate
$0B$2B$4B$6BCapital captado ao longo da vida$1.9BComputação da Nscale comprometida$3.5Bprimeiros GPUs chegam no 2º semestre de 2027Intenção de escalar para além$6B
Data
Value
Capital captado ao longo da vida$1.9B
Computação da Nscale comprometida (estimate)$3.5B
Intenção de escalar para além$6B
Em bilhões de dólares. Capital próprio captado ao longo da vida da empresa, até setembro de 2026; compromisso plurianual de computação assinado em 3 de setembro de 2026; o número de US$ 6 bilhões é uma intenção declarada de escalar, não um gasto contratado.7,8,9

Duas coisas merecem acompanhamento antes que chegue um único GPU: se a próxima duplicação do Index move os 56%, e se Figure, Sunday e 1X (a terceira facção humanoide na disputa de benchmarks) algum dia concordam em rodar um único benchmark neutro de tarefas domésticas 2. A própria Figure admite que o ponto não é que a robótica humanoide esteja resolvida 1. A aposta é que o cara ou coroa tem uma lei de escala.

How this brief was made

Become a contributor

Reporting on the business of AI and want it read? We take pitches from outside contributors who bring primary sources and a number worth arguing about.

Share

Deepdive

AI-generated from this story and its cited sources. Not investment advice.

Reader comments

0 comments

    Sign up

    Get your curated digest

    After email confirmation, you will receive a daily digest of the most relevant news that matter to your portfolio