Figure bindet 3,5 Milliarden Dollar an Rechenleistung – sein Roboter scheitert in 44 % der Tests

Laut Figure bestand Helix 2.5 237 von 420 Alles-oder-nichts-Tests in 30 zuvor unbekannten Haushalten in der Bay Area – nach 9 % ohne Index-Vortraining [1][2]. Wie Reuters berichtet, hat das Unternehmen Rechenkapazität von Nscale im Wert von 3,5 Milliarden Dollar gebunden – fast doppelt so viel wie die 1,9 Milliarden Dollar, die es je eingesammelt hat [7][8][9].

Original lesen

In this storyTSLANVDA
Vincent JiangVincent Jiang · 3 min read
Share
Figure AI
1 / 6Slide 1 of 6
Figure AI

Allein das Vortraining mit Index machte aus 9 % 56 %

Figure berichtet, Helix 2.5 sei in 30 Haushalte in der Bay Area gegangen, die der Roboter nie zuvor gesehen hatte; mit ein und demselben unveränderten Modell habe er dort drei Hausarbeiten erledigt und 237 von 420 blinden Testläufen bestanden 123. Teilpunkte gab es nicht: alle 13 bis 15 Spielzeuge im Korb, jedes Handtuch gefaltet, die Bettdecke glattgezogen 1. Ein Zwillingsmodell, das mit identischen Daten von Grund auf trainiert wurde, kam auf 9 %; das mit Index vortrainierte Zwilling auf 56 % – das Vortraining auf dem eigenen Datensatz mit menschlichen Videos sei die einzige experimentelle Variable gewesen, sagt Figure 134. Sämtliche Zahlen stammen aus Figures eigenem Bericht; wiederholt hat den Test bislang niemand von außen 3.

Das Geld beruht auf einer Fehlerprognose mit vier Dezimalstellen

Der schärfere Anspruch steht unter der Demo: Figure trainierte vier Modelle mit Index-Datenmengen, die sich um den Faktor acht unterschieden. Vor Trainingsbeginn habe das Unternehmen den Loss (Fehlerwert) der Aktionsvorhersage seines größten Trainingslaufs auf vier Dezimalstellen genau vorhergesagt, sagt Figure: ein Skalierungsgesetz für den Transfer vom Menschen zum Humanoiden, nach eigenen Angaben das erste, das an einem Humanoiden gemessen wurde 14. Hält die Kurve, lässt sich beziffern, was die nächste Verdopplung der menschlichen Videos einbringt – noch bevor der Rechenlauf bezahlt ist 2. Auch der Wettstreit mit dem Optimus von Tesla folgt derselben Logik: ein Duell der Daten-Burggräben, Teslas Flottenmeilen gegen Figures bezahlte Videos 5. Jede Sekunde kommen über Index rund 35 Minuten neuer menschlicher Erfahrung zusammen; der öffentliche Zähler stand am 24. September bei 24.593.204 Uploads, nach mehr als 16 Millionen Videos zum Start der App am 25. August 1468.

Die anderen 44 Prozent

Nach derselben Alles-oder-nichts-Maßgabe scheiterte der Roboter in 44 % seiner Testläufe; je Aufgabe lag die Quote bei 40 % fürs Aufräumen von Spielzeug, 62 % fürs Faltender Handtücher und 67 % fürs Bettmachen 23. Tony Zhao, Chef von Sunday Robotics, antwortete binnen Stunden: „In der Hälfte der Fälle zu scheitern ist keine ‚wirklich nützliche Arbeit‘.“ 2 Seine Gegenzahl – 778 von 785 Faltvorgängen, 99,1 % – zählt einzelne Kleidungsstücke, keine ganzen Aufgaben; die beiden Maßstäbe sind also nicht unmittelbar miteinander vergleichbar 2. Der andere Zahler dieser Evaluierung waren die 30 Haushalte, die ihre Zimmer hergaben: Kurzzeitvermietungen, mit Spielzeug drapiert, per Definition aufgeräumt, ohne Haustiere und ohne Wäscheberge – die Bedingungen, unter denen die 44 % erhoben wurden 2.

Spielzeug aufräumen ist die schwächste Aufgabe: nur zwei von fünf Tests bestanden

0%20%40%60%80%Spielzeug aufräumen40%Handtücher falten62%Bettmachen67%alle 420 Testläufe: 56 %
Data
Value
Spielzeug aufräumen40%
Handtücher falten62%
Bettmachen67%
Anteil der bestandenen Alles-oder-nichts-Testläufe je Hausarbeit in Figures Zero-Shot-Evaluierung in 30 Häusern. Die 56-%-Linie markiert den Durchschnitt über alle 420 blinden Testläufe. Die Zahlen stammen von Figure selbst und wurden von Forbes und TechRepublic berichtet; kein unabhängiger Prüfer hat sie wiederholt.2,3

Die Rechnung kommt vor dem Beweis

Figure hat in seiner Unternehmensgeschichte 1,9 Milliarden Dollar eingesammelt, gut eine Milliarde davon erst im vergangenen September bei einer Bewertung von 39 Milliarden Dollar; Umsätze hat das Unternehmen nie offengelegt 89. Am 3. September band Figure 3,5 Milliarden Dollar an Rechenkapazität von Nscale fest, mit der Absicht, über sechs Milliarden Dollar hinaus zu skalieren; bis zu 100.000 Nvidia-GPUs sollen frühestens in der zweiten Jahreshälfte 2027 eintreffen. Im selben Deal stieg Nscale zum Aktionär 789.

Figures gebundene Rechenkapazität ist fast doppelt so hoch wie alles Geld, das das Unternehmen je eingesammelt hat

  • Estimate
$0B$2B$4B$6BEingesammeltes Eigenkapital$1.9BGebundene Nscale-Rechenkapazität$3.5Berste GPUs frühestens im 2. Halbjahr 2027Geplante Skalierung darüber hinaus$6B
Data
Value
Eingesammeltes Eigenkapital$1.9B
Gebundene Nscale-Rechenkapazität (estimate)$3.5B
Geplante Skalierung darüber hinaus$6B
Angaben in Milliarden US-Dollar. Insgesamt eingesammeltes Eigenkapital bis September 2026; mehrjährige Rechenkapazitätsbindung vom 3. September 2026; die 6 Mrd. $ sind eine erklärte Absicht zu skalieren, kein vertraglich vereinbarter Betrag.7,8,9

Bis die erste GPU eintrifft, sind zwei Dinge zu beobachten: ob die nächste Verdopplung von Index die 56-Prozent-Quote bewegt – und ob sich Figure, Sunday und 1X, das dritte Humanoiden-Lager in diesem Benchmark-Streit, je darauf einigen, einen einzigen neutralen Benchmark für Hausarbeiten durchzuführen 2. Figure selbst räumt ein: Damit ist die humanoide Robotik noch nicht gelöst 1. Die Wette lautet: Auch der Münzwurf folgt einem Skalierungsgesetz.

How this brief was made

Become a contributor

Reporting on the business of AI and want it read? We take pitches from outside contributors who bring primary sources and a number worth arguing about.

Share

Deepdive

AI-generated from this story and its cited sources. Not investment advice.

Reader comments

0 comments

    Sign up

    Get your curated digest

    After email confirmation, you will receive a daily digest of the most relevant news that matter to your portfolio