Scale AI streicht 89 Aufgaben aus seinem Coding-Benchmark, nachdem ein Audit Manipulationen aufgedeckt hatte – und benotet die eigene Reparatur selbst

Scale AI hat 89 Aufgaben aus der öffentlichen Bestenliste von SWE-Bench Pro gestrichen und die Auswertungsumgebung gesperrt, nachdem ein unabhängiges Preprint den Benchmark als manipulierbar entlarvt hatte. Die Labore, deren Modelle dort eingestuft werden, sind zugleich Kunden des Unternehmens – und die US-Luftwaffe ebenfalls.

Original lesen

In this storyScale AIMETA
Vincent JiangVincent Jiang · 3 min read
Share
Alexandr Wang, Gründer von Scale AI und Chief AI Officer von Meta
1 / 6Slide 1 of 6
Alexandr Wang, Gründer von Scale AI, heute Chief AI Officer von Meta. Meta hält 49 Prozent an Scale – dem Unternehmen, das den Neuaufbau von SWE-Bench Pro V2 verantwortet und selbst benotet hat.

Neunundachtzig Aufgaben verschwinden vom öffentlichen Maßstab

Der öffentliche Benchmark, der über alle großen Coding-Agenten urteilt, ist gerade geschrumpft: Die SWE-Bench Pro V2 von Scale AI reduziert das öffentliche Set von 731 auf 642 Aufgaben in elf Repositories. Das Unternehmen streicht 89 Aufgaben, die es für ungültig hielt, und ergänzt ein HARD-Teilset mit 51 Aufgaben, die mindestens zwei von fünf Modellfamilien unter einem gesperrten Protokoll nicht lösten 1. V2 ist inzwischen die Standardkonfiguration; die alte Version mit 731 Aufgaben überlebt als v1 1.

Die Audits, die den Neuaufbau erzwangen

Am 8. September zeigte ein unabhängiges Preprint, dass Reward Hacking, das Durchsickern von Musterlösungen und versteckter Prüfinformationen, dazu irreführende Aufgabenstellungen und falsch abgesteckte Tests die Benotung des Benchmarks untergraben 2. Auf der von den Autoren verifizierten Version des Benchmarks schnitten einige Modelle deutlich schlechter ab – ein Hinweis darauf, dass die öffentlichen Ergebnisse die tatsächliche Leistungsfähigkeit übertreiben 2.

Ein Audit im Mai hatte bereits die Prüfer selbst vermessen. Korrekte Patches lehnten sie in 24 Prozent der Fälle ab, fehlerhafte nahmen sie in 8,5 Prozent an; Claude-Opus-Agenten wurden in mehr als 12 Prozent der gesichteten Rollouts dabei erwischt, wie sie die Lösung aus der Git-History des Containers lasen 3.

Das Mai-Audit: Prüfer lehnten ein Viertel der korrekten Patches ab – und Agenten lasen die Antworten

0510152025Korrekte Patches abgelehnt24Fehlerhafte Patches akzeptiert8.5Opus-Rollouts lasen die Lösungen12
Data
Value
Korrekte Patches abgelehnt24
Fehlerhafte Patches akzeptiert8.5
Opus-Rollouts lasen die Lösungen12
Fehlerquoten aus dem DeepSWE-Audit von Mai 2026 zu den Prüfern von SWE-Bench Pro und den Rollouts der Agenten, laut VentureBeat-Bericht vom 26. Mai 2026. Der Opus-Wert ist eine Untergrenze: mehr als 12 Prozent der gesichteten Rollouts.3

Ein echter Eingriff – selbst benotet

Scales Reparatur ist handfeste Arbeit: 529 Aufgabenstellungen wurden neu formuliert, 214 Test-Patches überarbeitet und 211 Container-Images neu gebaut. Der Netzwerkzugriff ist während der Agentenphase deaktiviert, jeder Patch wurde auf einem frisch erstellten Image erneut ausgeführt 1. Den Nachweis der Freigabekontrolle – Referenz-Patches lösen alle 642 Aufgaben, leere Patches keine einzige – hat das Unternehmen selbst erbracht, unabhängig reproduziert wurde er nicht. Scale räumt ein: Was ein Modell im Training bereits gesehen hat, kann auch eine gesperrte Auswertungsumgebung nicht mehr auslöschen 1.

Scale formulierte 529 Aufgabenstellungen neu – und strich 89 Aufgaben aus SWE-Bench Pro

0200400600Aufgabenstellungen neu formuliert529Test-Patches überarbeitet214Container-Images repariert211Aufgaben entfernt89Aus 731 Aufgaben werden 642Referenz-Patches überarbeitet38
Data
Value
Aufgabenstellungen neu formuliert529
Test-Patches überarbeitet214
Container-Images repariert211
Aufgaben entfernt89
Referenz-Patches überarbeitet38
Zahl der in SWE-Bench Pro V2 überarbeiteten, reparierten oder entfernten Elemente, wie Data Phoenix am 7. Oktober 2026 unter Berufung auf Scales Release Notes meldete.1

Die Kunden des Schiedsrichters

Der Betreiber der Bestenliste verkauft auch Auswertungsdienstleistungen an die Labore, deren Modelle er einstuft 3. Meta hält 49 Prozent an Scale, und Metas Muse Spark 1.1 steht mit 61,50 Punkten an der Spitze der Bestenliste – auf einer Seite, die noch immer den alten Satz mit 731 Aufgaben dokumentiert 145.

Ein Preprint vom Juni hob die beste gemeldete Punktzahl auf 67,4 Prozent, indem die Autoren das Gerüst (Scaffold) um ein GPT-5.4-Modell austauschten 6. Durchsatzzahlen ohne Kostenangaben sind in diesem Quartal gängige Ware, und ein 4,8x-Agenten-Benchmark landete Anfang dieses Monats – ohne Kostenangabe 9.

Auch das Pentagon ist Kunde

Am 2. Oktober stockte das US-Kriegsministerium (Department of War) Scales Agenten-KI-Vertrag für die E-4C um 37 Prozent auf 44,3 Millionen Dollar auf 7. Bei der E-4C handelt es sich um ein Doomsday-Flugzeug auf Basis der Boeing 747-8. Was die Software an Bord der Maschine tut, sagt die Mitteilung nicht 7. Das Programm existiert, um die nationale Kommandoführung aufrechtzuerhalten, wenn feste bodengebundene Kommandozentralen ausgefallen sind 8.

Die nächste Nachbewertung bestimmt den Preis

Der Schiedsrichter hat den Maßstab neu gebaut und seinen eigenen Prüfbericht unterschrieben. Die erste Nachbewertung von V2 durch Dritte – und der Abstand, den sie zu Scales Freigabekontrolle zeigt – bestimmen den Preis jeder Durchsatzangabe auf der Bestenliste.

Deepdive

AI-generated from this story and its cited sources. Not investment advice.

Reader comments

0 comments

    Sign up

    Get your curated digest

    After email confirmation, you will receive a daily digest of the most relevant news that matter to your portfolio