Die dümmsten Entscheidungen der KI kosten jetzt nichts mehr

Das Modell Jev von TypeSafe, am 15. September veröffentlicht, schreibt keinen Text. Es beantwortet typisierte Fragen mit kalibrierten Wahrscheinlichkeiten – für einen Bruchteil eines Cents. In Agenten-Schleifen werden die kleinen, ständigen Prüfungen dadurch beinahe gratis, und Routinearbeit, deren Automatisierung sich nie lohnte, beginnt sich zu rechnen. Die Plattformen, die diese Technik integrieren, behalten die Marge; die Anbieter, die Regeln verkaufen, werden zur Ware.

Original lesen

Richard TangRichard Tang · 5 min read
Share
Die drei Mitgründer von TypeSafe AI, die Arme verschränkt, vor schlichtem Hintergrund; rechts CEO Diogo Almeida im TypeSafe-T-Shirt
1 / 6Slide 1 of 6
Die Gründer von TypeSafe AI, rechts CEO Diogo Almeida. Er hat RLHF mitentwickelt – die Trainingsmethode, die ChatGPT das Sprechen beigebracht hat; sein neues Modell Jev spricht überhaupt nicht.

Am 15. September hat einer der Entwickler von ChatGPT ein Frontier-Modell vorgelegt, das nicht schreiben kann. Diogo Almeida half, den Chatbot und die Trainingsmethode RLHF dahinter zu bauen, und verbrachte danach zwei Jahre im Stealth-Modus bei TypeSafe AI, wo er die Umkehrung seiner eigenen Erfindung schuf 1. Sein Urteil über die Branche, die er mitschuf, fällt schonungslos aus: „Wir haben den Blitz in der Flasche, und doch ist er nicht nützlich“, denn Modelle optimieren auf menschliche Sprache, während „Computer eine andere Sprache sprechen“ 1. Sein neues Modell Jev redet kein Wort.

Das Modell antwortet statt zu schreiben

Jev nimmt einen Block Programmzustand und einen Satz typisierter Fragen entgegen und liefert Antworten mit kalibrierten Wahrscheinlichkeiten: die Auswahl aus bis zu 255 Optionen, einen Wert auf einer Skala oder eine Ja-oder-Nein-Wahrscheinlichkeit 2. Sämtliche Fragen wertet das Modell in einem einzigen parallelen Durchlauf aus – es gibt keine Token-für-Token-Dekodierung, nichts zu parsen und keine Möglichkeit, in einem Vier-Tool-Menü ein fünftes Tool zu erfinden 23. TypeSafe meldet Entscheidungszeiten von 70 bis 500 Millisekunden; der Input kostet 0,042 Dollar pro Million Tokens, der Output ist gratis 2. Es nennt diese Modellklasse System-One-Modelle – nach Kahnemans schnellem Denken – und trainiert sie mit Reinforcement Learning auf kalibrierte Entscheidungen, sodass die angegebene Konfidenz die Treffgenauigkeit widerspiegelt und Code oberhalb eines Schwellenwerts handeln und unterhalb eskalieren kann 2.

Agenten-Schleifen zahlten Chat-Preise für Ampelentscheidungen

Im Leben eines Agenten geht es meist nicht um Reasoning. Es geht ums Wählen: welches Tool als Nächstes, ob der Klick gesessen hat, ob sich dieser Befehl sicher ausführen lässt. LangChain nennt das Kostenproblem der Schleife klipp und klar: Jede Entscheidung ist ein weiterer Modellaufruf 4. Innerhalb von zwei Tagen nach dem Start lieferte das Unternehmen die Reparatur als Middleware nach: einen Router, der jede Anfrage an ein günstiges oder ein leistungsstarkes Modell weiterleitet, und eine Leitplanke, die jeden Tool-Aufruf prüft, bevor er ausgeführt wird 4. Vercel hatte den Luna-Klassifikator von OpenAI, der Befehle auf Sicherheit prüft, bereits auf Jev umgestellt und berichtet, die Antworten seien fünf- bis 18-mal schneller und zugleich genauer 1. Bei Browserbase treffen Browser-Agenten ihre Entscheidungen inzwischen Zug für Zug mit Jev – für Bruchteile eines Cents 4.

Der Flaschenhals war nicht die Intelligenz, sondern die Verifikation

Die aussagekräftige Zahl ist kein Benchmark. Ein Entwickler ließ Jev auf 9.081 abzugleichende Produktpaare los, die seine eigene Engine zur Prüfung durch Menschen geparkt hatte, und räumte die Warteschlange in 13 Minuten ab – für 32 Cent. Diese Stufe hatte er im Juni auf Eis gelegt, weil sich der Bau zu Frontier-Preisen nicht lohnte 5.

Die Automatisierung ist nicht deshalb ins Stocken geraten, weil Modelle keine Routinearbeit leisten konnten. Sie ist ins Stocken geraten, weil das ehrliche Prüfen jedes kleinen Schritts mehr kostete, als der Schritt wert war – darum wurden nur die teuren Schritte automatisiert.

TypeSafes eigene Vier-Workflow-Evaluation beziffert den Tausch: Jev erreicht die Genauigkeit von GPT-5.6 Terra – 67,8 gegen 67,9 Prozent Übereinstimmung mit den Referenzantworten – bei 0,0004 Dollar pro Fall 3. Die viel zitierten Multiplikatoren, bis zu 193-mal schneller und 445-mal günstiger 26, sind vom Anbieter berichtet, gemessen gegen Referenzen, die über andere Frontier-Modelle gemittelt wurden; TypeSafe selbst sagt, die Spitzenwerte lägen am oberen Ende der Zuwächse, die sich in der Praxis zeigen 2.

Was Jev für einen Bruchteil eines Cents entscheidet, kostet beim Frontier-Modell bis zu 0,18 Dollar

$0$0.05$0.1$0.15$0.2Jev (TypeSafe)$0Genauigkeit auf Terra-Niveau zu diesem PreisGPT-5.6 Terra$0.03GPT-5.6 Sol$0.08Claude Opus 5$0.18
Data
Value
Jev (TypeSafe)$0
GPT-5.6 Terra$0.03
GPT-5.6 Sol$0.08
Claude Opus 5$0.18
Kosten pro Fall in US-Dollar in TypeSafes Vier-Workflow-Evaluation (Security-Response, Agentenprüfung, Rechnungsstellung, Kundenservice), vom Anbieter berichtet; Referenzantworten gemittelt aus GPT-6 Astra und Claude Fable 5.1. Quellen: TypeSafe-Launchbeitrag; DataCamp.2,3

UiPaths Regeln sind der exponierte Posten

UiPath hat auf deterministischer, regelbasierter Automatisierung ein Geschäft mit 1,94 Milliarden Dollar wiederkehrender Umsätze aufgebaut, das um 12,5 Prozent wächst 7. Der eigene COO sagt, Kunden wollten inzwischen „sowohl deterministische als auch probabilistische KI-Fähigkeiten“, beharrt darauf, dass die Plattform modellagnostisch bleibt, und räumt ein, dass fortschreitende Sprachmodelle einfachere Automatisierungen zur Ware machen könnten 7. Eine kalibrierte Entscheidung für Bruchteile eines Cents ist genau diese Kommodifizierung, angewandt auf den Entscheidungspunkt in jedem Workflow, den UiPath orchestriert. Das Unternehmen kann sie über den modellagnostischen Agent Builder, den es bereits verkauft, absorbieren – oder zusehen, wie sein Burggraben zur Ware wird. Beide Wege stehen offen. Die Risikoposition ist nicht symmetrisch.

Zehn Quartale UiPath-Umsatz: stetiger Anstieg, niedriges zweistelliges Wachstum, kein Wendepunkt durch Agenten

$300M$350M$400M$450M$500MQ2/24Q4/24Q2/25Q4/25Q2/26$410.26MLetztes Quartal: plus 13,4 Prozentim Jahresvergleich
Data
Umsatz
Q1/24$335.11M
Q2/24$316.25M
Q3/24$354.65M
Q4/24$423.65M
Q1/25$356.62M
Q2/25$361.73M
Q3/25$411.11M
Q4/25$481.11M
Q1/26$418.38M
Q2/26$410.26M
UiPaths Quartalsumsätze in Millionen US-Dollar, nach SEC-Einreichungen des Unternehmens via Sharadar. Über zehn Quartale lag das Wachstum im Jahresvergleich zwischen 4,5 und 17,3 Prozent; das im Juli 2026 endende Quartal wuchs um 13,4 Prozent – im Einklang mit den im Text genannten 1,94 Milliarden Dollar ARR und 12,5 Prozent Wachstum.10

Plattformen, die nach Ergebnis abrechnen, stecken die Marge ein

Salesforce meldet wiederkehrende Agentforce-Umsätze von mehr als 1,5 Milliarden Dollar, ein Plus von über 240 Prozent, rechnet mit Kunden aber pro Konversation, pro gelöster Anfrage und in Credits ab – und zahlt darunter selbst die Token-Rechnung: Mehr als 19 Billionen Tokens wurden verbraucht, und eine Führungskraft merkt an, ein einzelner Ingenieur „kann da locker eine Rechnung von 100.000 Dollar im Monat verursachen“ 8. Jeder Routing-, Leitplanken- und Verifikationsaufruf, der auf eine nahezu kostenlose Schicht wandert, wird zur Marge an einem Produkt, das längst verkauft ist. Dieselbe Rechnung wartet auf ServiceNow und den Copilot-Stack von Microsoft – dieselbe Frage, die diese Seite stellte, als Salesforce seinen eigenen Agenten-Marktplatz für Anthropic öffnete: Wer behält das Softwarebudget, wenn die Agenten-Schicht darunter billig wird? Deshalb verschob sich die Spitze binnen Tagen: Cloudflare listet typesafe/jev in seiner KI-Dokumentation, und Vercel nahm es am 16. September in sein AI Gateway auf 5.

Weniger Bandbreite pro Entscheidung – und mehr Entscheidungen

Die Frage nach den Rechenzentren verdient eine ehrliche Antwort. Da jede Antwort in einem einzigen Durchlauf entsteht, fehlt die Dekodierungsschleife, die bei jedem Output-Token Speicher bewegt. Pro Entscheidung dürfte das Modell damit weniger Speicherbandbreite beanspruchen als das Chatmodell, das es für diese Aufgabe verdrängt 3. Das ist ohnehin die falsche Rechnung. Der Sinn einer billigen Schicht liegt gerade darin, mehr Agentenaktivität lohnend zu machen – und jeder dieser Agenten ruft für die schweren Anteile seiner Arbeit nach wie vor ein Frontier-Modell auf. TypeSafe hat das Modell nicht von ungefähr nach William Stanley Jevons benannt: Wurde Kohle billiger, wurde mehr Kohle verbrannt 25. Die Gesamtnachfrage auf der Reasoning-Stufe – und bei den Speicherlieferanten dahinter – könnte steigen, selbst wenn die Stückkosten sinken. Das ist die These – entscheiden lässt sie sich mit sechs Tagen Daten nicht.

Porträtfoto von William Stanley Jevons, sitzend, aus der Sammlung der Bibliotheken der Universität Manchester
William Stanley Jevons, der Ökonom, dessen Kohleparadoxon TypeSafe für die Namensgebung seines Modells übernommen hat: Wurde Kohle billiger, wurde mehr Kohle verbrannt. · Unknown photographer, University of Manchester Libraries, History & Heritage collection, Image ID JRL15040114

Nicht börsennotiert, sechs Tage alt – und die Architektur, die es jetzt zu lernen gilt

Offen bleibt einiges: Die Evaluationen führt der Anbieter selbst durch, die Referenzlabels sind Antworten anderer Modelle und keine verifizierte Ground Truth, der Output ist eine Wahrscheinlichkeit ohne Begründung, Jev kann weiterhin falsch klassifizieren – und TypeSafe räumt ein, nicht beweisen zu können, dass seine Preise nicht subventioniert sind 2356. TypeSafe selbst ist nicht börsennotiert, mit einer Seed-Finanzierung von 40 Millionen Dollar unter Führung von DCVC und laut einem Bericht mit rund 200 Millionen Dollar bewertet 9. Ein Tickersymbol, das diesen Wandel abbildet, gibt es also nicht – und jede Liste, die eines behauptet, ist Spekulation.

Die Mitte des Stacks im Blick behalten

Der Wert geht dorthin, wo jemand die Distanz zwischen einer Fähigkeit und dem Arbeitsalltag von Menschen überbrückt – und diese Woche besteht diese Arbeit darin, den Preis ehrlicher kleiner Prüfungen gegen null zu fahren. Deshalb: die Mitte des Stacks im Blick behalten. Plattformen, die die Schicht in Produkte integrieren, die sie ohnehin verkaufen, behalten die Marge; regelbasierte Anbieter, die sie ablehnen, werden zur Ware. Wer heute baut, für den ist die Kaskade – billige Entscheidungen unter teurem Reasoning – die Architektur, die es jetzt zu lernen gilt, mit allen sechs Tage alten Einschränkungen. Die Menschen, die sie lernen, sind die, deren Arbeit sich als Nächstes verändert.

How this brief was made

01Gathered & sourced378 channels · 1,398 articles▾

Agents swept 378 channels and ingested 1,398 articles, then de-duplicated and ranked them for signal.

02Verified & cross-validated10 claims · 15 data feeds▾
03Reviewed & edited2 human editors▾

2 editors read the draft against the evidence, tuned the framing, and signed off before it shipped.

Become a contributor

Reporting on the business of AI and want it read? We take pitches from outside contributors who bring primary sources and a number worth arguing about.

Share

Deepdive

AI-generated from this story and its cited sources. Not investment advice.

Reader comments

0 comments

    Sign up

    Get your curated digest

    After email confirmation, you will receive a daily digest of the most relevant news that matter to your portfolio