Les décisions les plus bêtes de l'IA ne coûtent plus rien

Le Jev de TypeSafe, sorti le 15 septembre, répond à des questions typées par des probabilités calibrées pour une fraction de centime, au lieu d'écrire du texte. Dans une boucle d'agents, ces petits contrôles permanents deviennent quasi gratuits et le travail routinier qui ne méritait pas d'être automatisé commence à payer. Les plateformes qui l'intègrent gardent la marge ; les fournisseurs qui vendent des règles deviennent une commodité.

Lire l’original

Richard TangRichard Tang · 5 min read
Share
Les trois cofondateurs de TypeSafe AI, bras croisés, sur fond neutre ; le directeur général Diogo Almeida à droite, en tee-shirt TypeSafe
Les fondateurs de TypeSafe AI, avec le directeur général Diogo Almeida à droite. Il a co-inventé le RLHF, la méthode d'entraînement qui a appris à ChatGPT à parler ; son nouveau modèle, Jev, ne parle pas du tout.

Le 15 septembre, l'une des personnes qui ont construit ChatGPT a lancé un modèle frontière incapable d'écrire. Diogo Almeida a participé à la construction du chatbot et de la méthode d'entraînement RLHF qui le sous-tend, puis a passé deux ans en mode furtif chez TypeSafe AI à bâtir l'inversion de sa propre invention 1. Son verdict sur le secteur qu'il a contribué à créer est sans détour : « Nous avons la foudre en bouteille, et pourtant ce n'est pas utile », parce que les modèles optimisent pour le langage humain, alors que « les ordinateurs parlent un autre langage » 1. Jev, son nouveau modèle, ne parle pas du tout.

Le modèle répond au lieu d'écrire

Jev reçoit un bloc d'état de programme et un ensemble de questions typées, et renvoie des réponses assorties de probabilités calibrées : un choix parmi jusqu'à 255 options, une note sur une échelle ou une probabilité oui-non 2. Chaque question est évaluée en un seul passage parallèle, sans décodage jeton par jeton, sans rien à analyser, et sans possibilité d'inventer un cinquième outil dans un menu qui n'en compte que quatre 23. TypeSafe annonce des décisions en 70 à 500 millisecondes, une entrée à 0,042 dollar par million de jetons et une sortie gratuite 2. L'entreprise baptise cette classe « modèles System One », d'après la pensée rapide de Kahneman, et les entraîne par apprentissage par renforcement pour obtenir des décisions calibrées, de sorte que la confiance affichée suive l'exactitude et qu'un code puisse agir au-dessus d'un seuil et faire remonter l'information en dessous 2.

Les boucles d'agents payaient des prix de chatbot pour des décisions de feu tricolore

La vie d'un agent n'est surtout pas faite de raisonnement. Elle est faite de choix : quel outil appeler ensuite, ce clic a-t-il abouti, cette commande est-elle assez sûre pour être exécutée. LangChain énonce clairement le problème de coût de la boucle : chaque décision est un appel de modèle supplémentaire 4. Deux jours après le lancement, LangChain a livré la réparation sous forme de middleware : un routeur qui oriente chaque requête vers un modèle bon marché ou puissant, et un garde-fou qui vérifie chaque appel d'outil avant son exécution 4. Vercel avait déjà basculé le classifieur Luna d'OpenAI, qui examine la sûreté des commandes, sur Jev, et fait état de réponses cinq à dix-huit fois plus rapides, avec une exactitude supérieure 1. Chez Browserbase, les agents de navigation font désormais leurs choix coup par coup sur ce modèle pour des fractions de centime 4.

Le goulot d'étranglement était la vérification, pas l'intelligence

Le chiffre révélateur n'est pas un benchmark. Un développeur a soumis à Jev 9 081 paires de mise en correspondance de produits que son propre moteur avait laissées de côté pour une révision humaine, et a vidé la file d'attente en 13 minutes pour 32 cents ; il avait remisé cette étape en juin parce que les tarifs des modèles frontières rendaient le projet sans intérêt 5.

L'automatisation ne s'est pas arrêtée parce que les modèles étaient incapables d'exécuter des tâches routinières. Elle s'est arrêtée parce que vérifier honnêtement chaque petit pas coûtait plus cher que la valeur du pas, si bien que seules les étapes coûteuses ont été automatisées.

L'évaluation maison de TypeSafe sur quatre flux de travail chiffre la substitution : Jev égale l'exactitude de GPT-5.6 Terra, 67,8 contre 67,9 % de concordance avec les réponses de référence, à 0,0004 dollar par cas 3. Les multiples mis en avant, jusqu'à 193 fois plus rapide et 445 fois moins cher 26, proviennent du fournisseur et sont comparés à des références moyennées issues d'autres modèles frontières ; TypeSafe souligne elle-même que les pointes se situent dans le haut des gains réels 2.

Une décision qui coûte une fraction de centime sur Jev coûte jusqu'à 0,18 dollar sur un LLM frontière

$0$0.05$0.1$0.15$0.2Jev (TypeSafe)$0Une exactitude du niveau de Terra à ce prixGPT-5.6 Terra$0.03GPT-5.6 Sol$0.08Claude Opus 5$0.18
Data
Value
Jev (TypeSafe)$0
GPT-5.6 Terra$0.03
GPT-5.6 Sol$0.08
Claude Opus 5$0.18
Coût par cas en dollars américains dans l'évaluation TypeSafe sur quatre flux de travail (réponse de sécurité, revue d'agents, facturation, service client), chiffres communiqués par l'éditeur ; réponses de référence moyennées à partir de GPT-6 Astra et Claude Fable 5.1. Sources : billet de lancement de TypeSafe ; DataCamp.2,3

L'actif exposé d'UiPath, ce sont ses règles

UiPath a bâti une activité de 1,94 milliard de dollars de revenus récurrents sur l'automatisation déterministe et fondée sur des règles, en croissance de 12,5 % 7. Son directeur des opérations affirme que les clients veulent désormais « à la fois des capacités d'IA déterministes et probabilistes », insiste sur le fait que la plateforme reste agnostique en matière de modèles, et reconnaît que les progrès des modèles de langage pourraient banaliser les automatisations simples 7. Une décision calibrée à des fractions de centime est exactement cette banalisation, appliquée au point de décision de chaque flux de travail orchestré par UiPath. L'entreprise peut l'absorber grâce à l'Agent Builder, agnostique aux modèles, qu'elle vend déjà, ou regarder son fossé concurrentiel devenir une commodité. Les deux voies restent ouvertes. L'exposition n'est pas symétrique.

Dix trimestres de chiffre d'affaires d'UiPath : hausse régulière, croissance de 10 à 15 %, aucune inflexion liée aux agents

$300M$350M$400M$450M$500MT2 24T4 24T2 25T4 25T2 26$410.26MDernier trimestre : +13,4 % sur unan
Data
Chiffre d'affaires
T1 24$335.11M
T2 24$316.25M
T3 24$354.65M
T4 24$423.65M
T1 25$356.62M
T2 25$361.73M
T3 25$411.11M
T4 25$481.11M
T1 26$418.38M
T2 26$410.26M
Chiffre d'affaires trimestriel d'UiPath, en millions de dollars américains, d'après ses dépôts auprès de la SEC via Sharadar. La croissance sur un an s'est inscrite entre 4,5 et 17,3 % sur dix trimestres ; le trimestre clos en juillet 2026 a progressé de 13,4 %, en cohérence avec le revenu récurrent annuel de 1,94 milliard de dollars et la croissance de 12,5 % cités dans le texte.10

Les plateformes qui facturent au résultat empochent la marge

Salesforce a fait état d'un revenu récurrent d'Agentforce supérieur à 1,5 milliard de dollars, en hausse de plus de 240 %, tout en facturant ses clients à la conversation, à la résolution et aux crédits, et en payant en dessous la facture des jetons : plus de 19 000 milliards de jetons consommés, et un dirigeant relève qu'un seul ingénieur « peut générer une facture de l'ordre de 100 000 dollars par mois » 8. Chaque appel de routage, de garde-fou et de vérification déplacé vers une couche quasi gratuite est de la marge sur un produit déjà vendu, et la même arithmétique attend ServiceNow et la pile Copilot de Microsoft, la même question que ce site posait lorsque Salesforce a ouvert son propre marché d'agents à Anthropic : qui conserve le budget logiciel une fois que la couche d'agents sous-jacente devient bon marché. C'est pourquoi la périphérie du réseau a basculé en quelques jours : Cloudflare mentionne typesafe/jev dans sa documentation IA, et Vercel l'a intégré à son AI Gateway le 16 septembre 5.

Moins de bande passante par décision, et plus de décisions

Soyons honnêtes sur la question des centres de données. Comme chaque réponse arrive en un seul passage, il n'y a pas de boucle de décodage qui fait circuler de la mémoire pour chaque jeton produit ; par décision, le modèle paraît donc plus léger en bande passante mémoire que le modèle de chat qu'il remplace sur cette tâche 3. Ce n'est de toute façon pas le bon registre. L'intérêt d'une couche bon marché est de rendre rentable davantage d'activité d'agents, et chacun de ces agents appelle toujours un modèle frontière pour sa fraction difficile. TypeSafe n'a pas donné au modèle le nom de William Stanley Jevons par hasard : un charbon moins cher a entraîné plus de charbon brûlé 25. La demande totale sur le niveau de raisonnement, et sur les fournisseurs de mémoire qui le soutiennent, pourrait augmenter même si le coût unitaire baisse. C'est là l'argument ; six jours de données ne suffisent pas à trancher.

Portrait photographique de William Stanley Jevons, assis, issu des collections des bibliothèques de l'université de Manchester
William Stanley Jevons, l'économiste dont TypeSafe a emprunté le paradoxe du charbon pour nommer son modèle : un charbon moins cher a entraîné plus de charbon brûlé. · Unknown photographer, University of Manchester Libraries, History & Heritage collection, Image ID JRL15040114

Société privée, six jours d'existence, et l'architecture à apprendre dès maintenant

Ce qui n'est pas tranché : les évaluations sont menées par l'éditeur, les étiquettes de référence sont les réponses d'autres modèles et non une vérité de terrain, la sortie est une probabilité sans justification, Jev peut encore se tromper dans ses classifications, et TypeSafe admet ne pas pouvoir prouver que ses tarifs ne sont pas subventionnés 2356. TypeSafe est elle-même une société privée, financée en amorçage à hauteur de 40 millions de dollars, emmenée par DCVC et valorisée autour de 200 millions de dollars selon un rapport 9 ; aucun ticker ne porte donc ce mouvement, et toute liste qui prétend en désigner un relève de la spéculation.

Surveillez le milieu de la pile

La valeur va à celui qui réduit la distance entre une capacité et le quotidien de travail d'une personne, et cette semaine, ce travail consiste à faire chuter le prix des petits contrôles honnêtes. Surveillez le milieu de la pile : les plateformes qui intègrent cette couche dans des produits qu'elles vendent déjà conservent la marge, et les fournisseurs de règles qui la refusent deviennent une commodité. Pour tous ceux qui construisent, cette cascade — des décisions bon marché sous un raisonnement coûteux — est l'architecture à apprendre dès maintenant, avec toutes les réserves liées à six jours d'existence. Ceux qui l'apprennent sont ceux dont le travail changera ensuite.

How this brief was made

01Gathered & sourced378 channels · 1,398 articles

Agents swept 378 channels and ingested 1,398 articles, then de-duplicated and ranked them for signal.

02Verified & cross-validated10 claims · 15 data feeds
03Reviewed & edited2 human editors

2 editors read the draft against the evidence, tuned the framing, and signed off before it shipped.

Become a contributor

Reporting on the business of AI and want it read? We take pitches from outside contributors who bring primary sources and a number worth arguing about.

Share

Deepdive

AI-generated from this story and its cited sources. Not investment advice.

Reader comments

0 comments

    Sign up

    Get your curated digest

    After email confirmation, you will receive a daily digest of the most relevant news that matter to your portfolio