OpenAI s'attaque à l'IA juridique. Harvey doit, elle aussi, continuer d'avancer.

Astra for Law fait monter le niveau de référence. L'étude publiée le même jour par Harvey renvoie à une compétition plus difficile encore : savoir quel système apprendra à accomplir des travaux que les avocats continueront de payer.

Lire l’original

In this storyHarveyOpenAILegora
Richard TangRichard Tang · 4 min read
Share
La façade en verre du 1515 Third Street, l'immeuble abritant le siège d'OpenAI dans le quartier de Mission Bay à San Francisco, vue depuis l'angle de Warriors Way.
Le siège d'OpenAI au 1515 Third Street, à San Francisco, photographié le 15 juin 2025. Photo : Coolcaesar / Wikimedia Commons (https://commons.wikimedia.org/wiki/File:1515_Third_Street.jpg), CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/).

OpenAI a lancé Astra for Law le 17 septembre. L'offre combine GPT-6 Astra avec une recherche juridique et des instructions spécialisées. Harvey et Legora sont cités comme futurs utilisateurs de l'API ; certains cabinets sélectionnés y accèdent dans un premier temps via ChatGPT et Codex. Le fournisseur propose par ailleurs une voie directe vers le client. 1

La menace est sérieuse. Elle ne signifie pas que l'activité de Harvey vient de disparaître.

Cette conclusion suppose que Harvey reste immobile pendant qu'OpenAI progresse. La question utile est de savoir ce que Harvey peut apprendre et construire, à mesure que des capacités qui exigeaient jusqu'ici une ingénierie spécialisée deviennent disponibles chez son fournisseur. Un socle plus performant peut renforcer un produit et rendre, dans le même temps, certains de ses éléments plus difficiles à facturer.

Il existe aujourd'hui une raison concrète de poser cette question. Parallèlement au lancement d'OpenAI, Harvey a publié une étude sur l'utilisation du jugement des avocats pour évaluer et améliorer l'IA juridique. Ces travaux mettent en évidence une contrainte difficile : obtenir une réponse jugée assez bonne pour une tâche donnée. 2

Le niveau de référence a bougé. Les dépenses, elles, restent inconnues.

L'index d'OpenAI couvre plus de 230 millions d'URL. L'annonce le présente comme complémentaire des contenus sous licence proposés par des fournisseurs dont Thomson Reuters. Elle ne fournit ni tarif, ni nombre de licences payantes, ni chiffre d'affaires pour Astra for Law. Elle n'établit pas non plus que l'utilisation de l'index est gratuite. 1

Ces omissions comptent. Un vaste corpus renseigne sur la matière qu'un système peut interroger. Il ne dit pas ce qu'un cabinet peut résilier, combien il paiera la solution de remplacement, ni si celle-ci accomplit le même travail.

Notre précédent article sur Harvey revenait sur le financement et la valorisation de la société. 3 Dans sa propre annonce du 9 septembre, Harvey a fait état d'une levée de fonds de 550 millions de dollars pour une valorisation de 15,5 milliards de dollars, et indiqué que 80 % des cabinets de l'Am Law 100 utilisaient ses produits. Ce sont des chiffres déclarés par l'entreprise ; l'usage ne dit rien de l'ampleur ni de la rentabilité de ces relations. 4

Ce lancement donne une raison de revenir sur cette activité. Il n'apporte pas de nouveau multiple de chiffre d'affaires, ni de preuve que des clients partent.

Le plus difficile : définir ce que « mieux » veut dire

Harvey décrit une étude portant sur 24 tâches confiées à des agents d'IA juridique, chacune évaluée par trois avocats. Les évaluateurs n'ont été unanimes que dans 25 % des confrontations. Selon l'entreprise, une grande partie des désaccords portait sur la manière de pondérer les mêmes forces et faiblesses. 2

C'est là que le problème devient intéressant. Imaginez deux projets de réponse : l'un est plus lisible, l'autre traite avec plus de soin une exception importante. Lequel le système doit-il apprendre à produire ? Compter les notes positives sans comprendre ce qui les motive pourrait lui enseigner la mauvaise leçon.

Harvey expérimente les modèles de récompense génératifs (generative reward models) : des évaluateurs d'IA qui confrontent les réponses produites à des critères définis par des juristes. L'entreprise rapporte que ces évaluateurs ont parfois accepté des erreurs graves en échange d'autres atouts, ou désigné un vainqueur alors que les avocats jugeaient les deux réponses insuffisantes. Ces conclusions proviennent de la propre étude de Harvey, et non d'une validation indépendante. 2

Un système peut produire davantage de réponses sans produire pour autant un signal fiable sur celles qui méritent d'être reproduites. Ce goulot d'étranglement mérite un examen attentif avant que quiconque ne célèbre un cercle vertueux des données.

Boucle d'apprentissage conceptuelle de l'IA juridique : effectuer la tâche, examiner le résultat, conserver les retours utiles, puis améliorer et tester à nouveau. La conservation des retours utiles est mise en évidence comme goulot d'étranglement.
Là où la boucle d'apprentissage peut se rompre. Illustration conceptuelle de la thèse de cet article, éclairée par l'étude de Harvey [2] ; il ne s'agit pas d'une architecture vérifiée de l'une ou l'autre entreprise. Schéma original de Codex pour The Inference ; réalisé pour cet article.

Le travail autour du modèle compte : ce que l'évaluateur peut inspecter, la façon dont la correction d'un avocat est consignée, ce qui constitue un échec grave, et si la version suivante progresse sur des tâches inédites. Davantage d'usage ne serait un atout que si l'entreprise parvenait à transformer cette expérience en améliorations fiables, dans le respect des autorisations qui régissent ces informations.

Avoir des clients ne prouve pas, à soi seul, que cette boucle existe. Montrer qu'elle améliore les résultats des clients serait bien plus convaincant que de décrire le produit comme spécialisé.

OpenAI aussi peut continuer d'apprendre

Dans son propre test, mené sur 200 questions de validation privées, OpenAI indique qu'Astra for Law a réussi le contrôle global d'exactitude dans 54,0 % des cas, contre 38,7 % pour Astra recourant à la recherche web. OpenAI présente également des applications propres à certains cabinets, développées avec Sullivan & Cromwell, Ropes & Gray et Cooley. 1

Le benchmark reste une comparaison étroite, pas une mesure de dossiers clients menés à terme. Mais les projets montés avec ces cabinets rendent la question concurrentielle plus épineuse. Ce serait une erreur de croire que le fournisseur du socle doit rester éloigné du travail, alors que seuls les spécialistes comprendraient les clients.

Harvey ne peut pas tabler sur le maintien de la division du travail actuelle. Et il ne faut pas davantage supposer que le lancement d'OpenAI est le produit définitif contre lequel Harvey aura à rivaliser. Les deux camps peuvent progresser.

La meilleure stratégie du spécialiste consiste à exploiter le socle plus solide là où il apporte un gain et à concentrer ses efforts sur les travaux difficiles que les clients ne parviennent toujours pas à mener à bien de façon satisfaisante. Les preuves à guetter : moins de corrections lourdes de conséquences, moins d'effort de relecture et un usage répété sur des tâches significatives. Ce sont des tests proposés, et non des résultats que l'une ou l'autre de ces annonces établirait.

La prochaine preuve commerciale devra être tout aussi précise : un renouvellement, une décision d'achat, des tarifs rendus publics, ou un client expliquant quels travaux ont basculé et pourquoi. La poursuite des paiements indiquerait que les clients y trouvent encore de la valeur. Il faudrait alors comprendre ce qu'ils achetaient, plutôt que de décider à leur place qu'une alternative généraliste devrait suffire.

Astra for Law rend l'immobilisme plus dangereux. Il ne rend pas pour autant inutile de bâtir une offre de spécialiste. L'opportunité de Harvey est de transformer un socle plus solide en un meilleur produit opérationnel, plus vite que le fournisseur du socle ne comblera l'écart restant. L'entreprise devra continuer à mériter cet écart. Sa valorisation ne peut pas faire ce travail à sa place.

How this brief was made

01Gathered & sourced373 channels · 1,030 articles▾

Agents swept 373 channels and ingested 1,030 articles, then de-duplicated and ranked them for signal.

02Verified & cross-validated4 claims · 28 data feeds▾
03Reviewed & edited1 human editor▾

One editor read the draft against the evidence, tuned the framing, and signed off before it shipped.

Become a contributor

Reporting on the business of AI and want it read? We take pitches from outside contributors who bring primary sources and a number worth arguing about.

Share

Deepdive

AI-generated from this story and its cited sources. Not investment advice.

Reader comments

0 comments

    Sign up

    Get your curated digest

    After email confirmation, you will receive a daily digest of the most relevant news that matter to your portfolio