OpenAI进军法律AI,Harvey必须继续奔跑

Astra for Law抬高了基准线。Harvey同日发布的研究指向一场更难的较量:谁的系统能学会完成律师愿意持续付费的工作。

阅读原文

In this storyHarveyOpenAILegora
Richard TangRichard Tang · 4 min read
Share
从Warriors Way街角望见的OpenAI总部大楼玻璃幕墙立面,该楼位于旧金山米慎湾(Mission Bay)社区的第三街1515号。
OpenAI位于旧金山第三街1515号的总部大楼,摄于2025年6月15日。图片来源:Coolcaesar / Wikimedia Commons(https://commons.wikimedia.org/wiki/File:1515_Third_Street.jpg),CC BY 4.0(https://creativecommons.org/licenses/by/4.0/)。

9月17日,OpenAI发布Astra for Law,把GPT-6 Astra与法律检索、专门指令结合在一起。公告将Harvey和Legora列为未来的API用户;部分入选律所可率先通过ChatGPT和Codex试用。与此同时,这家供应商也在给自己铺设直达客户的通道。1

威胁不容小觑。但这并不意味着Harvey的生意就此消失。

这个结论的前提,是Harvey原地不动、OpenAI单向前进。更有价值的问题在于:当过去必须依靠专门工程才能实现的能力,如今可以直接从供应商处获得时,Harvey能学到什么、又能在此基础上构建什么。更强的基础模型既能让产品变得更强,也可能同时让产品的某些部分更难收费。

眼下就有一个提出这个问题的具体理由。在OpenAI发布新品的同一天,Harvey发布了一项研究,探讨如何用律师的判断来评估和改进法律AI。这项研究暴露出一个棘手的约束:如何得到一个被评定为“足够好”、能胜任特定任务的答案。2

基准线已经抬高。支出仍是未知数。

OpenAI的索引覆盖超过2.3亿个网址。公告称,该索引与汤森路透等供应商提供的授权内容互为补充。公告没有公布Astra for Law的定价、付费席位数或收入数据,也没有说明使用该索引是否免费。1

这些信息的缺失并非小事。庞大的语料库只告诉我们系统能检索到什么材料,却回答不了这些问题:律所能取消哪些既有订阅?愿意为替代品支付多少钱?替代品又能否完成同样的工作?

我们此前关于Harvey的报道梳理过这家公司的融资与估值。3 Harvey在9月9日的公告中称,公司以155亿美元估值融资5.5亿美元,并表示Am Law 100榜单上80%的律所在使用其产品。这些均为公司自行披露的数字;使用率并不能说明这些合作关系的规模与盈利能力。4

这次发布给了我们重新审视这门生意的理由,但既没有带来新的收入倍数,也没有客户正在流失的证据。

真正的难点:判断何为“更好”

Harvey介绍了一项覆盖24项法律智能体任务的研究,每项任务由3名律师评分。评审意见完全一致的对比仅占25%。公司称,相当一部分分歧出在如何权衡同样的优缺点上。2

问题在这里开始变得有意思。设想两份草稿答案:一份更容易读,另一份对某个重要例外情形的处理更周全。系统应该学着生成哪一份?只统计正面评分、不理解其中的原因,可能会把系统教偏。

Harvey正在试验生成式奖励模型(generative reward model):由AI担任评估器,依据法律专家参与制定的标准来比较不同输出。据公司报告,这些评估器有时会为了其他方面的长处而放过严重错误,或者在律师认为两个答案都不合格时,仍然选出一个优胜者。这些发现出自Harvey自身的研究,并非独立验证。2

系统可以产出更多答案,却未必能给出可靠信号,说明哪些答案值得重复使用。在有人为“数据飞轮”欢呼之前,这个瓶颈值得先细细审视。

法律AI学习闭环的概念示意图:执行任务、审查结果、保留有用反馈,再改进并重新测试。“保留有用反馈”被突出标注为瓶颈。
学习闭环可能断在哪里。本文论点的概念示意图,参考了Harvey的研究[2];并非两家公司经证实的系统架构。原图由Codex为The Inference绘制,专为本文创作。

模型之外的工作同样重要:评估器能查看哪些内容、律师的修改如何被记录、什么算严重失误、下一版本在陌生任务上是否有所改进。只有当公司能在相关信息的使用权限之内,把相关经验转化为可靠的改进,更多使用量才会成为优势。

拥有客户本身并不能证明这一闭环存在。若能证明闭环切实改善了客户成效,将远比把产品描述成“专业化”更有说服力。

OpenAI同样可以继续学习

在OpenAI自己开展的测试中,面对200道内部验证题,Astra for Law在54.0%的题目上通过整体正确性检验,使用网络搜索的Astra这一比例为38.7%。OpenAI还介绍了与苏利文·克伦威尔(Sullivan & Cromwell)、罗普斯·格雷(Ropes & Gray)和库利(Cooley)合作构建的律所定制应用。1

这项基准测试只是范围有限的对比,不能衡量实际完成的客户业务。但律所项目让竞争问题变得更难回答。若认定基础模型供应商必然与具体业务保持距离、只有专业厂商才懂客户,那就错了。

Harvey无法指望今天的分工格局一成不变。我们同样不应假设,OpenAI此次发布的产品就是Harvey日后对垒的最终形态。双方都还能继续改进。

对专业厂商来说,上策是在用得上的地方借助更强的基础模型,把精力集中到客户至今仍难以妥善完成的困难工作上。值得关注的证据包括:影响重大的修正减少、审查工作量下降,以及在重要任务上的反复使用。这些只是建议采用的检验标准,并非任何一方的公告已经确立的结果。

下一批商业证据同样应当具体:一次续约、一项采购决策、公开的定价,或由客户说明哪些工作发生了转移、为什么转移。若客户继续付费,说明产品在他们眼中仍有价值。届时我们还需弄清他们购买的究竟是什么,而不是替他们断定通用型替代品理应够用。

Astra for Law让原地踏步变得更加危险,但并不意味着专业化因此失去意义。Harvey的机会在于,抢在基础模型供应商弥合剩余差距之前,把更强的基础模型转化为更好用的产品。这家公司必须持续挣得这份差距——估值无法代劳。

How this brief was made

01Gathered & sourced373 channels · 1,030 articles▾

Agents swept 373 channels and ingested 1,030 articles, then de-duplicated and ranked them for signal.

02Verified & cross-validated4 claims · 28 data feeds▾
03Reviewed & edited1 human editor▾

One editor read the draft against the evidence, tuned the framing, and signed off before it shipped.

Become a contributor

Reporting on the business of AI and want it read? We take pitches from outside contributors who bring primary sources and a number worth arguing about.

Share

Deepdive

AI-generated from this story and its cited sources. Not investment advice.

Reader comments

0 comments

    Sign up

    Get your curated digest

    After email confirmation, you will receive a daily digest of the most relevant news that matter to your portfolio