Mercor基准测试考倒12名持证注册会计师,它兜售的解药却是更多人力
这家估值100亿美元的AI人力中介发布研究:前沿模型在持证注册会计师平均得分仅37%的会计任务上轻松取胜。同一份报告也显示,完整版基准测试中近60%的任务没有任何模型能完全解决——而这一缺口,正是Mercor的生意。
Vincent Jiang · 3 min read
12名注册会计师应试,平均得分37%
12名持证注册会计师——平均执业五年半——完成了4个月末结账情景,题目由Mercor的APEX会计基准测试(APEX-Accounting)简化而来12。他们满足了约37%的评分标准12。如今前沿模型已能轻松拿下同样的任务,而18个月前最强的模型还做不出来12。
这份报告还给这场败局标出了价码。模型不到10分钟就完成整套测试,每满足一项评分标准的成本比人类低一个数量级以上211。研究于2026年10月1日发布;同一周,创始人兼CEO Brendan Foody 现身哥伦比亚广播公司(CBS),为周日亮相《60分钟》节目预热,其间他主张,AI“可能改变人类工作,而非简单地取代它”3。
200亿美元估值,押在接受评分的人身上
Mercor成立于2023年,向AI实验室输送专家合同工,客户包括OpenAI与Anthropic——按公司自己的统计,截至2025年10月约有3万人5。融资追踪机构的数据显示,Mercor累计融资额接近4.856亿美元7。
公司称,年化收入6月已突破20亿美元,距突破10亿美元仅过去4个月4。7月,公司正洽谈以200亿美元估值融资5亿美元,是去年秋季100亿美元C轮估值的两倍;《福布斯》估算,若交易落地,三位创始人每人身家将达43亿美元46。
判会计师不及格的页面,同时售卖监督服务
这份报告更不动声色的发现,是商业模式。在由40多位平均从业11年的专业人士打造的完整版160项基准测试中,近60%的任务没有任何模型能完全解决1。
Mercor的研究中心把这一缺口变成了待售存货。APEX数据以训练授权形式对外提供,覆盖30多个领域的逾5万项任务,当天即可拿到样本,此外还有3万多名专家,以及“达到前沿实验室所依赖的规模”的人工评估89。这些任务由来自高盛、麦肯锡和世达律师事务所(Skadden)的专业人士撰写——出题者与被评测者同属一个梯队;会计任务集则与支出管理公司Ramp联合打造8。
坦承局限,但天花板正是卖点
Mercor对自身的批评直言不讳:这些任务“测试的是AI最擅长的方面”,测试场景剔除了同事与日积月累的工作背景,出题者原本预计初级人员的得分在30%上下、中级人员在55%上下2。团队表示,曾考虑过干脆不发布2。但完整基准测试的天花板,依然在告诉各家实验室下一步该买什么。
最佳模型在完整版160项会计基准测试上拿下61.8%
Data
| Value | |
|---|---|
| Claude Opus 5.5 Max | 61.8% |
| Fable 5.1 Max | 61% |
| GPT-6 Astra Max | 57.9% |
| Fable 5 Max | 56.4% |
| Claude Opus 5 Max | 54.5% |
公司拿自家商品目录作辩护
Mercor的结论是,会计师并不可取代,公司预期带来的是生产率提升而非裁员1。而买单的,是坐在板凳上的那批人。
据前员工描述,公司内部环境充满敌意,有人入职第一周便辞职,既拿不到奖金也没有股权;一项分析发现,五分之一的数据标注员无家可归,其中不少人还在领取公共救助10。公司称,与绩效挂钩的奖金属于行业标准10。公司官网首页宣传的平均合同费率为每小时109美元9。
盯住两个信号,其中一个定在周日
一是《福布斯》预计7月敲定的那轮估值200亿美元的融资,最终有没有落地;二是报告自己都承认依然存在的差距,各家实验室是否还愿意继续支付专家费率46。4月披露的LiteLLM供应链攻击事件——据报道泄露数据最多达4TB——连同合同工提起的诉讼,都会跟着公司进入此后的任何一轮融资456。
无论如何,这场价格重估最先冲击的是初级会计工作与金融外包。周日,Foody将登上更大的舞台3。机器考赢了这场考试,而考试的主人仍在兜售阅卷人。
Deepdive
AI-generated from this story and its cited sources. Not investment advice.



