Тест Mercor завалили 12 живых бухгалтеров — исправлять это компания предлагает людьми

Исследование оценённого в $10 млрд брокера на рынке ИИ-труда показывает, что передовые модели легко решают бухгалтерские задачи, по которым у сертифицированных бухгалтеров (CPA) в среднем лишь 37%. Тот же документ показывает: почти 60% задач полного бенчмарка ни одна модель полностью не решает, — и именно этот разрыв Mercor продаёт.

Читать оригинал

Vincent JiangVincent Jiang · 3 min read
Share
Фотография XIX века: четыре бухгалтера за столом со счётами, гроссбухами и часами
1 / 6Slide 1 of 6
Бухгалтеры за работой со счётами и гроссбухами. Фотография 1880-х годов, автор — Лай Афонг. В исследовании Mercor двенадцать сертифицированных CPA со средним стажем пять с половиной лет соревновались с передовыми моделями в задачах закрытия месяца.

Тест прошли 12 бухгалтеров CPA — средний результат 37%

Двенадцать сертифицированных бухгалтеров CPA со средним стажем пять с половиной лет проработали четыре сценария закрытия месяца, упрощённые по сравнению с бенчмарком APEX-Accounting компании Mercor 12. Они выполнили около 37% критериев оценки 12. Те же задачи передовые модели теперь решают на отлично — полтора года назад лучшие модели с ними не справлялись 12.

В исследовании посчитана и цена поражения. Модели справлялись с наборами задач менее чем за десять минут, а затраты в расчёте на один критерий оценки у них более чем на порядок ниже, чем у людей 211. Исследование вышло 1 октября 2026 года; в ту же неделю основатель и гендиректор Брендан Фуди выступал на CBS — накануне эфира в воскресном выпуске программы 60 Minutes — и утверждал, что ИИ „может изменить человеческий труд, а не просто заменить его“ 3.

Оценка в $20 млрд держится на людях, которых оценивают

Основанная в 2023 году Mercor поставляет ИИ-лабораториям экспертов-подрядчиков, в том числе OpenAI и Anthropic: по данным самой компании, по состоянию на октябрь 2025 года таких подрядчиков около 30 тыс. 5. По подсчётам отраслевых трекеров, суммарный объём привлечённых компанией средств — около $485,6 млн 7.

По словам компании, в июне её выручка в годовом исчислении превысила $2 млрд; отметку в $1 млрд она прошла четырьмя месяцами ранее 4. В июле Mercor вела переговоры о привлечении $500 млн при оценке в $20 млрд — вдвое выше оценки раунда C прошлой осенью ($10 млрд). По подсчётам Forbes, при закрытии сделки состояние каждого из трёх основателей составило бы $4,3 млрд 46.

Страница, завалившая бухгалтеров, заодно продаёт человеческий контроль

Менее заметный вывод исследования — это и есть бизнес-модель. Полный бенчмарк из 160 задач составили более 40 специалистов со средним стажем 11 лет — и почти 60% этих задач ни одна модель не смогла решить полностью 1.

Исследовательское подразделение Mercor превращает этот разрыв в товар. Данные APEX предлагаются по лицензии на обучение моделей — более 50 тыс. задач более чем в 30 областях, образцы высылаются в тот же день; в нагрузку идут свыше 30 тыс. экспертов и человеческая оценка «в масштабе, на который опираются передовые ИИ-лаборатории» 89. Задачи пишут специалисты из Goldman Sachs, McKinsey и Skadden — того же уровня, что и испытуемые, — а бухгалтерский набор составлен вместе с Ramp, платформой управления корпоративными расходами 8.

Честные оговорки — и потолок, который продаётся

Mercor критикует себя без обиняков: задачи «проверяли то, в чём ИИ сильнее всего», сценарии лишали людей коллег и накопленного за годы работы контекста, а авторы задач ожидали от людей около 30% у младших специалистов и 55% — у специалистов среднего звена 2. По словам команды, она рассматривала вариант вовсе не публиковать исследование 2. Впрочем, потолок полного бенчмарка по-прежнему подсказывает лабораториям, что покупать дальше.

Лучшая модель набирает 61,8% на полном бухгалтерском бенчмарке из 160 задач

0%20%40%60%80%Claude Opus 5.5 Max61.8%Идеально прошёл упрощённый набор из четырёх задачисследованияFable 5.1 Max61%GPT-6 Astra Max57.9%Fable 5 Max56.4%Claude Opus 5 Max54.5%
Data
Value
Claude Opus 5.5 Max61.8%
Fable 5.1 Max61%
GPT-6 Astra Max57.9%
Fable 5 Max56.4%
Claude Opus 5 Max54.5%
Доля выполненных критериев оценки на бенчмарке APEX-Accounting от Mercor (160 задач) по состоянию на 3 октября 2026 года; интервалы, сообщённые самими моделями, — от ±3,6 до 4,0 п. п. Средний результат 12 CPA — 37% — получен на упрощённых задачах и несопоставим. Источники: лидерборд Mercor APEX; The Decoder.1,8

Защита компании — её собственный каталог

Mercor приходит к выводу, что бухгалтеры незаменимы, и ожидает роста производительности, а не сокращений 1. Но платит за это «скамейка запасных».

Бывшие работники описывают враждебную рабочую среду и увольнения в первую же неделю — без бонусов и опционов, — а анализ показал, что каждый пятый разметчик данных остался без жилья, при этом многие живут на государственные пособия 10. Бонусы, привязанные к результатам, в компании называют отраслевой нормой 10. На главной странице сайта рекламируется средняя договорная ставка $109 в час 9.

Два сигнала, один — с воскресной датой

Стоит проследить, закрылся ли раунд за $20 млрд, который, как ожидал Forbes, должен был закрыться в июле, и продолжат ли ИИ-лаборатории платить по экспертным ставкам за разрыв, который, как констатирует само исследование, сохраняется 46. В любой новый раунд вместе с компанией поедут и атака на цепочку поставок LiteLLM, о которой стало известно в апреле и которая, по сообщениям, скомпрометировала до 4 терабайт данных, — и иски контрактных работников 456.

Так или иначе, пересмотр расценок в первую очередь ударит по работе младших бухгалтеров и финансовому аутсорсингу. В воскресенье г-н Фуди выходит на сцену покрупнее 3. Машины сдали экзамен на отлично — а владелец экзамена по-прежнему продает проверяющих.

Deepdive

AI-generated from this story and its cited sources. Not investment advice.

Reader comments

0 comments

    Sign up

    Get your curated digest

    After email confirmation, you will receive a daily digest of the most relevant news that matter to your portfolio