Тест Mercor завалили 12 живых бухгалтеров — исправлять это компания предлагает людьми
Исследование оценённого в $10 млрд брокера на рынке ИИ-труда показывает, что передовые модели легко решают бухгалтерские задачи, по которым у сертифицированных бухгалтеров (CPA) в среднем лишь 37%. Тот же документ показывает: почти 60% задач полного бенчмарка ни одна модель полностью не решает, — и именно этот разрыв Mercor продаёт.
Vincent Jiang · 3 min read
Тест прошли 12 бухгалтеров CPA — средний результат 37%
Двенадцать сертифицированных бухгалтеров CPA со средним стажем пять с половиной лет проработали четыре сценария закрытия месяца, упрощённые по сравнению с бенчмарком APEX-Accounting компании Mercor 12. Они выполнили около 37% критериев оценки 12. Те же задачи передовые модели теперь решают на отлично — полтора года назад лучшие модели с ними не справлялись 12.
В исследовании посчитана и цена поражения. Модели справлялись с наборами задач менее чем за десять минут, а затраты в расчёте на один критерий оценки у них более чем на порядок ниже, чем у людей 211. Исследование вышло 1 октября 2026 года; в ту же неделю основатель и гендиректор Брендан Фуди выступал на CBS — накануне эфира в воскресном выпуске программы 60 Minutes — и утверждал, что ИИ „может изменить человеческий труд, а не просто заменить его“ 3.
Оценка в $20 млрд держится на людях, которых оценивают
Основанная в 2023 году Mercor поставляет ИИ-лабораториям экспертов-подрядчиков, в том числе OpenAI и Anthropic: по данным самой компании, по состоянию на октябрь 2025 года таких подрядчиков около 30 тыс. 5. По подсчётам отраслевых трекеров, суммарный объём привлечённых компанией средств — около $485,6 млн 7.
По словам компании, в июне её выручка в годовом исчислении превысила $2 млрд; отметку в $1 млрд она прошла четырьмя месяцами ранее 4. В июле Mercor вела переговоры о привлечении $500 млн при оценке в $20 млрд — вдвое выше оценки раунда C прошлой осенью ($10 млрд). По подсчётам Forbes, при закрытии сделки состояние каждого из трёх основателей составило бы $4,3 млрд 46.
Страница, завалившая бухгалтеров, заодно продаёт человеческий контроль
Менее заметный вывод исследования — это и есть бизнес-модель. Полный бенчмарк из 160 задач составили более 40 специалистов со средним стажем 11 лет — и почти 60% этих задач ни одна модель не смогла решить полностью 1.
Исследовательское подразделение Mercor превращает этот разрыв в товар. Данные APEX предлагаются по лицензии на обучение моделей — более 50 тыс. задач более чем в 30 областях, образцы высылаются в тот же день; в нагрузку идут свыше 30 тыс. экспертов и человеческая оценка «в масштабе, на который опираются передовые ИИ-лаборатории» 89. Задачи пишут специалисты из Goldman Sachs, McKinsey и Skadden — того же уровня, что и испытуемые, — а бухгалтерский набор составлен вместе с Ramp, платформой управления корпоративными расходами 8.
Честные оговорки — и потолок, который продаётся
Mercor критикует себя без обиняков: задачи «проверяли то, в чём ИИ сильнее всего», сценарии лишали людей коллег и накопленного за годы работы контекста, а авторы задач ожидали от людей около 30% у младших специалистов и 55% — у специалистов среднего звена 2. По словам команды, она рассматривала вариант вовсе не публиковать исследование 2. Впрочем, потолок полного бенчмарка по-прежнему подсказывает лабораториям, что покупать дальше.
Лучшая модель набирает 61,8% на полном бухгалтерском бенчмарке из 160 задач
Data
| Value | |
|---|---|
| Claude Opus 5.5 Max | 61.8% |
| Fable 5.1 Max | 61% |
| GPT-6 Astra Max | 57.9% |
| Fable 5 Max | 56.4% |
| Claude Opus 5 Max | 54.5% |
Защита компании — её собственный каталог
Mercor приходит к выводу, что бухгалтеры незаменимы, и ожидает роста производительности, а не сокращений 1. Но платит за это «скамейка запасных».
Бывшие работники описывают враждебную рабочую среду и увольнения в первую же неделю — без бонусов и опционов, — а анализ показал, что каждый пятый разметчик данных остался без жилья, при этом многие живут на государственные пособия 10. Бонусы, привязанные к результатам, в компании называют отраслевой нормой 10. На главной странице сайта рекламируется средняя договорная ставка $109 в час 9.
Два сигнала, один — с воскресной датой
Стоит проследить, закрылся ли раунд за $20 млрд, который, как ожидал Forbes, должен был закрыться в июле, и продолжат ли ИИ-лаборатории платить по экспертным ставкам за разрыв, который, как констатирует само исследование, сохраняется 46. В любой новый раунд вместе с компанией поедут и атака на цепочку поставок LiteLLM, о которой стало известно в апреле и которая, по сообщениям, скомпрометировала до 4 терабайт данных, — и иски контрактных работников 456.
Так или иначе, пересмотр расценок в первую очередь ударит по работе младших бухгалтеров и финансовому аутсорсингу. В воскресенье г-н Фуди выходит на сцену покрупнее 3. Машины сдали экзамен на отлично — а владелец экзамена по-прежнему продает проверяющих.
Deepdive
AI-generated from this story and its cited sources. Not investment advice.



