Benchmark da Mercor reprovou 12 contadores de verdade — e a solução que a empresa vende é mais humanos
Estudo da intermediária de mão de obra de IA avaliada em US$ 10 bilhões mostra modelos de fronteira gabaritando tarefas contábeis em que contadores licenciados (CPAs) tiveram média de 37%. O mesmo documento mostra que nenhum modelo resolve integralmente quase 60% do benchmark completo — e é essa lacuna que a Mercor vende.
Vincent Jiang · 3 min read
Doze CPAs fizeram a prova e tiveram média de 37%
Doze CPAs licenciados, com média de cinco anos e meio de experiência, trabalharam em quatro cenários de fechamento contábil mensal — versões simplificadas do benchmark APEX-Accounting, da Mercor 12. Atingiram cerca de 37% dos critérios de correção 12. Modelos de fronteira gabaritam hoje as mesmas tarefas que escapavam aos melhores modelos há dezoito meses 12.
O estudo também põe preço na derrota. Os modelos concluíram os conjuntos de tarefas em menos de dez minutos, com um custo por critério de correção inferior em mais de uma ordem de grandeza ao dos humanos 211. O estudo foi divulgado em 1º de outubro de 2026, e o fundador e CEO, Brendan Foody, passou a mesma semana na CBS, antes de uma participação no 60 Minutes de domingo, sustentando que a IA “pode mudar o trabalho humano em vez de simplesmente substituí-lo” 3.
A marca de US$ 20 bilhões repousa sobre os humanos que estão sendo avaliados
Fundada em 2023, a Mercor fornece contratados especializados a laboratórios de IA como OpenAI e Anthropic — cerca de 30 mil deles em outubro de 2025, segundo contagem da própria empresa 5. Rastreadores de captação colocam o financiamento total da companhia perto de US$ 485,6 milhões 7.
A empresa afirma ter ultrapassado US$ 2 bilhões em receita anualizada em junho, quatro meses depois de superar US$ 1 bilhão 4. Em julho, estava em negociações para captar US$ 500 milhões a uma avaliação de US$ 20 bilhões — o dobro dos US$ 10 bilhões da Série C do outono do ano passado. A Forbes estimou os três fundadores em US$ 4,3 bilhões cada, se a rodada fosse fechada 46.
A página que reprova os contadores também vende a supervisão
O achado mais discreto do estudo é o modelo de negócio. No benchmark completo, de 160 tarefas, elaborado por mais de 40 profissionais com média de 11 anos de atuação na área, nenhum modelo resolveu por completo quase 60% das tarefas 1.
O hub de pesquisas da Mercor transforma essa lacuna em estoque. Dados do APEX são oferecidos sob licença de treinamento — mais de 50 mil tarefas em mais de 30 domínios, com amostras no mesmo dia, além de mais de 30 mil especialistas e de avaliação humana "na escala de que os laboratórios de fronteira dependem" 89. As tarefas são redigidas por profissionais de Goldman Sachs, McKinsey e Skadden — o mesmo degrau que está sendo avaliado —, e o conjunto de contabilidade foi elaborado com a Ramp, empresa de gestão de gastos 8.
Ressalvas francas — e um teto que vende
A Mercor se critica com franqueza: as tarefas "testavam o que a IA faz de melhor", o cenário eliminava colegas e o contexto acumulado do trabalho, e os autores das tarefas esperavam dos humanos algo próximo de 30% no nível júnior e 55% no nível pleno 2. A equipe diz que chegou a considerar não publicar o estudo 2. O teto do benchmark completo, ainda assim, segue indicando aos laboratórios o que comprar a seguir.
Melhor modelo supera 61,8% do benchmark contábil completo de 160 tarefas
Data
| Value | |
|---|---|
| Claude Opus 5.5 Max | 61.8% |
| Fable 5.1 Max | 61% |
| GPT-6 Astra Max | 57.9% |
| Fable 5 Max | 56.4% |
| Claude Opus 5 Max | 54.5% |
A defesa da empresa é o próprio catálogo
A Mercor conclui que os contadores não são substituíveis e espera ganhos de produtividade em vez de cortes 1. O banco de reservas paga a conta.
Ex-trabalhadores descrevem condições hostis e pedidos de demissão já na primeira semana, sem bônus nem equity, e uma análise constatou que um em cada cinco anotadores de dados estava em situação de rua, enquanto muitos recebem auxílio do Estado 10. A empresa considera os bônus atrelados ao desempenho uma prática padrão do setor 10. A página inicial da companhia anuncia uma taxa média contratada de US$ 109 por hora 9.
Dois sinais, um marcado para domingo
Vale acompanhar se fechou a rodada de US$ 20 bilhões que a Forbes esperava para julho — e se os laboratórios continuam pagando honorários de especialista por uma lacuna que o próprio estudo diz persistir 46. O ataque à cadeia de suprimentos da LiteLLM, revelado em abril, que teria exposto até quatro terabytes, e as ações judiciais movidas por trabalhadores contratados entram de carona em qualquer captação 456.
De um jeito ou de outro, a reprecificação do trabalho cai primeiro sobre o trabalho contábil júnior e a terceirização de serviços financeiros. Foody sobe a um palco maior no domingo 3. As máquinas cravaram a prova, e o dono da prova continua vendendo os corretores.
Deepdive
AI-generated from this story and its cited sources. Not investment advice.



