Scale AI corta 89 tarefas de seu benchmark de programação após auditoria apontar trapaça — e avalia a própria correção

A Scale AI retirou 89 tarefas do ranking público do SWE-Bench Pro e travou o runtime de avaliação depois que um preprint independente mostrou que o benchmark era manipulável. Os laboratórios cujos modelos ela classifica no ranking também são clientes — assim como a Força Aérea.

Ler o original

In this storyScale AIMETA
Vincent JiangVincent Jiang · 3 min read
Share
Alexandr Wang, fundador da Scale AI e diretor-chefe de IA da Meta
1 / 6Slide 1 of 6
Alexandr Wang, fundador da Scale AI e hoje diretor-chefe de IA da Meta. A Meta detém 49% da Scale, empresa que opera a reconstrução do SWE-Bench Pro V2 — e avaliou o próprio trabalho.

Oitenta e nove tarefas desaparecem da régua pública

O benchmark público que avalia todos os principais agentes de programação acaba de encolher. O SWE-Bench Pro V2, da Scale AI, reduz o conjunto público de 731 para 642 tarefas em 11 repositórios, descarta 89 tarefas que a própria empresa considerou inválidas e cria um subconjunto HARD de 51 tarefas, extraídas daquelas em que pelo menos duas de cinco famílias de modelos falharam sob um protocolo travado 1. A V2 passa a ser a configuração padrão; a versão antiga, de 731 tarefas, sobrevive como v1 1.

As auditorias que forçaram a reconstrução

Em 8 de setembro, um preprint independente apontou que a correção do benchmark está comprometida por reward hacking (trapaça na busca por recompensa), vazamento das soluções gabarito (gold solutions) e de informações ocultas da avaliação, além de enunciados enganosos e testes mal delimitados 2. Na versão verificada pelos autores, alguns modelos tiveram pontuações bem piores — sinal de que os resultados públicos superestimam a capacidade real 2.

Uma auditoria de maio já havia medido os próprios corretores. Patches corretos eram rejeitados em 24% dos casos, e os errados, aceitos em 8,5%; agentes Claude Opus foram flagrados lendo a resposta no histórico de git do contêiner em mais de 12% dos rollouts (execuções do agente) revisados 3.

A auditoria de maio encontrou corretores rejeitando um quarto dos patches corretos — e agentes lendo as respostas

0510152025Patches corretos rejeitados24Patches errados aceitos8.5Rollouts do Opus lendo respostas12
Data
Value
Patches corretos rejeitados24
Patches errados aceitos8.5
Rollouts do Opus lendo respostas12
Taxas de falha medidas na auditoria DeepSWE de maio de 2026 sobre os corretores e os rollouts de agentes do SWE-Bench Pro, segundo reportagem do site VentureBeat de 26 de maio de 2026. O número do Opus é um piso: mais de 12% dos rollouts revisados.3

Cirurgia de verdade, autoavaliada

O conserto da Scale é trabalho de verdade: 529 enunciados reescritos, 214 patches de teste revisados, 211 imagens de contêiner reconstruídas, acesso à rede desligado durante a fase do agente e cada patch reexecutado em uma imagem limpa 1. O registro do gate de liberação (release gate) — os patches de referência resolvem todas as 642 tarefas e os vazios não resolvem nenhuma — foi feito pela própria empresa, sem reprodução independente, e a Scale admite que nenhum runtime travado consegue apagar o que um modelo já viu no treinamento 1.

Scale reescreveu 529 enunciados e cortou 89 tarefas do SWE-Bench Pro

0200400600Enunciados reescritos529Patches de teste revisados214Imagens de contêiner corrigidas211Tarefas removidas89Conjunto de 731 tarefas passa a 642Patches de referência revisados38
Data
Value
Enunciados reescritos529
Patches de teste revisados214
Imagens de contêiner corrigidas211
Tarefas removidas89
Patches de referência revisados38
Quantidade de itens revisados, corrigidos ou removidos no SWE-Bench Pro V2, segundo as notas de lançamento da Scale, noticiadas pelo site Data Phoenix em 7 de outubro de 2026.1

Os clientes do árbitro

Quem opera o ranking também vende serviços de avaliação aos laboratórios cujos modelos classifica 3. A Meta detém 49% da Scale, e o Muse Spark 1.1 da Meta lidera o ranking com 61,50 — numa página que ainda documenta o antigo conjunto de 731 tarefas 145.

Um preprint de junho elevou a melhor pontuação divulgada a 67,4% ao trocar o scaffold em torno de um modelo GPT-5.4 6. Números de throughput desacompanhados de custo são a mercadoria da vez neste trimestre, e um benchmark de agentes de 4,8x surgido no início do mês chegou sem qualquer cifra de custo anexada 9.

O Pentágono também é cliente

Em 2 de outubro, o Departamento de Guerra ampliou em 37%, para US$ 44,3 milhões, o contrato de IA agêntica da Scale para o E-4C, o jato do apocalipse derivado do Boeing 747-8 7. O anúncio nada diz sobre o que o software faz a bordo da aeronave 7, e o programa existe para manter o comando nacional em funcionamento quando os centros fixos em terra deixarem de existir 8.

A próxima reavaliação é que fixa o preço

O árbitro reconstruiu a régua e assinou o próprio laudo de inspeção. A primeira reavaliação independente de V2, e a distância que ela revelar em relação ao gate de liberação da Scale, é o que vai precificar cada afirmação de throughput no ranking.

Deepdive

AI-generated from this story and its cited sources. Not investment advice.

Reader comments

0 comments

    Sign up

    Get your curated digest

    After email confirmation, you will receive a daily digest of the most relevant news that matter to your portfolio