Alguém acabou de zerar o custo das decisões mais burras da IA

Lançado em 15 de setembro, o Jev, da TypeSafe, responde perguntas tipadas com probabilidades calibradas por frações de centavo de dólar, em vez de escrever texto. Dentro de um loop de agente que torna as pequenas checagens constantes quase gratuitas, o trabalho rotineiro que nunca valeu a pena automatizar começa a se pagar. As plataformas que o incorporam ficam com a margem; os fornecedores que vendem regras viram commodity.

Ler o original

Richard TangRichard Tang · 5 min read
Share
Os três cofundadores da TypeSafe AI de braços cruzados diante de um fundo neutro; o CEO, Diogo Almeida, à direita, de camiseta da TypeSafe
1 / 6Slide 1 of 6
Os fundadores da TypeSafe AI, com o CEO, Diogo Almeida, à direita. Ele cocriou o RLHF, o método de treinamento que ensinou o ChatGPT a conversar; o novo modelo dele, o Jev, não conversa de jeito nenhum.

Em 15 de setembro, uma das pessoas que construíram o ChatGPT lançou um modelo de fronteira que não sabe escrever. Diogo Almeida ajudou a construir o chatbot e o método de treinamento por trás dele, o RLHF (aprendizado por reforço com feedback humano), e passou dois anos em sigilo na TypeSafe AI construindo a inversão da própria invenção 1. O veredito dele sobre a indústria que ajudou a criar é cru: "Temos um raio engarrafado e, ainda assim, ele não é útil", porque os modelos otimizam para a linguagem humana enquanto "os computadores falam uma linguagem diferente" 1. O Jev, seu novo modelo, não fala de jeito nenhum.

O modelo responde em vez de escrever

O Jev recebe um bloco de estado do programa e um conjunto de perguntas tipadas e devolve respostas com probabilidades calibradas: a escolha entre até 255 opções, uma nota em uma escala ou uma probabilidade de sim ou não 2. Cada pergunta é avaliada em uma única passada paralela, sem decodificação token a token, sem nada a interpretar e sem chance de inventar uma quinta ferramenta em um menu de quatro 23. A TypeSafe informa decisões em 70 a 500 milissegundos, entrada a US$ 0,042 por milhão de tokens e saída gratuita 2. A empresa batiza a classe de modelos de Sistema 1 (System One), em referência ao pensamento rápido de Kahneman, e os treina com aprendizado por reforço para decisões calibradas, de modo que a confiança declarada acompanhe a precisão — e o código possa agir acima de um limiar e escalar o caso abaixo dele 2.

Os loops de agentes pagavam preço de chat por decisões de semáforo

A vida de um agente não é, na maior parte do tempo, raciocínio. É escolher: qual a próxima ferramenta, se aquele clique funcionou, se este comando é seguro rodar. A LangChain expõe com franqueza o problema de custo do loop: cada decisão é mais uma chamada de modelo 4. Em até dois dias após o lançamento, a empresa já entregava o conserto como middleware: um roteador que envia cada requisição a um modelo barato ou a um modelo poderoso, e uma salvaguarda que checa toda chamada de ferramenta antes de executá-la 4. A Vercel já havia migrado para o Jev o classificador Luna, da OpenAI, que revisa comandos por segurança, e relata respostas de 5 a 18 vezes mais rápidas, com precisão maior 1. Na Browserbase, agentes de navegador já tomam nele suas escolhas lance a lance, por frações de centavo 4.

O gargalo era a verificação, não a inteligência

O número revelador não vem de um benchmark. Um desenvolvedor apontou o Jev para 9.081 pares de correspondência de produtos que seu próprio motor havia deixado na fila de revisão humana — e zerou a fila em 13 minutos, ao custo de 32 centavos de dólar. Havia engavetado essa etapa em junho, porque com os preços dos modelos de fronteira não compensava construí-la 5.

A automação não travou porque os modelos não dessem conta do trabalho rotineiro. Travou porque checar com honestidade cada pequeno passo custava mais do que o passo valia — e só os passos caros, por isso, foram automatizados.

A avaliação de quatro fluxos de trabalho conduzida pela própria TypeSafe dá números concretos à troca: o Jev iguala a precisão do GPT-5.6 Terra — 67,8% contra 67,9% de concordância com as respostas de referência — a US$ 0,0004 por caso 3. Os múltiplos que viraram manchete, de até 193 vezes mais rápido e 445 vezes mais barato 26, são informados pelo próprio fornecedor e medidos contra referências obtidas pela média de outros modelos de fronteira; a própria TypeSafe diz que os picos ficam na faixa alta dos ganhos no mundo real 2.

Uma decisão que custa fração de centavo no Jev custa até US$ 0,18 em um LLM de fronteira

$0$0.05$0.1$0.15$0.2Jev (TypeSafe)$0Precisão no nível do Terra a esse preçoGPT-5.6 Terra$0.03GPT-5.6 Sol$0.08Claude Opus 5$0.18
Data
Value
Jev (TypeSafe)$0
GPT-5.6 Terra$0.03
GPT-5.6 Sol$0.08
Claude Opus 5$0.18
Custo por caso, em dólares, na avaliação de quatro fluxos de trabalho da TypeSafe (resposta de segurança, revisão de agentes, faturamento e atendimento ao cliente), dados informados pelo fornecedor; as respostas de referência são a média de GPT-6 Astra e Claude Fable 5.1. Fontes: post de lançamento da TypeSafe; DataCamp.2,3

As regras da UiPath são o ativo exposto

A UiPath construiu um negócio de US$ 1,94 bilhão em receita recorrente sobre automação determinística e baseada em regras, com crescimento de 12,5% 7. O próprio diretor de operações diz que os clientes agora querem "capacidades de IA tanto determinísticas quanto probabilísticas", insiste que a plataforma segue agnóstica quanto a modelos e admite que o avanço dos modelos de linguagem pode transformar em commodity as automações mais simples 7. Uma decisão calibrada a frações de centavo é exatamente essa commoditização, aplicada ao ponto de decisão dentro de cada fluxo de trabalho que a UiPath orquestra. A empresa pode absorvê-la pelo Agent Builder, agnóstico quanto a modelos, que já vende — ou ver seu fosso competitivo virar commodity. Os dois caminhos estão abertos. A exposição não é simétrica.

Dez trimestres de receita da UiPath: subida constante, alta de dez e poucos por cento e nenhuma inflexão dos agentes

$300M$350M$400M$450M$500M2T244T242T254T252T26$410.26MÚltimo trimestre: alta de 13,4% nacomparação anual
Data
Receita
1T24$335.11M
2T24$316.25M
3T24$354.65M
4T24$423.65M
1T25$356.62M
2T25$361.73M
3T25$411.11M
4T25$481.11M
1T26$418.38M
2T26$410.26M
Receita trimestral da UiPath, em milhões de dólares, com base em seus arquivamentos na SEC via Sharadar. O crescimento na comparação anual variou entre 4,5% e 17,3% ao longo de dez trimestres; o trimestre encerrado em julho de 2026 cresceu 13,4%, em linha com o ARR de US$ 1,94 bilhão e alta de 12,5% citados no texto.10

Plataformas que cobram por resultado embolsam a margem

A Salesforce reportou receita recorrente do Agentforce acima de US$ 1,5 bilhão, em alta de mais de 240%, enquanto cobra dos clientes por conversa, resolução e créditos — e paga, por baixo, a conta de tokens: mais de 19 trilhões consumidos. Um executivo observa que um único engenheiro "pode gerar uma conta de uns US$ 100 mil por mês" 8. Toda chamada de roteamento, salvaguarda e verificação migrada para uma camada quase gratuita é margem sobre um produto já vendido. A mesma aritmética aguarda o ServiceNow e a pilha Copilot da Microsoft — e é a mesma pergunta que este site fez quando a Salesforce abriu seu próprio mercado de agentes à Anthropic: quem fica com o orçamento de software quando a camada de agentes por baixo dele fica barata. É por isso que a borda da rede se moveu em questão de dias: a Cloudflare lista typesafe/jev em sua documentação de IA, e a Vercel o incluiu em seu AI Gateway em 16 de setembro 5.

Menos largura de banda por decisão, e mais decisões

Vamos ser honestos quanto à questão dos data centers. Como toda resposta chega em uma única passada, não há loop de decodificação consumindo memória a cada token de saída — por decisão, o modelo parece mais leve em largura de banda de memória do que o modelo de chat que ele substitui nessa tarefa 3. De qualquer forma, essa é a conta errada. A razão de ser de uma camada barata é fazer mais atividade de agentes valer a pena — e cada um desses agentes continua acionando um modelo de fronteira na sua fração difícil. A TypeSafe batizou o modelo de William Stanley Jevons propositadamente: carvão mais barato significava mais carvão queimado 25. A demanda total pela camada de raciocínio — e pelos fornecedores de memória por trás dela — pode subir mesmo com a queda do custo unitário. Esse é o argumento; seis dias de dados não bastam para decidir a questão.

Fotografia em retrato de William Stanley Jevons, sentado, do acervo das Bibliotecas da Universidade de Manchester
William Stanley Jevons, o economista cujo paradoxo do carvão a TypeSafe tomou emprestado para o nome do modelo: carvão mais barato significava mais carvão queimado. · Unknown photographer, University of Manchester Libraries, History & Heritage collection, Image ID JRL15040114

Privada, com seis dias de vida, e a arquitetura para aprender agora

O que segue em aberto: as avaliações são conduzidas pelo próprio fornecedor; os rótulos de referência são respostas de outros modelos, e não o gabarito real (ground truth); a saída é uma probabilidade sem justificativa; o Jev ainda pode cometer erros de classificação; e a TypeSafe admite que não consegue provar que sua precificação não é subsidiada 2356. A própria TypeSafe é privada — captou US$ 40 milhões em rodada-semente liderada pela DCVC, com avaliação de cerca de US$ 200 milhões segundo um relato 9. Por isso, não existe ticker que capture essa mudança — e qualquer lista que aponte um é especulação.

Fique de olho no meio da pilha

O valor vai para quem encurta a distância entre uma capacidade e o dia de trabalho de alguém — e, nesta semana, esse trabalho é derrubar o preço das pequenas verificações honestas. Fique de olho no meio da pilha: as plataformas que incorporam a camada aos produtos que já vendem embolsam a margem, e os fornecedores baseados em regras que a recusam tornam-se a commodity. Para quem está construindo, a cascata — decisões baratas sob raciocínio caro — é a arquitetura para aprender agora, ressalvas de seis dias incluídas. Quem a aprende são os próximos a ter o trabalho mudado.

How this brief was made

01Gathered & sourced378 channels · 1,398 articles▾

Agents swept 378 channels and ingested 1,398 articles, then de-duplicated and ranked them for signal.

02Verified & cross-validated10 claims · 15 data feeds▾
03Reviewed & edited2 human editors▾

2 editors read the draft against the evidence, tuned the framing, and signed off before it shipped.

Become a contributor

Reporting on the business of AI and want it read? We take pitches from outside contributors who bring primary sources and a number worth arguing about.

Share

Deepdive

AI-generated from this story and its cited sources. Not investment advice.

Reader comments

0 comments

    Sign up

    Get your curated digest

    After email confirmation, you will receive a daily digest of the most relevant news that matter to your portfolio