AI의 '멍청한 결정'이 공짜가 됐다

TypeSafe AI가 9월 15일 공개한 Jev는 글을 쓰는 대신 타입이 지정된 질문에 보정된 확률로 답한다. 비용은 1센트의 몇 분의 일이다. 에이전트 루프(agent loop) 안에서 작고 끊임없는 점검이 사실상 공짜가 되면, 지금까지 자동화해봤자 남는 게 없던 단순 업무가 돈이 되기 시작한다. 이를 제품에 녹여내는 플랫폼은 마진을 챙기고, 룰을 팔아온 벤더는 커머디티가 된다.

원문 읽기

Richard TangRichard Tang · 5 min read
Share
단색 배경 앞에서 팔짱을 낀 채 서 있는 TypeSafe AI 공동창업자 3명. 오른쪽이 TypeSafe 티셔츠를 입은 디오구 알메이다 최고경영자(CEO).
1 / 6Slide 1 of 6
TypeSafe AI 창업자들. 오른쪽이 디오구 알메이다 최고경영자(CEO)다. 그는 챗GPT에게 말을 가르친 학습법인 RLHF(인간 피드백 기반 강화학습)를 함께 발명했다. 그런데 그가 새로 내놓은 모델 Jev는 아예 말을 하지 않는다.

9월 15일, 챗GPT를 만든 사람 중 한 명이 글을 쓰지 못하는 최첨단 모델을 내놨다. 디오구 알메이다는 챗GPT 개발에 참여했고, 그 뒤를 받친 RLHF 학습법도 함께 만들었다. 이후 TypeSafe AI에서 2년간 스텔스(비공개) 상태로 자신의 발명을 정반대로 뒤집는 모델을 만들었다1. 자신이 만드는 데 일조한 산업에 내린 그의 평가는 단호하다. “우리는 병에 담은 번개를 손에 넣었는데도 여전히 쓸모가 없다.” 모델이 인간 언어에 맞춰 최적화돼 있는데 “컴퓨터는 다른 언어를 쓰기” 때문이라는 것이다1. 그의 새 모델 Jev는 아예 말을 하지 않는다.

글 대신 답을 내놓는 모델

Jev는 프로그램 상태값 묶음과 타입이 지정된 질문 세트를 받아 보정된 확률이 붙은 답을 돌려준다. 최대 255개 선택지 가운데 하나 고르기, 일정 척도 위의 점수, 예·아니오 확률이다2. 모든 질문은 병렬 연산 한 번으로 평가된다. 토큰을 한 개씩 풀어내는 디코딩이 없고, 파싱할 것도 없으며, 도구 네 개짜리 메뉴에서 다섯 번째 도구를 지어낼 방법도 없다23. TypeSafe에 따르면 판단에 70~500밀리초가 걸리고, 입력은 100만 토큰당 0.042달러, 출력은 무료다2. 회사는 이 부류를 카너먼의 '빠른 사고'에서 따온 '시스템1(System One) 모델'이라 부르며, 보정된 판단을 끌어내도록 강화학습으로 훈련한다. 덕분에 밝히는 확신이 실제 정확도를 따라가고, 코드는 확신이 임계값을 넘으면 실행하고 못 미치면 상위로 넘길 수 있다2.

에이전트 루프는 '신호등' 확인에 챗 모델 요금을 냈다

에이전트의 삶은 대부분 추론이 아니다. 선택이다. 다음은 어느 도구인가, 그 클릭은 제대로 들어갔는가, 이 명령은 실행해도 안전한가. 랭체인은 이 루프의 비용 문제를 정면으로 짚는다. 결정 하나하나가 모델 호출 한 번 더다4. 출시 이틀 만에 이 문제의 해결책을 미들웨어 꼴로 내놓기도 했다. 요청마다 값싼 모델이나 강력한 모델로 보내는 라우터와, 실행에 앞서 모든 도구 호출을 점검하는 가드레일이다4. 버셀은 명령의 안전성을 검토하던 오픈AI 루나(Luna) 분류기를 이미 Jev로 옮겼고, 답변이 5~18배 빨라지고 정확도도 더 높아졌다고 밝혔다1. Browserbase에서는 브라우저 에이전트가 한 수 한 수 내리는 선택을 이제 1센트 미만 비용으로 Jev로 처리하고 있다4.

병목은 지능이 아니라 검증이었다

핵심을 보여주는 숫자는 벤치마크가 아니다. 한 개발자는 자기 엔진이 사람 검토 대기 상태로 쌓아둔 제품 매칭 쌍 9,081건에 Jev를 투입했다. 13분 만에 32센트를 들여 대기열을 전부 비웠다. 그는 최첨단 모델 요금 체계에서는 구축해봤자 남는 게 없다는 판단으로 6월 이 단계를 접어둔 참이었다5.

자동화가 멈춰 있던 까닭은 모델이 정형 업무를 해내지 못해서가 아니었다. 작은 단계 하나하나를 제대로 검증하자면 그 단계 자체의 가치보다 비용이 더 들었기 때문이다. 그래서 자동화가 이뤄진 것은 값비싼 단계뿐이었다.

TypeSafe가 자체 실시한 4개 워크플로 평가는 이 같은 대체의 효과를 수치로 보여준다. Jev는 GPT-5.6 Terra와 정확도가 맞먹는다. 기준 답안과의 일치율은 각각 67.8%와 67.9%이고, 건당 비용은 0.0004달러다3. 최대 193배 빠르고 445배 싸다는 대표 수치26는 다른 최첨단 모델들의 답변을 평균해 만든 기준 답안과 견줘 산 벤더 자체 보고치다. TypeSafe 스스로도 이런 최고치는 실제 개선 폭의 상단에 해당한다고 밝혔다2.

Jev에서 1센트 미만인 결정 하나, 최첨단 LLM에서는 최대 0.18달러

$0$0.05$0.1$0.15$0.2Jev (TypeSafe)$0이 가격에 Terra급 정확도GPT-5.6 Terra$0.03GPT-5.6 Sol$0.08Claude Opus 5$0.18
Data
Value
Jev (TypeSafe)$0
GPT-5.6 Terra$0.03
GPT-5.6 Sol$0.08
Claude Opus 5$0.18
TypeSafe의 4개 워크플로 평가(보안 대응, 에이전트 검토, 송장 발행, 고객 서비스)에서의 건당 비용(달러). 벤더 자체 보고 수치이며, 기준 답안은 GPT-6 Astra와 Claude Fable 5.1의 답변을 평균해 만든 것이다. 자료: TypeSafe 출시 포스팅, DataCamp.2,3

노출된 자산은 유패스의 규칙이다

유패스(UiPath)는 결정론적 규칙 기반 자동화로 19억4000만 달러의 반복 매출을 쌓아 올렸고, 12.5%의 성장세를 이어가고 있다7. 이 회사 최고운영책임자(COO)는 고객들이 이제 "결정론적 AI 기능과 확률적 AI 기능을 모두" 원한다고 말했고, 플랫폼은 모델 중립적(model-agnostic)이라고 못박으면서도 언어모델이 발전하면 단순한 자동화는 커머디티화될 수 있다고 인정했다7. 1센트 미만의 비용으로 보정된 확률을 내놓는 결정이 바로 그 커머디티화다. 적용 지점은 유패스가 오케스트레이션하는 모든 워크플로 안의 의사결정 지점이다. 회사는 이미 판매 중인 모델 중립적 Agent Builder로 이를 흡수할 수도 있고, 자사 해자가 커머디티가 되는 걸 지켜만 볼 수도 있다. 두 길 다 열려 있다. 노출은 대칭적이지 않다.

유패스 10개 분기 매출…꾸준한 상승, 10%대 초반 성장, 에이전트 변곡점은 없다

$300M$350M$400M$450M$500M24년 2분기24년 4분기25년 2분기25년 4분기26년 2분기$410.26M최근 분기: 전년 동기 대비 13.4% 증가
Data
매출
24년 1분기$335.11M
24년 2분기$316.25M
24년 3분기$354.65M
24년 4분기$423.65M
25년 1분기$356.62M
25년 2분기$361.73M
25년 3분기$411.11M
25년 4분기$481.11M
26년 1분기$418.38M
26년 2분기$410.26M
유패스 분기별 매출(단위: 100만 달러). 자료는 SEC 공시 기반 Sharadar. 10개 분기에 걸쳐 전년 동기 대비 증가율은 4.5~17.3%를 오갔고, 2026년 7월 마감 분기는 13.4% 늘었다. 본문에서 인용한 19억4000만 달러 ARR의 12.5% 성장과 부합하는 수치다.10

결과 단위로 과금하는 플랫폼이 마진을 챙긴다

세일즈포스는 Agentforce 반복 매출이 15억 달러를 넘었고 240% 이상 늘었다고 밝혔다. 이 회사는 고객에게는 대화 건수·해결 건수·크레딧 단위로 값을 매기면서 그 밑의 토큰 비용은 자사가 부담한다. 소비 토큰은 이미 19조 개를 넘어섰고, 한 임원은 엔지니어 한 명이 "한 달에 10만 달러쯤 되는 요금을 만들어낼 수 있다"고 말했다8. 라우팅·가드레일·검증 호출이 거의 공짜인 계층으로 옮겨갈 때마다 그만큼은 이미 판매한 제품에 얹히는 마진이 된다. 같은 산수가 서비스나우와 마이크로소프트의 코파일럿 스택에도 그대로 기다리고 있다. 이는 본지가 세일즈포스가 자사 에이전트 마켓플레이스를 안스로픽에 열었을 때 던졌던 바로 그 질문이기도 하다. 밑에 깔린 에이전트 계층이 싸지면 소프트웨어 예산은 누가 가져가는가. 우위가 며칠 만에 움직인 것도 이 때문이다. 클라우드플레어는 AI 문서에 typesafe/jev를 실었고, 버셀은 9월 16일 자사 AI 게이트웨이에 이 모델을 올렸다5.

결정당 대역폭은 줄고, 결정은 늘어난다

데이터센터 문제는 솔직하게 짚고 넘어가자. 모든 답변이 한 번의 패스로 나오기 때문에 출력 토큰마다 메모리를 끌어 쓰는 디코딩 루프가 없다. 결정 건당으로 따지면 이 모델은 그 작업에서 자신이 대체할 챗 모델보다 메모리 대역폭 부담이 가벼워 보인다3. 그런데 애초에 이 장부 자체가 틀렸다. 값싼 계층의 존재 이유는 돈이 되는 에이전트 활동을 더 많이 만들어내는 것이고, 그 에이전트는 하나같이 어려운 몫에서는 여전히 최첨단 모델을 호출한다. TypeSafe가 모델 이름을 윌리엄 스탠리 제번스(William Stanley Jevons)에서 딴 것은 우연이 아니다. 석탄이 싸지자 더 많은 석탄이 탔기 때문이다25. 단가가 떨어져도 추론 티어와 그 뒤에 선 메모리 공급업체에 대한 총수요는 오히려 늘어날 수 있다. 이것이 논거다. 6일치 데이터로 판가름할 수 있는 문제는 아니다.

맨체스터 대학교 도서관 소장. 의자에 앉은 윌리엄 스탠리 제번스의 초상 사진
윌리엄 스탠리 제번스. TypeSafe는 모델 이름을 이 경제학자의 석탄 역설에서 빌려 왔다. 석탄이 싸지자 더 많은 석탄이 탔다. · Unknown photographer, University of Manchester Libraries, History & Heritage collection, Image ID JRL15040114

비상장 회사, 나온 지 엿새… 그래도 지금 익혀야 할 아키텍처

아직 걷히지 않은 부분부터 분명히 해둔다. 평가(evals)는 벤더가 자체적으로 돌린 것이고, 기준 레이블은 정답(ground truth)이 아니라 다른 모델의 답변이며, 출력은 근거 없는 확률값 하나로 나온다. Jev도 여전히 오판할 수 있고, TypeSafe는 자사 요금에 보조금이 깔려 있지 않다는 점을 증명할 수 없다고 인정한다2356. TypeSafe 자체가 비상장 기업이다. DCVC가 주도하는 시드 투자에서 4000만 달러를 받았고, 한 보도에서는 기업가치 약 2억 달러로 평가됐다 9. 그래서 이 전환을 통째로 담은 종목코드(티커)는 존재하지 않는다. 그런 종목이 있다고 내미는 목록은 모두 추측이다.

주목할 곳은 스택의 중간

가치는 새로운 능력과 누군가의 업무 현장 사이 거리를 좁히는 쪽에 돌아간다. 이번 주 그 거리를 좁히는 작업은 정직한 작은 검증의 가격을 무너뜨리고 있다. 스택의 중간을 주목하라. 이미 팔고 있는 제품에 이 계층을 접어 넣는 플랫폼은 마진을 챙기고, 이를 거부하는 규칙 기반 벤더는 커머디티가 된다. 무엇을 만드는 사람이든 지금 익혀야 할 아키텍처는 캐스케이드(cascade), 즉 값비싼 추론 아래 값싼 결정을 깔아두는 구조다. 엿새짜리 모델에 붙는 단서까지 감안하더라도 그렇다. 이것을 익히는 사람이 다음으로 일이 바뀌는 사람이다.

How this brief was made

01Gathered & sourced378 channels · 1,398 articles▾

Agents swept 378 channels and ingested 1,398 articles, then de-duplicated and ranked them for signal.

02Verified & cross-validated10 claims · 15 data feeds▾
03Reviewed & edited2 human editors▾

2 editors read the draft against the evidence, tuned the framing, and signed off before it shipped.

Become a contributor

Reporting on the business of AI and want it read? We take pitches from outside contributors who bring primary sources and a number worth arguing about.

Share

Deepdive

AI-generated from this story and its cited sources. Not investment advice.

Reader comments

0 comments

    Sign up

    Get your curated digest

    After email confirmation, you will receive a daily digest of the most relevant news that matter to your portfolio