AIの最も単純な判断を、ほぼタダにした者が現れた

TypeSafeの新モデル「Jev」は9月15日に公開された。文章を書く代わりに、型付きの質問へ較正された確率(calibrated probability)で答えを返し、その費用は1セント未満だ。エージェントループの中でたび重なる小さなチェックがほぼ無料になれば、これまで自動化する値打ちがなかった定型業務に採算が生まれ始める。この層を自社製品に組み込むプラットフォームは利幅を握り、ルールを売るベンダーはコモディティーに落ちる。

原文を読む

Richard TangRichard Tang · 5 min read
Share
無地の背景の前で腕を組んで立つTypeSafe AIの共同創業者3人。右端はTypeSafeのTシャツ姿の最高経営責任者(CEO)ディオゴ・アルメイダ
1 / 6Slide 1 of 6
TypeSafe AIの創業者たち。右がCEOのディオゴ・アルメイダ氏。ChatGPTに話すことを教えた訓練手法RLHFを共同考案したが、その新モデル「Jev」は、いっさい口をきかない。

9月15日、ChatGPTを作ったメンバーの一人が、文章を書けない最先端モデルを世に出した。ディオゴ・アルメイダ氏は同チャットボットと、その基盤となった訓練手法RLHF(人間からのフィードバックによる強化学習)の構築に携わった後、TypeSafe AIで2年間のステルス(非公開)期間を費やし、自らの発明を反転させるものを造り上げた1。自らが育てた業界への同氏の評価は辛辣だ。「われわれは瓶の中に稲妻を手に入れた。それなのに役に立たない」——モデルが人間の言語に最適化されている一方で、「コンピューターは別の言語を話している」からだ1。同氏の新モデル「Jev」は、いっさいものを言わない。

文章を書かず、答えを出すモデル

Jevは、プログラムの状態をまとめたブロックと一連の型付き質問を受け取り、較正された確率を伴う答えを返す。最大255の選択肢からの1つ、尺度上のスコア、あるいはイエス・ノーの確率——そのいずれかの形だ2。すべての質問は1回の並列処理で評価される。トークンを1個ずつ生成するデコードはなく、解析すべきテキストもなく、4つのツールのメニューに5つ目のツールをでっち上げる余地もない23。TypeSafeによれば、判断は70〜500ミリ秒で返り、入力は100万トークンあたり0.042ドル、出力は無料2。同社はこの種のモデルを、カーネマンのいう「速い思考」にちなんでシステム1(System One)モデルと呼び、較正された判断を得るために強化学習で訓練する。これにより、示された確信度が実際の正確さと一致し、コードは閾値以上なら行動し、未満なら上位に委ねられるようになる2。

エージェントループは、信号レベルの判断にチャット並みの代金を払っていた

エージェントの活動の大半は推論ではない。「次はどのツールか」「クリックは効いたか」「このコマンドは実行して安全か」——選択の連続である。LangChainは判断のたびにまた1回モデル呼び出しが増える、というこのループのコスト問題を端的に指摘する4。Jevの公開から2日以内に、同社はその解決策をミドルウェアとして提供した。各リクエストを安価なモデルか高性能なモデルに振り分けるルーターと、実行前にすべてのツール呼び出しを検査するガードレールだ4。Vercelは、コマンドの安全性を審査するOpenAIの分類器「Luna」をすでにJevに移しており、回答が5〜18倍速くなり、精度も上がったと明らかにしている1。Browserbaseでは、ブラウザを操作するエージェントが1手ごとの判断をJevで行うようになり、その費用は1セント未満だ4。

ボトルネックは知能ではなく、検証だった

注目すべき数字はベンチマークではない。ある開発者が、自社のエンジンで人間の確認待ちにしていた商品マッチング9,081ペアにJevを向けた。13分、費用32セントで、滞留案件をすべて片付けた。この工程は、最先端モデルの料金では作る見合いが取れないとして、6月に棚上げしていたものだ5。

自動化が止まったのは、モデルに定型作業をこなす力がなかったからではない。小さな工程の一つひとつを手を抜かずに検証するコストが、工程そのものの価値を上回ったために止まったのだ。自動化されたのは、高額な工程だけだった。

TypeSafe自身による4ワークフロー評価が、この置き換えを数値で示している。JevはGPT-5.6 Terraに精度で並ぶ。参照解答との一致率は67.8%対67.9%で、コストは1ケースあたり0.0004ドルだ3。うたい文句の倍率——最大193倍の高速化、445倍の低コスト化26——は、ほかの最先端モデルの解答を平均して作った参照解答に対するベンダー自己申告の数値で、TypeSafe自身も、ピーク値は実運用で得られる効果の上端にあると認めている2。

Jevなら1セント未満の判断、最先端LLMでは最大0.18ドル

$0$0.05$0.1$0.15$0.2Jev(TypeSafe)$0この価格でTerra並みの精度GPT-5.6 Terra$0.03GPT-5.6 Sol$0.08Claude Opus 5$0.18
Data
Value
Jev(TypeSafe)$0
GPT-5.6 Terra$0.03
GPT-5.6 Sol$0.08
Claude Opus 5$0.18
TypeSafeの4ワークフロー評価(セキュリティ対応、エージェント審査、請求処理、カスタマーサービス)における1ケースあたりコスト(米ドル)。ベンダー自己申告。参照解答はGPT-6 AstraとClaude Fable 5.1の平均。出典:TypeSafeの発表記事、DataCamp2,3

UiPathのルール資産、リスクに露出

UiPathは、決定論的なルールベースの自動化で19億4000万ドルのリカーリング収益(経常収益)を築き、12.5%成長している7。同社の最高執行責任者(COO)自身が、顧客は今や「決定論的なAI機能と確率的なAI機能の双方」を求めると述べ、プラットフォームはモデル非依存(model-agnostic)を貫くと強調する一方、言語モデルの進展が単純な自動化をコモディティ化しかねないと認めている7。較正された判断を1セント未満で返すというのは、まさにそのコモディティ化を、UiPathがオーケストレーションするすべてのワークフロー内の判断ポイントに適用したものだ。同社は、すでに販売しているモデル非依存の「Agent Builder」でこれを取り込むこともできれば、自社の堀がコモディティになるのを見届けることもできる。どちらの道も開いている。ただし、リスクの向けられ方は対称ではない。

UiPathの売上高は10四半期連続で緩やかな右肩上がり 伸び率10%前半、エージェントの変曲点は見えず

$300M$350M$400M$450M$500M24年Q224年Q425年Q225年Q426年Q2$410.26M最新四半期:前年同期比13.4%増
Data
売上高
24年Q1$335.11M
24年Q2$316.25M
24年Q3$354.65M
24年Q4$423.65M
25年Q1$356.62M
25年Q2$361.73M
25年Q3$411.11M
25年Q4$481.11M
26年Q1$418.38M
26年Q2$410.26M
UiPathの四半期別売上高(単位は100万ドル)。米証券取引委員会(SEC)提出資料をSharadar経由で取得。前年同期比は10四半期にわたり4.5~17.3%で推移し、2026年7月期は13.4%増。本文で引用したARR(年間経常収益)19億4000万ドル・12.5%増と整合している。10

成果課金のプラットフォームが利幅を確保

SalesforceはAgentforceのリカーリング収益(経常収益)が15億ドルを超え、240%以上増えたと発表。顧客には会話数や解決数、クレジット単位で課金しながら、その下でかかるトークンの請求額は自社が負担する。消費トークン数は19兆を超え、幹部の1人は「1人のエンジニアが月10万ドルくらいの請求を生み出せる」と指摘する8。ルーティング、ガードレール、検証の各呼び出しをほぼ無料の層に移した分は、そのすべてが、すでに販売した製品の利幅となる。同じ計算がServiceNowやMicrosoftのCopilotスタックにも待ち構えている。Salesforceが自社のエージェントマーケットプレースの門をAnthropicに開いた際に本サイトが問うたのと同じ問いだ。その下のエージェント層が安価になれば、ソフトウェア予算を誰が握るのか。エッジ側が数日で動いたのはこのためだ。CloudflareはAI関連ドキュメントにtypesafe/jevを掲載し、Vercelは9月16日にAI GatewayでJevの提供を始めた5。

1判断あたりの帯域は減り、判断の数は増える

データセンターをめぐる問いには、率直であるべきだ。すべての回答が1回のパスで得られるため、出力トークンごとにメモリを消費するデコードループが存在せず、判断1回あたりのメモリ帯域の負荷は、この用途で置き換わるチャットモデルより軽く見える3。だが、それはそもそも間違った帳簿だ。安い層の狙いは、動かす価値のあるエージェントの活動を増やすことにあり、そのどのエージェントも、難しい部分では今も最先端モデルを呼び出す。TypeSafeがモデル名をウィリアム・スタンリー・ジェヴォンズにちなんだのは意図的だ。石炭が安くなれば、燃やす石炭は増える25。単価が下がっても、推論層への総需要は、その背後にいるメモリーメーカーへの需要とともに増えうる。これが論点だ。6日分のデータで決着はつかない。

マンチェスター大学図書館コレクション所蔵、着席したウィリアム・スタンリー・ジェヴォンズの肖像写真
経済学者ウィリアム・スタンリー・ジェヴォンズ。石炭が安くなれば燃やす石炭は増えるという「石炭のパラドックス」を、TypeSafeはモデル名に借りた。 · Unknown photographer, University of Manchester Libraries, History & Heritage collection, Image ID JRL15040114

非公開、登場から6日、それでも学ぶべきアーキテクチャ

不確定な点は残る。評価はベンダー自身の実施で、参照ラベルは正解データではなく他のモデルの回答であり、出力は根拠を伴わない確率で、Jevの誤分類もありうる。TypeSafe自身も、価格が補填されていないことを証明できないと認める2356。TypeSafeは非公開会社で、DCVCがリードする4000万ドルのシード調達を実施、評価額はある報道で約2億ドルとされる 9。したがって、この変化を握るティッカー(上場銘柄)は存在せず、あるかのように掲げる銘柄リストは、いずれも憶測にすぎない。

見るべきはスタックの中間

価値は、能力と働く現場との距離を縮める者のところに転がり込む。今週その距離を縮めたのは、正直な小さなチェックの価格だ。見るべきはスタックの中間だ。すでに販売している製品にこの層を組み込むプラットフォームは利幅を確保し、組み込みを拒むルールベースのベンダーはコモディティになる。作る側の誰にとっても、高い推論の下に安い判断を置く「カスケード」こそ、登場6日の注意点を丸ごと引き受けてでも今学ぶべきアーキテクチャだ。それを学んだ人の仕事が、次に変わる。

How this brief was made

01Gathered & sourced378 channels · 1,398 articles▾

Agents swept 378 channels and ingested 1,398 articles, then de-duplicated and ranked them for signal.

02Verified & cross-validated10 claims · 15 data feeds▾
03Reviewed & edited2 human editors▾

2 editors read the draft against the evidence, tuned the framing, and signed off before it shipped.

Become a contributor

Reporting on the business of AI and want it read? We take pitches from outside contributors who bring primary sources and a number worth arguing about.

Share

Deepdive

AI-generated from this story and its cited sources. Not investment advice.

Reader comments

0 comments

    Sign up

    Get your curated digest

    After email confirmation, you will receive a daily digest of the most relevant news that matter to your portfolio