TypeSafe Jev:文章ではなく判断を返すAI

#AI読了時間:3分

顧客の問い合わせを担当部署に振り分けるために、長い回答を生成する必要はあるだろうか。TypeSafe AIが9月14日に早期アクセスで公開したJevは、この問いから出発している。[1] 同社が「System One Model」と呼ぶこのモデルは、文章を書く代わりに、ソフトウェアがそのまま使える構造化された判断と確率を返す。[1] 韓国時間9月21日時点の公式発表と開発資料から、特徴と限界を見ていく。

パンチカードと機械図面を重ねたTypeSafeのJev公式発表画像
画像: TypeSafe AI · Jev公式発表画像公式ページ

チャットボットより「判断関数」に近い

Jevには、判断対象の資料であるstateと、質問であるquestionsを分けて渡す。[4] たとえば顧客の問い合わせを資料として、「どの部署が担当するか」「どれほど緊急か」を別々に尋ねる形だ。公式APIには、選択肢からひとつを選ぶChoice、評価基準に沿って採点するScore、命題の真偽を0〜1で表すNoulがある。[4]

複数の質問は同じ資料に基づいて並列に評価され、複雑な問題は小さな質問に分け、結果をコードで組み合わせることが推奨されている。[4] 「この依頼を実行してよいか」というひとつの質問にすべてのポリシーを詰め込むのではなく、条件ごとの判断を受け取り、最終的な実行ルールは開発者が管理する考え方だ。

速さと安さの主張は条件も確認

TypeSafeは発表で、エンドツーエンドの応答時間を70〜500ms、入力100万トークンあたりの料金を0.042ドルとしている。[1] Vercel AI GatewayのJevページにも同じ入力単価が記載されている。[3] ただし、GamZipがAPIを呼び出して速度や請求額を実測した結果ではない。

同社の「193.6倍速く、444.6倍安い」という数字は、独自のワークフロー評価によるもので、実際の利用で期待できる改善幅の高い側に当たるとも説明している。[1] 評価の基準は人間が付けた正解ラベルではなく、他の大規模モデルの平均予測であり、比較対象のLLMには確率を出力するためのラッパーが使われた。[1] したがって、すべての作業での速度・費用の優位性に一般化することはできない。

「ハルシネーションなし」は「誤答なし」ではない

TypeSafeの0%という数字は、実験で観測したすべてのエラー率ではなく、出力が決められたスキーマに従うという保証に基づいている。[1] 許可されていない形式を作らないことと、許可された選択肢から正解を選ぶことは別の問題だ。「請求」と「技術サポート」で誤った部署を選んでも、形式は正しい場合がある。

Pydantic AIの資料も、Jevの計算・数え上げ・日付の判断、複数段階を要する質問、回答を誘導する敵対的入力に注意を求めている。[2] この連携のconfidenceも、正解である確率そのものではなく、確率分布から算出する指標と説明されている。[2] 高い数字だけで自動実行を認めるのではなく、実際の業務の正解データで基準を検証すべきだ。

ゲームでも使える?

公式発表にはDoomのデモも登場する。ただし画面画像を直接読むのではなく、テキストを含む構造化されたゲーム状態を入力しており、同社は従来の非AIボットのほうがうまくプレイする可能性も示している。[1] ゲーム画面を理解する汎用プレイヤーとして紹介すると、デモの意味を誇張してしまう。

GamZipの視点では、「AIがゲーム全体を作る」ことより、NPCの限られた行動選択や通報の分類などから考えたい。これは活用案であり、検証済みのゲーム性能ではない。移動・攻撃など可能な行動をコードで限定し、誤った判断の影響を小さくする設計が先に必要だ。

GamZipの解説:LLMをなくすより役割を分ける

Jevは自由な文章やツールの引数を生成するモデルではない。[2] 一方、Pydantic AIは確信度が低い依頼を別の言語モデルに渡す連携方法を説明している。[2] すばやい分類はJevに、説明や複雑な処理はLLMまたは人間に任せる構成が自然だ。

導入を検討するなら、自社データでの誤分類率、人間に引き継ぐ割合、実際の応答遅延を合わせて確認したい。特に返金やアカウント制裁のように影響の大きい作業では、モデルの判断と実行権限を分けるべきだ。Jevの興味深さは「絶対に間違えないAI」ではなく、AIの判断をソフトウェアの明示的なルールに組み込もうとするインターフェースにある。

Sources

[1] https://typesafe.ai/blog/introducing-system-one-models-and-jev [2] https://pydantic.dev/docs/ai/models/typesafe [3] https://vercel.com/ai-gateway/models/jev [4] https://docs.typesafe.ai — TypeSafeの公式開発資料