powered by TechFeed
表示モード
Deep Dive

LLMの300分の1のコストで同等精度 — テキストではなく「判断」を返すDecision AIモデルという新カテゴリ

10月2日、MarkTechPostが「Decision AI Models Explained: TypeSafe Jev vs Fastino GLiDE, GLiNER2.5-Decide and Open-Source Competitors」と題した記事を公開した。テキスト生成ではなく型付きの確率付き判断を返す「Decision AIモデル」という新カテゴリの仕組みと、商用・OSSを含む7モデルの比較について詳しく紹介されている。その代表モデルであるJevはClaude Sonnet 5と同等精度を達しながらコストは約300分の1、レイテンシは約200分の1という数字を示しており、ソフトウェアの判断ロジックにAIを組み込む上で実用上の選択肢が大きく広がりつつある。

10月2日、MarkTechPostが「Decision AI Models Explained: TypeSafe Jev vs Fastino GLiDE, GLiNER2.5-Decide and Open-Source Competitors」と題した記事を公開した。テキスト生成ではなく型付きの確率付き判断を返す「Decision AIモデル」という新カテゴリの仕組みと、商用・OSSを含む7モデルの比較について詳しく紹介されている。その代表モデルであるJevはClaude Sonnet 5と同等精度を達しながらコストは約300分の1、レイテンシは約200分の1という数字を示しており、ソフトウェアの判断ロジックにAIを組み込む上で実用上の選択肢が大きく広がりつつある。


「決定を返すモデル」とは何か

従来のLLMはテキストを生成する。Decision AIモデルは選択肢・スコア・確率を返す。コードが直接分岐できる形式の出力だ。

このカテゴリを一般化したのが、TypeSafe AIが2年のステルス期間を経てリリースした**Jev**だ。TypeSafeはJevを「System Oneモデル」と呼ぶ。これはダニエル・カーネマンの「速く直感的なシステム1思考」から取った命名である。

Jevがサポートするプリミティブは3種類だ:

  • Choice:リストから1つを選択し、各選択肢の確率と信頼度を返す。最大255選択肢に対応。
  • Score:順序付きレベルのルーブリックで状態を評価し、確率と信頼度を返す。
  • Noul:ある文が真である確率を0〜1で返す(ベルヌーイ分布に由来する名前)。

複数の質問は並列かつ独立に同一の状態に対して評価される。質問を追加しても応答時間はほぼ変わらない。文字列を生成しないため、型エラーを返すことがない。

アーキテクチャとして、TypeSafeは並列サンプラーとRLCD(Reinforcement Learning for Calibrated Decisions)という独自の学習手法を採用している。RLHFが人間の好みを最適化するのに対し、RLCDは信頼度と精度の整合性を最適化する。

ここで押さえておきたい背景がある。LLMは一般に「キャリブレーション問題」を抱えており、モデルが高い確信度を示しても実際の正答率がそれに伴わないケースが多い。これはLLMをソフトウェアの判断フローに組み込む際の大きな障壁だった。RLCDはこの問題に正面から取り組む設計であり、高い信頼度スコアが実際に高い正確さに対応するよう訓練されている点が核心だ。


コスト・レイテンシのインパクト

価格は入力トークン100万件あたり$0.042、出力は無料。コンテキストウィンドウは32K(OpenRouter掲載)。エンドツーエンドの応答は70〜500ミリ秒と報告されている。

TypeSafeが公開しているワークフロー評価(セキュリティインシデント、請求書処理、カスタマーサービス等4タスク)では:

モデル 平均精度 コスト/件 所要時間
Jev 67.8% $0.0004 0.4秒
Claude Sonnet 5 67.8% $0.1174 78.1秒
OpenAI "sol"(最良) 74.1% $0.0836 23.3秒

表中の「OpenAI "sol"」はOpenAIのモデルを指す略称として元記事が使用している表記であり、一般的な正式名称とは異なる可能性がある点に注意されたい。

Jevはコストで約300倍、レイテンシで約200倍Sonnet 5を下回りながら同等精度を達成した。ただしトップフロンティア構成には6.3ポイント及ばない。タスク別ではカスタマーサービスで76.0%、請求書処理では61.8%と差がある。


どこで使うか、どこで使わないか

「コードが分岐する必要のある境界付きの答えが要るならDecision Model、人間が出力を読む必要があるならLLM」というのが基本の判断軸だ。

主な適用場面:

  • エージェントのコントロールフロー:次のツール選択、リトライ判断、モデルルーティング。Vercelはこれを主要ユースケースとして挙げている。
  • 分類・トリアージ:サポートチケットルーティング、メールトリアージ、スパム検出。
  • ガードレール・安全確認:プロンプトやLLM出力のスコアリング。
  • LLM-as-a-judge代替:ArizeとLangfuseがJev評価器をリリース済み。
  • 検索リランキング:BM25で100件取得後、Jevで並列にスコアリング。

使ってはいけない場面:

  • 生成テキスト・要約・説明が必要なとき。
  • 厳密な算術・カウント・日付計算が必要なとき(TypeSafe自身のドキュメントがこの3点を弱点として明示している)。
  • 採用など人の生活に影響する判断(バイアスの検査が難しいという指摘がある)。

競合7モデルの比較

Jev公開から3週間でFastino Labsが2モデルを投入し、OSSの再現実装も複数登場した。

モデル 開発元 ライセンス サイズ ローカル実行
Jev 1.13 TypeSafe AI クローズド API 非公開 不可
GLiDE Fastino Labs クローズド API 非公開(適応的思考) 不可
GLiNER2.5-Decide Fastino Labs Apache 2.0 340M DeBERTa-v3-large 可(CPU/GPU)
Laya Convai Innovations Apache 2.0 421M ModernBERT-large 可
JevK5 個人開発者 Apache 2.0 4B Qwen3.5ベース 可(GPU)
OpenJev Theo Lee MIT Qwen3.5-4B(凍結) 可(コンシューマGPU)
kev-0.5b Jared Palmer Apache 2.0 0.5B Qwen2.5ベース 可(ラップトップ)

GLiNER2.5-Decideはエンコーダモデル(340M)でCPU推論時のp50レイテンシが167.3ms、V100では38.3ms。エアギャップ環境へのデプロイやファインチューニングが必要な場面で選択肢になる。kev-0.5bはApple M5ラップトップで6問あたり約160msと報告されており、ローカル実験の入門として使いやすい規模だ。

ベンチマーク数値については注意が必要だ。FastinoはGLiDEの評価でテストとその対戦相手を自ら選定しており、GLiNER2.5-Decideの比較ではTypeSafe製Jevではなく再現実装のJevK5を使っている。数字を跨いで比較してはいけない。


選択の基準

  • Jev:エコシステム連携が最も広い管理型API。VercelやOpenRouter、Arize、Langfuse、Buddyとの統合が既に揃っている。
  • GLiDE:推論負荷の高い判断タスクで検証したいとき。ただし自社データでの検証を推奨。
  • GLiNER2.5-Decide:オフライン環境、ファインチューニング、クロスクエスチョン制約が必要なとき。
  • Laya:多言語対応や低レイテンシが優先のとき。100言語以上対応。
  • kev / OpenJev / JevK5:ローカル実験やベンダー依存回避のとき。

詳細はDecision AI Models Explained: TypeSafe Jev vs Fastino GLiDE, GLiNER2.5-Decide and Open-Source Competitorsを参照していただきたい。