powered by TechFeed
表示モード
主要ニュース

「考えすぎ」をモデル自体に直させた — Fireworks AIのEmber-1、推論トークンを40%削減しつつコーディング性能はほぼ維持

9月28日、MarkTechPostが「Fireworks AI Releases Ember-1: A Post-Trained Kimi K3 That Uses About 40% Fewer Tokens」と題した記事を公開した。Fireworks AIがKimi K3をポストトレーニングして推論トークン数を約40%削減したモデル「Ember-1」のリリースを伝える内容だ。本番A/Bテストではタスクスコアをほぼ維持したまま出力トークンを39%削減し、一部ベンチマークではベースモデルを上回るという結果が示されている。

9月28日、MarkTechPostが「Fireworks AI Releases Ember-1: A Post-Trained Kimi K3 That Uses About 40% Fewer Tokens」と題した記事を公開した。Fireworks AIがKimi K3をポストトレーニングして推論トークン数を約40%削減したモデル「Ember-1」のリリースを伝える内容だ。本番A/Bテストではタスクスコアをほぼ維持したまま出力トークンを39%削減し、一部ベンチマークではベースモデルを上回るという結果が示されている。


推論モデルはトークンを使いすぎる——それ自体を訓練で直した

LLM(大規模言語モデル)の推論コストは、モデルのパラメータ数だけでなく、生成するトークン数に直結する。特に「考える」ステップを持つ推論モデル(Reasoning Model)では、内部の思考プロセスが出力トークンとして課金対象になる。

Fireworks AIによれば、Kimi K3のような推論モデルでは、生成トークンの90%以上が内部推論(internal reasoning)に費やされるケースがある。さらにエージェント的なマルチターン処理では、各ターンで前の推論トレースが再度入力として蓄積されるため、コンテキスト長はターン数に応じて線形に増加する。加えてTransformerの自己注意機構(Self-Attention)のコストはコンテキスト長の二乗に比例するため、ターン数が増えるにつれ計算・課金コストは急速に膨らむ。初期ターンで生成された長い推論トレースが後続の全呼び出しで読み直され、その都度課金される構造が問題の核心だ。

顧客からは「K3のコーディング性能を、より低コストで使いたい」という要望があった。推論時に「reasoning effort」設定を下げる方法も試みたが、品質の低下が許容できないレベルだったという。そこでFireworks Researchがとったアプローチが、モデル自体を「効率よく推論する」よう再訓練することだった。

Ember-1の訓練:50回以上の実験と独自アルゴリズム

Ember-1は、MoonshotAIのオープンウェイトモデルであるKimi K3を元に、Fireworks Researchがポストトレーニング(事後訓練)を施したモデルだ。

訓練の方針は「推論のすべてを削るのではなく、無駄な部分だけを削る」というものだ。仮定を見直したり、フィードバックに反応したりといった有益な自己参照(self-reflection)は維持しつつ、冗長なループや非生産的な繰り返しをカットするよう訓練されている。

訓練データは数学、コーディング、指示追従、会話、検索、ツール使用、ソフトウェアエンジニアリングと幅広く、単発の問題だけでなく、マルチステップのインタラクションも含む。タスクおよび環境からのフィードバックを使ったオンポリシー学習(on-policy learning)を採用。50回以上の訓練実験と200回以上の評価を実施した。訓練アルゴリズムは独自開発だが、現時点では非公開だ。全訓練はFireworks Serverless Training上で実行され、顧客データは使用していないとしている。

ベンチマーク:一部でK3 Maxを上回る

Fireworksが公開したベンチマーク結果(K3の3段階の推論effort設定との比較)は以下のとおりだ。

ベンチマーク K3 Low K3 High K3 Max Ember-1 コスト削減(vs K3 Max)
Terminal Bench 2.1 76.4% 77.6% 80.9% 82.0% -51.9% / -23.1 USD
SWE-bench Verified 80.4% 86.0% 93.2% 92.2% -15.5% / -68.1 USD
SWE-Interact 6.7% 13.3% 21.3% 20.0% -32.5% / -60.8 USD
DeepSWE 1.1 55.8% 62.8% 66.4% 75.2% -23.7% / -126.9 USD
τ-2 Bench Airline 64% 64% 64% 66% -5.9% / -0.3 USD

Terminal Bench 2.1とDeepSWE 1.1ではK3 Maxを上回っている。SWE-bench VerifiedとSWE-Interactではわずかに下回るが、コスト削減幅はそれぞれ15.5%・32.5%だ。7つのベンチマークと2社の本番トラフィックを通じて、推論トークンを35〜50%削減しながら精度を維持したとFireworksは述べている。

なお、表中のSWE-bench VerifiedはGitHub Issueを用いたソフトウェアエンジニアリングタスクの標準的なベンチマークだが、SWE-InteractおよびDeepSWE 1.1はFireworks独自または比較的新しい評価基準であり、評価方法や難易度の詳細はFireworksの公式ブログおよびSpecialized Intelligence Indexを確認されたい。ベンチマーク数値の解釈には、評価設定の違いも考慮する必要がある。

本番A/Bテスト:タスクスコアほぼ同一、出力トークンは39%減

2社の顧客の本番コーディングワークロードで実施したA/Bテストでは、いずれもタスクあたりのトークン数が約35%減という結果が出た。公開された実行データでは以下の数値が示されている。

  • 出力トークン:49,300 → 29,900(39%減)
  • 推論トークン:71.3%減
  • タスクスコア:0.751(K3)→ 0.753(Ember-1)
  • 平均ステップ数:23.8 → 21.4

タスクスコアはほぼ同一のまま、トークン数が大幅に減っている。料金体系はKimi K3と同一(入力$3.00、キャッシュ済み入力$0.30、出力$15.00/1Mトークン)のため、削減効果はそのままコスト削減に直結する。出力トークンのみで計算すると、タスクあたりの出力コストは約$0.74から$0.45に下がる計算だ。

現時点の制約と提供範囲

Ember-1はFireworks ServerlessのAPIを通じたResearch Previewとして提供されており、ウェイト・訓練コード・訓練アルゴリズムはいずれも非公開だ。セルフホスティングは現時点では不可能である。

医療分野への応用:Bedside Bench

コーディング以外の応用例として、医療分野への展開にも言及されている。医師が検証した500の臨床ケースからなる独自ベンチマーク「Bedside Bench」において、Ember-1はコストパフォーマンスの新たなPareto最前線を達成したとしている。詳細はSpecialized Intelligence Indexで確認できる。


詳細はFireworks AI Releases Ember-1: A Post-Trained Kimi K3 That Uses About 40% Fewer Tokensを参照していただきたい。