powered by TechFeed
表示モード
Deep Dive

AIのコスト低下速度は史上最速——18ヶ月でo3並みの精度が1/725の価格で手に入る時代へ

9月25日、The Decoderが「AI performance costs are falling faster than those of any previous technology」と題した記事を公開した。この記事では、AIの性能コストが過去のいかなる技術よりも速いペースで低下しているというEpoch AIとMITによる定量分析について詳しく紹介されている。以下に、その内容を紹介する。

9月25日、The Decoderが「AI performance costs are falling faster than those of any previous technology」と題した記事を公開した。この記事では、AIの性能コストが過去のいかなる技術よりも速いペースで低下しているというEpoch AIとMITによる定量分析について詳しく紹介されている。以下に、その内容を紹介する。


o3並みの精度が1/725のコストで手に入る時代

最も目を引く数字から始めよう。

Epoch AIは、OpenAIのo3を例に挙げる。2025年初頭、o3はPhDレベルの科学テスト「GPQA Diamond」で75%のスコアを記録し、1問あたりの推定コストは約30セントだった。それから18ヶ月後、GPT-5.6ファミリーのモデルが同じスコアを0.04セント以下で達成した。Epochの計算では元の価格の1/725になる。

Epochはこの数字を直感的に表現している。「もし自動車がこのペースで値下がりしたなら、5万ユーロの車が70ユーロ以下になる」。さらに、OpenAIはつい数日前にGPT-6 SolとLunaという低価格モデルをリリースしており、この差はさらに広がっている可能性が高い。


固定精度レートにおける複数AIベンチマークの1問あたりコストの推移 | 画像: Epoch AI

Epochの分析は数学・科学・論理パズルにまたがる5つのベンチマークに基づいており、同組織自身も「入手できる最良のデータによる、合理的だが粗い測定値」と位置づけている。


MITの分解分析:コスト低下の正体

HansGundlach氏らMITの研究チームは、モデル比較プラットフォームArtificial Analysisの価格データ(2024年4月〜2025年11月)を使い、より多くのモデルを対象に分析した。

MITの推計ではコスト低下は年間5〜10倍で、Epochの数字より小さい。差が生じる主な理由は、新しい推論モデルが難しい問題に対してテスト時コンピュート(test-time compute)を大量に投入するため、トークン単価が下がっても1問あたりのコストが上がるケースがあるからだ。トークンはAPIプロバイダが課金の単位とするテキストの断片であり、その単価だけを比べると実態を見誤る。

MITはコスト低下の要因を以下の3つに分解している。

  • アルゴリズムの効率化:年約3倍のコスト低下に相当
  • ハードウェアの低価格化:一部を説明
  • 競争圧力:最大の要因

Epochの推計(年13倍)が大きいのは、ハードウェアと競争の効果を除外していないためだ。MITが競争の影響を切り離すために、オープンモデルを別途分析するなどの統制を行った結果、純粋なアルゴリズム効率の改善は年約3倍という数字が残った。


2024〜2025年の価格低下をアルゴリズム効率・ハードウェア改善・競争の3要因に分解 | 画像: Gundlach et al.


ベンチマークスコアの向上 ≠ 効率の向上

MITの分析でもう一点見落とせないのが、ベンチマークスコアの「中身」に関する指摘だ。

新モデルがGPQA Diamondで前モデルを上回るように見えても、その改善の一部は単純により多くの計算リソースを投入した結果に過ぎないケースがある。スコアは上がり、コストも上がる。コーディングや数学のベンチマークでも同様の傾向が確認されている。

新モデルのスコアには、より良いトレーニング・データ・アーキテクチャ・テスト時コンピュートのすべてが混ざり込んでいる。単一のスコアからは効率化を判断できない。

さらに「ベンチマックシング(benchmaxxing)」の問題もある。AI企業が有名なテストに特化した最適化を行い、実用上の改善を伴わずにスコアだけを押し上げる懸念だ。Epochはこれに対処するため、非公開ゲームに基づく「Mystery Game Puzzles」というテストを1つ含めているが、そのテストではコスト低下が最も緩やかであり、benchmaxxing仮説と整合する(ただし、タスク形式やデータのノイズによる可能性も否定できない)。


「安いモデル」を選ぶべきかどうかは別問題

コストが劇的に下がっているという事実は、モデル選定の問題を単純にしない。

リアルタイムチャットボットには、低コストでもレイテンシの高いモデルは使えない。自動化ワークフローには、強力な推論モデルが遅すぎることもある。逆に、高単価のフロンティアモデルでも、エラーが減ってリトライが少なくなればトータルコストが下がる場合もある。こうした多次元のトレードオフは、トークン単価の比較だけでは見えてこない。

Artificial Analysisのようなプラットフォームは品質・価格・レイテンシ・コンテキストウィンドウ・出力速度でモデルをランク付けしており、最安値が全方位で勝つことはまずない。


詳細はAI performance costs are falling faster than those of any previous technologyを参照していただきたい。