powered by TechFeed
表示モード
主要ニュース

OpenAIがGPT-6の下位モデル「Sol・Luna」を半額投入 — 特定ベンチマークではClaude Opus 5の10分の1以下のコストで上回る性能

9月24日、startuphub.aiが「OpenAI halves Sol and Luna pricing after Astra」と題した記事を公開した。OpenAIがGPT-6 SolおよびGPT-6 LunaのAPI価格をGPT-5.6のプロモーション価格比で50%引き下げ、特定のエージェント系ベンチマークではClaude Opus 5の10分の1以下のコストで競合・上回る性能を示したという内容だ。ただしベンチマークによってはOpus 5がSolを上回るケースもあり、「全面的な性能同等」ではなくタスク・用途ごとの使い分けを前提とした価格戦略の発表と捉えるのが正確だ。

9月24日、startuphub.aiが「OpenAI halves Sol and Luna pricing after Astra」と題した記事を公開した。OpenAIがGPT-6 SolおよびGPT-6 LunaのAPI価格をGPT-5.6のプロモーション価格比で50%引き下げ、特定のエージェント系ベンチマークではClaude Opus 5の10分の1以下のコストで競合・上回る性能を示したという内容だ。ただしベンチマークによってはOpus 5がSolを上回るケースもあり、「全面的な性能同等」ではなくタスク・用途ごとの使い分けを前提とした価格戦略の発表と捉えるのが正確だ。


コスト競争の構図:なぜ今この価格なのか

OpenAIは今月上旬、同社の最高性能モデルとしてGPT-6 Astraを発表した。Astraは最上位としてコンテキストウィンドウ1,050,000トークン・最大出力128,000トークンを備える旗艦モデルだが、「作業には規模・リズム・予算によって使い分けが必要」という前提のもと、直後に下位ティアとしてGPT-6 SolとGPT-6 Lunaを投入した。

価格の比較基準となるGPT-5.6は、OpenAIがGPT-6ファミリー投入前に展開していたモデル群で、当時は競争促進を目的としたプロモーション価格が設定されていた。今回の価格改定はそのプロモーション価格をさらに50%下回る水準への引き下げとなる。

モデル 入力(/100万トークン) 出力(/100万トークン)
Astra $10 $50
Sol $2 $10
Luna $0.10 $0.50

Astraを最上位に、SolはAstraより低コストで高性能、Lunaは大量処理向けの最廉価帯という三層構造が明確になった。なお、キャッシュされた入力トークン読み取りの90%ディスカウントは引き続き有効だ。OpenAIは、推論とキャッシングの効率改善により低価格での提供が可能になったと説明している。


「トークン単価」ではなく「タスク単価」で語る価格戦略

今回の発表でOpenAIが強調しているのは、トークンあたりのコストではなくタスクあたりのコスト効率だ。各種ベンチマークでの比較がその根拠として示されている。ただし、ベンチマークによって優劣の様相は異なる点に注意が必要だ。

AutomationBench 1.0.6(47ツール対象)

SolがOpus 5を精度・コストの両面で最も大きく上回るベンチマークがこれだ。

  • GPT-6 Sol(xhighエフォート): スコア33.2%、1タスクあたり$0.27
  • Claude Opus 5(maxエフォート): スコア26.9%、Solの約11.1倍のコスト

精度でも上回りながら、コストは10分の1以下という結果だ。

Agents' Last Exam V1

このベンチマークではOpus 5がSolを上回るスコアを記録している。

  • Claude Opus 5(best): **63.0%**(元記事記載値)
  • GPT-6 Sol(max): 56.4%(Opus 5比で約60%低コスト)

Solはスコアこそ劣るものの、コストを大幅に抑えながら60%台に迫る水準にあると元記事は位置づけている。

DeepSWE 1.1

  • GPT-6 Sol(max): 68.8%(Claude Fable 5 xhigh比で約80%低コスト、スコア差は1.1ポイント)
  • GPT-6 Luna(max): 66.6%(Claude Opus 5 mediumと比較して93%低コスト)

LunaとOpus 5 mediumの比較が特に注目点だ。93%低コストでほぼ同等の精度という数字は、コスト重視のワークロードでは実用的な意味を持つ。

FrontierCode 1.1(マージ可能性も評価する開発向けベンチマーク)

  • Sol(xhigh)がClaude Fable 5.1とほぼ同等のスコアを、大幅に低いコストで達成

なお、Claude Fable 5.1はAnthropicが2026年にリリースしたClaude 5ファミリーの中位モデルで、現在Snowflakeとのプライベートプレビューが進んでいる。Anthropicのモデル系譜上はOpus 5とHaiku 5の間に位置するとされている。

OSWorld 2.0 offline(コンピュータ操作タスク)

  • Sol(xhigh): 60.5%(Claude Opus 5 mediumと同水準、約80%低コスト)

競合との価格競争が加速している背景

Sol・Lunaのトレーニング手法はAstraと共通しており、プロフェッショナル業務・事実確認・コーディング・コンピュータ操作・アライメント(AIの安全性・整合性)といった分野でのAstraの改善を継承している。

価格設定の背景には、AnthropicのClaude Fable 5.1など競合モデルの台頭がある。OpenAIは今回の価格改定について、Astra投入後の競争環境を前提にしたものであることを明示しており、「Astra登場後にのみ成立する価格」と位置づけている。

整理すると、今回の価格改定が最も効果を発揮するのは次のようなケースだ。

  • Luna(入力$0.10・出力$0.50): 大量バッチ処理や高頻度API呼び出しを検討しているケース。DeepSWEでOpus 5 mediumと比較して93%低コストかつ競合スコアを示した点は、コスト重視のエージェント系ワークロードで実用的な数字だ
  • Sol(入力$2・出力$10): AutomationBenchやOSWorldなど操作系タスクで精度とコストのバランスを求めるケース。ただしAgents' Last Examのようにモデル選択が逆転するベンチマークもあるため、自社ユースケースでの検証が前提になる

詳細はOpenAI halves Sol and Luna pricing after Astraを参照していただきたい。