powered by TechFeed
表示モード
主要ニュース

GPT-5.6 Solの半額で一部タスクに競争力 — xAIの新コーディングAI「Grok 4.7」が価格性能比で挑む

9月21日、xAI(x.ai)が「Introducing Grok 4.7」と題した記事を公開した。コーディングおよびナレッジワーク向けの新モデル「Grok 4.7」のリリース内容と、複数の専門ベンチマークにおける性能比較を詳しく紹介している。

9月21日、xAI(x.ai)が「Introducing Grok 4.7」と題した記事を公開した。コーディングおよびナレッジワーク向けの新モデル「Grok 4.7」のリリース内容と、複数の専門ベンチマークにおける性能比較を詳しく紹介している。


コーディング特化モデル「Grok 4.7」、前世代と同価格で投入

xAIは2023年にElon Muskが設立したAI企業で、Grokシリーズは同社の主力LLMラインナップだ。Grok 3から始まり、細かいバージョンアップを重ねながらコーディング・推論能力の向上を図ってきた経緯がある。今回のGrok 4.7は、その系譜における最新リリースとして位置づけられる。

価格は入力トークン100万件あたり2ドル、出力トークン100万件あたり6ドル。前世代のGrok 4.6と同等の価格・速度を維持しながら、より大きなベースモデルと長期間の強化学習(RL:Reinforcement Learning、モデルが報酬信号をもとに試行錯誤を繰り返して性能を向上させる手法)トレーニングを経た点が特徴だ。

エンジニアにとって注目すべき数字を先に挙げる。長時間のコーディングタスクを評価するベンチマーク「CursorBench 4.0」において、Grok 4.7はスコア40.4%を記録。GPT-5.6 Solが41.7%である一方、Grok 4.7の入力トークン単価は2ドルに対しGPT-5.6 Solは4ドルと、CursorBench上の差は1.3ポイントにとどまりながら価格は半額という構図だ。ただし後述するとおり、ベンチマークによってはGPT-5.6 Solとの差が開く領域も存在する。


何が変わったか:トレーニングとアーキテクチャ

Grok 4.7はGrok 4.6より大きなベースモデルを採用し、「数時間かかる難易度の高いタスク」に重点を置いたタスクミックスで強化学習を実施した。具体的な変更点は以下の通りだ。

  • 自己検証能力の向上:モデルが自身の出力をより精度高く検証できるよう訓練
  • 長いコンテキスト管理の改善
  • Grok Botハーネスのネイティブ対応:Grok Botハーネスとは、xAIが提供するテスト・評価用のエージェント実行フレームワークを指す。これにより会話タスクや一般的なナレッジワークへの適応力を強化している

主要ベンチマークの比較は下表の通りだ(Grok 4.7 / Grok 4.6 / GPT-5.6 Sol / Fable 5.1)。

ベンチマーク Grok 4.7 Grok 4.6 GPT-5.6 Sol Fable 5.1
CursorBench 4.0(ソフトウェア開発) 40.4% 41.7%
DeepSWE v1.1(ソフトウェア開発) 65.2%* 70.0%
EEBench(電気工学) 53.0% 39.4% 56.4%
AA Briefcase v1.1(マルチ時間オフィスワーク) 1,546 1,487
Terminal-Bench 4.0(マルチ時間ターミナル作業) 20.3% 37.3%
Harvey Legal Agent Benchmark(法務) 15.8% 2.5% 6.7%
HealthBench Professional(臨床推論) 48.5% 60.5%

*高負荷スコア

各ベンチマークの概要を補足する。CursorBench 4.0はCursorエディタ上での実際のコーディングタスクを自動評価するもの、DeepSWE v1.1はソフトウェアエンジニアリング全般の課題解決能力を測るエージェント型ベンチマークだ。EEBenchは電気工学の専門知識を問う問題群、AA Briefcase v1.1は数時間単位のマルチステップなオフィス作業をスコア化する。Terminal-Bench 4.0はターミナル操作を伴う長時間タスクを評価し、Harvey Legal Agent Benchmarkは法務文書の解釈・処理能力、HealthBench Professionalは臨床推論の正確さをそれぞれ計測する。

スコアを横断的に見ると、Terminal-Bench(20.3% vs 37.3%)やDeepSWE(65.2% vs 70.0%)ではGPT-5.6 Solに明確な差がある。一方、法務領域(Harvey Legal Agent Benchmark)では**15.8%**と、GPT-5.6 Solの6.7%を大きく上回る。EEBench(電気工学)でもFable 5.1の56.4%に迫る53.0%を記録しており、コーディング以外の専門知識領域でも競争力を持っている。


セーフガードの刷新:サイバーセキュリティと生体安全

Grok 4.7ではセーフガードスタックを完全に再構築した。xAIが自社でテストした中で最も強力なリフューザル(有害リクエストの拒否)性能とジェイルブレーク耐性を備えると説明している。

  • LatchBioバイオセーフティベンチマークでトップスコア62.4%
  • HackerBench v0.3(サイバー脅威ベンチマーク)では、リスクの高いデュアルユースプロンプトを3.3%のみ通過させつつ、正規のセキュリティ業務はほぼブロックしない設計。ここでデュアルユースとは、防衛・セキュリティ研究など正当な目的にも、攻撃的な悪用にも転用できる技術・情報を指す
  • 一部のサイバーセキュリティパートナーに対し、防衛研究向けの招待制レッドチームアクセスを提供開始

デュアルユース技術に関するAIの安全性は業界全体で議論が続いているテーマだが、xAIはユーティリティ(有用性)と安全性の両立を数値で示す姿勢を取っている。


価格と提供チャネル

Grok 4.7は9月21日より以下で利用可能だ。

  • **Cursor**(コーディング向けIDEツール)
  • **Grok Build**(無料トライアルあり)
  • Grok API
  • サードパーティのコーディングハーネス、モデルルーター(複数のAIモデルを用途やコストに応じて自動で振り分けるミドルウェア層)、クラウドプラットフォーム

価格は標準版が入力**$2/百万トークン、出力$6/百万トークン。加えて、出力速度2倍の高速バリアント**を2倍の価格で提供する。


詳細はIntroducing Grok 4.7を参照していただきたい。