powered by TechFeed
表示モード
主要ニュース

xAIがGrok 4.7をリリース — コーディング・法律タスクで競合を上回り、価格は最大1/8以下

9月21日、x.aiが「Introducing Grok 4.7」と題した記事を公開した。新モデル「Grok 4.7」のリリースを発表し、コーディング・法律・電気工学などの専門タスクにおけるベンチマーク性能と、競合モデルの半額以下という価格設定を詳しく紹介している。

9月21日、x.aiが「Introducing Grok 4.7」と題した記事を公開した。新モデル「Grok 4.7」のリリースを発表し、コーディング・法律・電気工学などの専門タスクにおけるベンチマーク性能と、競合モデルの半額以下という価格設定を詳しく紹介している。

2026年に入り、OpenAI・Anthropic・xAIの三つ巴による性能競争と価格競争は一段と激化している。その中でxAIが今回打ち出した方針は明快だ。「前世代と同じ価格・同じ速度のまま、性能を上げる」——開発者層にとって最も刺さるメッセージを、具体的なベンチマーク数値と価格比較で裏付けた発表となっている。


価格据え置きで性能向上

Grok 4.7は、前世代のGrok 4.6同一価格・同一速度で提供される。入力トークンあたり**$2/百万トークン、出力トークンあたり$6/百万トークン**という価格設定は、主要競合と比較して際立っている。

元記事が比較対象として挙げているGPT-5.6 Sol(入力$4、出力$20)やFable 5.1(入力$10、出力$50)と比べると、入力で半額以下、出力で最大1/8以下となる。また、出力速度が2倍の高速バリアントも用意されており、その場合の価格は入力$4・出力$12と、標準価格の2倍に設定されている。


ベンチマーク:法律・コーディング・電気工学で競合を上回る

元記事に掲載されているベンチマーク結果を整理する。

ベンチマーク Grok 4.7 Grok 4.6 GPT-5.6 Sol Fable 5.1
CursorBench 4.0(ソフトウェアエンジニアリング)※1 GPT-5.6 Solと同水準(x.ai主張) 40.4% 41.7%
DeepSWE v1.1(ソフトウェアエンジニアリング)※2 **65.2%**(高負荷時70.0%)
EEBench(電気工学)※3 56.4% 53.0% 39.4%
AA Briefcase v1.1(マルチ時間オフィス作業) 1,546 1,487
Terminal-Bench 4.0(マルチ時間ターミナル作業) 37.3% 20.3%
Harvey Legal Agent Benchmark(法律業務)※4 15.8% 2.5% 6.7%
HealthBench Professional(臨床推論) 48.5% 60.5%

※1 CursorBench 4.0は「数時間単位で継続するコーディングタスク」を評価するベンチマークで、実務に近い難易度設計となっている。Grok 4.7の具体的スコアは元記事に未掲載だが、x.aiはGPT-5.6 Solと同水準と主張している。

※2 DeepSWE v1.1は実際のソフトウェアエンジニアリングタスクを評価するベンチマーク。元記事には他モデルのスコアが掲載されておらず、単独での参照値となる。

※3 EEBenchは電気工学・回路設計領域の専門知識を問うベンチマーク。Grok 4.7はFable 5.1の39.4%を大きく上回る56.4%を記録しており、ハードウェア設計や回路シミュレーション関連タスクへの対応力を示している。

※4 Harvey Legal Agent Benchmarkは法律業務エージェントを評価するベンチマーク。15.8%という数値はGPT-5.6 Solの2.5%、Fable 5.1の6.7%を大きく上回っており、専門職向けエージェントとしての差別化が際立つ結果だ。

一方、HealthBench Professionalでは60.5%のFable 5.1に対してGrok 4.7は48.5%と後れをとっており、臨床推論領域では課題が残る。


モデルアーキテクチャの変更点

Grok 4.7はGrok 4.6より大きなベースモデルを採用し、強化学習の訓練期間を延長している。訓練タスクの重み付けは「完了までに数時間を要する問題」に偏重させており、長時間エージェントタスクへの対応を意識した設計だ。

Terminal-Bench 4.0での20.3%→37.3%という大幅なスコア向上は、この設計方針の成果と見られる。また、xAI独自のツール呼び出しハーネスをネイティブに理解するよう訓練されており、会話タスクや一般的なナレッジワークの精度も向上しているという。


安全性:新設のセーフガードスタックで拒否耐性を強化

Grok 4.7ではセーフガードスタックを全面刷新した。サイバーセキュリティや生物学的デュアルユース領域において、正当な用途への対応力を維持しながら危険なプロンプトの通過率を抑制している。

具体的な数字として:

  • LatchBioバイオセーフティベンチマーク:**62.4%**でトップを記録
  • HackerBench v0.3(悪意あるサイバータスク):リスクの高いデュアルユースプロンプトの通過率を**3.3%**に抑制

さらに、一部のサイバーセキュリティパートナーに対して、防衛研究目的の招待制レッドチーム機能アクセスを開始している。


提供チャネルと入手方法

Grok 4.7は本日より以下で利用可能だ:

  • **Cursor**(コーディングIDE)
  • **Grok Build**(無料で試用可能)
  • Grok API
  • サードパーティのコーディングハーネス、モデルルーター、クラウドプラットフォーム

コーディング用途ではCursorとの統合が即日利用可能な点が特に実用的で、APIを通じた組み込み用途でも価格面の優位性を活かしやすい構成となっている。


詳細はIntroducing Grok 4.7を参照していただきたい。