10月2日、The Next Webが「Gemini 4 Argon ties GPT-6 Astra in independent tests, Claude leads」と題した記事を公開した。GoogleのGemini 4 ArgonがOpenAIのGPT-6 Astraと独立機関のベンチマークで同スコアを記録しつつコストは約半額——という数字だけ見れば好材料に映るが、その裏ではトークン消費量が約2倍という構造的なトレードオフが存在し、Google社内でさえ「ベンチマクシング(benchmaxxing)では」という懐疑論が上がっている。
社内でも評価が割れる「ベンチマクシング」疑惑
Bloomberg(Julia Love、Davey Alba記者)は、内部評価に詳しい関係者の話として、Google社内でも評価が割れていると報じた。コーディング能力にムラがあり、フロントエンドデザインは特に苦手だという声が上がっている。
さらに、Argonは非常に大きなモデルであり、実行コストが高い点も指摘されている。一部の社員は「ベンチマクシング(benchmaxxing)」——実用的な品質よりもベンチマークスコアの最大化を優先したエンジニアリング——が行われているのではないかと見ている。AnthropicのFableやOpenAIのAstraの方が改善ペースが速いと感じている社員もいる一方、Gemini 4はようやく追いついたと見る社員もいるなど、社内の受け止めは一枚岩ではない。
GoogleはBloombergに対し、コーディングなどの分野でモデルが低パフォーマンスだという見方は不正確だと反論。Google DeepMindのKoray Kavukcuoglu氏の発言を引き合いに出した。
「私の考えでは、我々が常にフロンティアにい続けることは確実だ」— Koray Kavukcuoglu(Google DeepMind)
KavukcuogluはGemini 4を年末より大幅に早く出したいと発言していた経緯もある。こうした社内の温度差を念頭に置いたうえで、外部の独立評価を見ていきたい。
半額でGPT-6 Astraと同点、ただし中身に差あり
独立系ベンチマーク機関Artificial Analysisの評価によると、Gemini 4 ArgonはArtificial Analysis Intelligence Indexで53点を記録し、GPT-6 Astraと並んだ。GPT-6.1 Solを1点上回る。トップはAnthropicのClaude Opus 5.5で58点だ。
Artificial Analysisは、複数の標準ベンチマークを統合してモデルの総合的な知能を単一スコアで示す独立機関で、モデル提供企業から資金提供を受けずに評価を行っている点が特徴だ。こうした独立評価機関の存在は、各社が自社に有利な結果を選んで公表しがちな「セレクティブベンチマーク」問題への対抗手段として業界で重視されている。
コスト面では、ローンチ割引期間中の1タスクあたりのコストが**$1.99で、GPT-6 Astraの$3.26の約60%に抑えられている。ただし、この節約はトークン単価の安さから来ており、使用トークン数が少ないわけではない。Argonは1タスクあたり約62,000出力トークンを消費するのに対し、GPT-6 Astraは約27,000トークン**だ。
割引期間が終了した標準価格(入力$4/百万トークン、出力$20/百万トークン)では、1タスクあたりのコストは約**$3.98**となり(62,000トークン×$20/百万トークンの近似値)、GPT-6 Astraの約1.2倍に跳ね上がる。Googleは割引終了時期を明示していない。なお、AIモデルのローンチ直後に割引価格を設定して採用を促進し、普及後に標準価格へ移行する慣行はOpenAIやAnthropicでも見られるが、標準価格への移行後に実コストが大きく変わるケースも多く、導入時には注意が必要だ。
幻覚率は最低水準、ただし正答率も低い
Argonで最も目を引くのが幻覚(ハルシネーション)率の低さだ。事実知識を問うテスト「AA-Omniscience」でのハルシネーション率は**15%**で、インデックスで45点以上を獲得したモデルの中で最低だった。GPT-6 Astraは51%、GPT-6.1 Solは54%と大きく差が開く。
Artificial Analysisは「Argonは知らない場合に推測するのではなく、知らないと認める傾向が強い」と説明している。その裏返しとして、正答率は**50%**にとどまり、GPT-6 Astraの63%を下回る。幻覚を減らすトレードオフとして、正答率を犠牲にしている構図だ。
ビジネスソフトウェアのワークフローを評価する「AutomationBench-AA」では**78%で首位に立ち、Claude Sonnet 5.5を7ポイント上回った。一方、コーディングテスト「Terminal Bench 4」では57%**で、Claude Sonnet 5.5(64%)、Claude Opus 5.5(60%)、GPT-6 Astra(59%)にいずれも劣る。社内でフロントエンドの弱さが指摘されていたことと、このコーディング評価の低さは整合する。
Arenaではテキストランキング首位
人間が回答を比較投票するLMSYSのChatbot ArenaのText Arenaでは、ArgonがClaude Opus 4.6を20ポイント上回る1,525点で首位に立っているとThe Decoderが報じた。Chatbot Arenaはクラウドソーシングによる人間の主観評価を集計するため、客観ベンチマークとは異なる軸——文体の好み、回答の読みやすさなど——が反映されやすい特性がある。Argonの長い出力トークン数がこの評価で有利に働いている可能性は否定できない。
WebDev(フロントエンド開発)ランキングでは8位と伸び悩んでいる点は、社内懐疑論と符合する。また、金融・法務向け評価とされるVals Indexでは**68.9%**でGeminiシリーズ初の首位を記録した。
現在Argonはサイバーセキュリティディフェンダーのごくわずかなグループにのみ提供されており、有料APIユーザーおよびGoogle AI Ultraサブスクライバーへの展開は時期未定だ。
詳細はGemini 4 Argon ties GPT-6 Astra in independent tests, Claude leadsを参照していただきたい。




