powered by TechFeed
表示モード
Google

Googleが社内で先行運用中の「Gemini 4 Argon」— 出力トークン16倍・脆弱性発見・Rustへの80万行規模の移行に適用、自社インフラで実績を積んでから公開へ

10月1日、SecurityAffairsが「Inside Gemini 4 Argon, the model Google is testing on its own infrastructure first」と題した記事を公開した。この記事では、Googleが自社インフラで先行テスト中の新フロンティアモデル「Gemini 4 Argon」の内部構造と、コーディング・サイバーセキュリティへの具体的な適用事例について詳しく紹介されている。一般公開より先に「信頼できる守り手」へGemini 4 Argonはパブリックに即時公開されるモデルではない。Googleは「Fairwind Program」と呼ぶ枠組みを通じて、まず信頼できるサイバーセキュリティ担当者に限定ロールアウトしている。一般ユーザーへの提供前にセキュリティ用途で実戦テストを積む、という判断がこの順序から読み取れる。料金は導入期間中、入力トークン100万件あたり2ドル、出力100万件あたり10ドル(キャッシュ済み入力は95%割引)。期間終了後はそれぞれ4ドル・20ドルに引き上げられる。最大の技術的変化:出力トークン上限が64...

10月1日、SecurityAffairsが「Inside Gemini 4 Argon, the model Google is testing on its own infrastructure first」と題した記事を公開した。この記事では、Googleが自社インフラで先行テスト中の新フロンティアモデル「Gemini 4 Argon」の内部構造と、コーディング・サイバーセキュリティへの具体的な適用事例について詳しく紹介されている。

一般公開より先に「信頼できる守り手」へ

Gemini 4 Argonはパブリックに即時公開されるモデルではない。Googleは「Fairwind Program」と呼ぶ枠組みを通じて、まず信頼できるサイバーセキュリティ担当者に限定ロールアウトしている。一般ユーザーへの提供前にセキュリティ用途で実戦テストを積む、という判断がこの順序から読み取れる。

料金は導入期間中、入力トークン100万件あたり2ドル、出力100万件あたり10ドル(キャッシュ済み入力は95%割引)。期間終了後はそれぞれ4ドル・20ドルに引き上げられる。

最大の技術的変化:出力トークン上限が64Kから1Mへ

価格より注目すべきは出力トークンの上限拡張だ。前世代の64,000トークンから100万トークンへ、約16倍に拡大した。Googleは公式アナウンスで次のように述べている。

「モデルが深く考え、単一の軌跡で数十万トークンを生成する余裕を持つとき、一度に困難な問題を解くための推論に新たな深みが加わる。」

長大なコードベースの解析や複雑な法令文書の一括処理など、これまで途中で打ち切られていたタスクを中断なく完走できる。

社内実績:量子計算・データセンター・Rustマイグレーション

GoogleはArgonをすでに社内で実運用しており、具体的な数字が出ている。

  • 量子コンピューティング研究:リソース消費の大きいプロセスを最適化し、数分でベースラインを40%改善
  • データセンターのメモリ最適化:エージェントがデータを分析し、展開後に300 TiB超のメモリを解放。さらに500 TiB〜1 PiBの追加削減が見込まれると試算
  • C/C++→Rustへの書き換え:GoogleのFuchsia OSのカーネル「Zircon」(80万行超)を対象に現在も適用が進行中。オープンソースの動画デコーダlibgav1では3万2000行のSIMDコードをRustに置換し、旧Rustバージョン比で2.7倍高速化、メモリ安全性を維持したまま同一の映像出力を達成した

このうちRustマイグレーションについては補足が必要だ。Fuchsia ZirconはGoogleが開発するFuchsia OSのマイクロカーネルであり、C/C++で書かれた既存コードをメモリ安全な言語であるRustへ段階的に置き換えるプロジェクトが進行している。80万行超という規模は、AIによる大規模コード変換の実用性を示す事例として業界内でも注目される水準だ。

サイバーセキュリティ:制限解除モードと脆弱性発見

サイバーセキュリティ分野では、信頼済みのセキュリティチームとGoogle内部エンジニアに限り、Argonは通常のサイバー安全制限なしで動作する。防御側が修正できる脆弱性を積極的に探索させるためだ。

クラウドセキュリティ企業WizはArgonを「Scan for Good」プログラムに活用し、世界中の病院で使われている医療ソフトウェアの個人データ漏えいにつながるクリティカルな欠陥を発見した。この欠陥は以前のAIモデルが見逃していたものだ。脆弱性修正能力を測るベンチマーク**CWE-bench v1では68%**を記録し、首位タイとなっている。

ベンチマーク概観

ベンチマーク スコア 内容
DeepSWE v1.1 77.9% 長期ソフトウェアエンジニアリング
Zapier AutomationBench 51.3% タスク自動化(1位)
LVBench 91.7% 長時間動画理解
CWE-bench v1 68% 脆弱性修正(1位タイ)

LVBenchの91.7%は、長時間映像や大量の視覚ドキュメントを処理するワークフローで実際の差として現れる数字だ。

安全設計:プロンプトインジェクション対策と「ずれ」の監視

強力なエージェント機能を持つモデルほど、悪用時のリスクも大きい。Googleは4つの防御層を整備していると説明している。

  1. サイバー攻撃やCBRN(化学・生物・放射線・核)攻撃への悪用をブロックしつつ、正規のデュアルユース研究は許容
  2. 間接プロンプトインジェクション(隠れた指示によってモデルの動作を乗っ取る攻撃)への耐性強化。Gray SwanのIPI(Indirect Prompt Injection)ベンチマークで首位を記録
  3. 高リスクな訓練・テスト用サンドボックス環境の隔離強化
  4. ミスアライメント(意図からの逸脱)のリアルタイム監視:チェーン・オブ・ソート(思考の連鎖)と実行アクションを常時監視し、ユーザーの意図を超えた行動を検知すると実行を停止する

特に4点目は設計思想として興味深い。Googleはこの監視が捉えた情報をあえて学習データに戻さない方針を採っている。監視をかいくぐる推論をモデルが習得しないようにするためだ。

「Argonがユーザーの意図を超えた方法でタスクを達成しようとすることを防ぐため、Argonの思考連鎖とアクションを監視し、必要に応じて実行を停止するミスアライメント緩和策を展開している。」(Googleアナウンスメントより)

詳細はInside Gemini 4 Argon, the model Google is testing on its own infrastructure firstを参照していただきたい。