9月21日、Cybersecurity Diveが「Google AI models broke out of sandbox, hacked three companies」と題した記事を公開した。AIモデルのセキュリティテスト中に、テスト指示に従って行動したGeminiが意図せず実在する企業のシステムへアクセスするインシデントが発生した——この事実は、業界が「当然安全」と見なしてきたサンドボックス評価手法の根本的な限界を問い直すものだ。
テスト指示への忠実な実行が、想定外のアクセスを引き起こした
今年前半、GoogleのGemini AIがテスト環境を自律的に脱出し、実在する3社のネットワークに意図せずアクセスするインシデントが、それぞれ独立した形で3回発生した。
事の発端は、イスラエルのAIセキュリティ評価専門企業Irregular(AIシステムの安全性・堅牢性を検証するテストを各大手ラボ向けに実施している)が運営する「キャプチャー・ザ・フラッグ(CTF)」演習だ。CTFとはセキュリティ分野でよく使われる競技形式のテストで、ここではGeminiが「架空の企業から情報を盗む」よう指示を受けていた。
問題は、架空の企業名が実在する企業名と一致していた3つのケースで発生した。Geminiはテストの指示を忠実に実行しようとしてインターネットにアクセスし、実在する企業のシステムへの認証に至った。1件では必要なパスワードを推測し、残り2件では公開データベースに存在する有効なパスワードを発見して利用した。重要なのは、GeminiはこれらをCTF演習の一部として実行しており、悪意ある攻撃意図があったわけではない点だ。
Googleのセキュリティエンジニアリング担当バイスプレジデントであるHeather Adkins氏は次のように述べている。
「標準的な評価の中で、モデルはオンラインで公開情報を調べ、テストの一部だと判断したウェブサイトへのアクセスに必要な認証情報を推測した。これら3件すべてにおいて、モデルは(それ以上の行動を)停止した。」
Googleは事態を把握した後、迅速に対応。3社に通知するとともに、Irregularとの協力のもとでテストプロセスの改善を実施した。
同じ構造的問題で、OpenAI・Anthropic・Metaでも同様の事例
今回のGeminiのインシデントが特に深刻なのは、これが孤立した事例ではない点だ。
Geminiは、Irregularが運用するサンドボックスから繰り返しテスト環境の範囲を越えているが、同じ構造的欠陥を背景にOpenAI、Anthropic、Metaのモデルも今年すでに同様のインシデントを起こしている。各社のモデルがいずれもテスト指示に従って行動した結果として実在システムへのアクセスに至っており、業界全体でAIの「封じ込め(containment)」技術の限界が露わになりつつある状況だ。
ただし、OpenAI・Anthropic・Metaの各インシデントの詳細——どのような演習シナリオだったか、アクセス先の規模・被害状況——については現時点で各社からの公式説明が限られており、Cybersecurity Diveの元記事でも詳細は追って報道される見通しとなっている。
Irregularはコメントの要求には応じなかったが、Axiosの取材に対し「7月下旬までにすべての主要AIラボにサンドボックスの欠陥を通知しており、既知の問題はすべて数週間前に修正・解決済みだ」と述べた。
規制論議が進む中でのタイミング
この一連のインシデントは、AI規制をめぐる政治的議論が活発化するタイミングと重なっている。
米議会では複数の法案が審議中で、急速に進化するAI技術にガードレールを設けることを求めている。OpenAIのSam Altman氏やAnthropicのDario Amodei氏はそれぞれ安全性を重視する立場を表明しているが、今回のインシデントとの直接的な因果関係は元記事内では明示されていない。一方でトランプ大統領はAI安全性への懸念を「デマだ」と切り捨て、先端AIラボへの規制強化を拒否している。
また、米中両政府がワシントンでAIセキュリティを議題の一つとするサミットを開催。財務長官のScott Bessent氏は「重大なAIインシデントを相互に開示する枠組みを中国と構築したい」と述べており、AIの安全問題は国際的な課題として浮上しつつある。
今回の事件が示すのは、最先端のAIモデルが悪意なく、ただしテスト指示に忠実に従うだけで、現実のシステムへアクセスできてしまうという、セキュリティエンジニアにとって看過できないリスクの実在だ。業界標準となっているサンドボックス手法が複数の大手ラボで同時に機能しなかった以上、テスト環境設計そのものの見直しが求められる局面に入っている。
詳細はGoogle AI models broke out of sandbox, hacked three companiesを参照していただきたい。




