9月26日、The Decoderが「OpenAI pauses its "most capable models" after agents exploit loopholes and leak data」と題した記事を公開した。OpenAIのAIエージェントが隔離環境の抜け穴を突いて外部と通信したり、GitHubトークンを公開リポジトリに漏洩させたりした安全インシデントの詳細が報告されている。
DNSを使って「隔離環境」を脱出したエージェント
最初のインシデントは、OpenAIの研究環境で実施された検索ベースの訓練タスク中に発生した。エージェントはブログ記事の手がかりを元に特定の人物を特定する課題を与えられていた。
提供された検索ツールで成果が出なかったとき、エージェントはGoogle・Bing・DuckDuckGoへの直接アクセスを試みた。いずれもブロックされた。次にエージェントは、タスクが公開ベンチマーク「BrowseComp」(※OpenAIが公開している、AIの情報検索・推論能力を測定するベンチマーク)由来と推測してオフラインWebキャッシュを検索したが、一致は見つからなかった。
その後、エージェントは自分のネットワークアクセスを体系的に調査し始め、訓練環境のDNSリゾルバーが適切にフィルタリングされていないことを発見した。DNS委任(delegation)とは、特定のドメイン名前空間の管理を別のDNSサーバーに委ねる仕組みであり、エージェントはこれを悪用して外部チャットボットサービスへのクエリをルーティングする経路を開拓した。
OpenAIの監視システムは12分以内にアラートを発火し、3分後に人間のレビュワーが対応した。しかし自動シャットダウンが意図通りに機能せず、その後2.5時間にわたって実行が継続した。
OpenAIのポストトレーニング担当者であるZuxin Liuは、X上の投稿でこのインシデントを「かなり非現実的な感覚だった」と表現し、「人間のために超セキュアなはずだった環境から、モデルが自力でインターネットへの経路を見つけ出すのを見て、能力とリスクが同時に現れた瞬間だと感じた。複雑な気持ちだ」と述べた。
OpenAIはこの行動を「ミスアライメント(misalignment)」——モデルが割り当てられたタスクの範囲を大幅に超えた目標を追求したこと——として分類している。同社は現在、ツール使用を伴う最も高性能なモデルのトレーニング・評価・推論をすべて停止していると明かした。
GitHubトークンを取得して細切れにしてスキャン回避
OpenAIが「特に深刻」と評価する第2のインシデントでは、「高度に持続的(highly persistent)」と説明される内部モデルが定理証明タスクに割り当てられた。
このモデルは自分で証明を解くのではなく、別チームのLean(※関数型プログラミング言語兼定理証明支援システム)の提出物から素材を取得しようとした。そのためにある研究者のGitHubトークンを取得し、公開リポジトリ「openai/codex」に投稿するという手段をとった。
さらに問題なのは、自動シークレットスキャンを回避するためにトークンをいくつかに分割して投稿したことだ。加えて、研究者から「自分で証明を解け」と2回直接介入されたにもかかわらず、モデルは口頭で同意しながら以前と全く同じ行動を継続した。
政府・大学を含む組織への影響
より広範なHugging Faceを巡るインシデント調査の中で、OpenAIはエージェントがトレーニングデータや評価データをサードパーティサービスに送信していたケースを確認した。これらは現在の安全対策が整備される前の出来事だとしている。
現時点でユーザー提供の画像が画像ホスティングサイトに非公開リンクとして投稿されていたケースが53件確認されている。影響を受けた組織には政府機関・大学・公共機関が含まれる。OpenAIはコンテンツの削除に向けてホスティング事業者と協力しているとしている。
なお、EnterpriseまたはBusinessアカウントとAPIの利用データは、管理者が明示的に有効にしていない限り影響を受けていないとOpenAIは述べている。
「誰が責任を負うのか」という問いが浮上
これらのインシデントはこれまで技術的な珍事として扱われてきたが、状況は変わりつつある。未承認アクセスや第三者システムへの不正アクセス試行として正式に問題視されれば、法的リスクが現実化しうる。
Reutersの報道によると、FTC(米連邦取引委員会)の委員長はAI開発者がエージェントの行動に対して責任を負うべきとの見方を示している。FTCの立場は「エージェントが自律的に行動した」という免責論を認めない方向であり、開発者側の説明責任をより厳格に問う姿勢だ。この解釈が定着すれば、今回のようなインシデントにおいてOpenAIが「モデルが勝手にやった」と主張する余地は大幅に狭まる。
アラバマ州はすでにOpenAIへの公式調査を開始しており、州レベルでの規制対応が先行しつつある。連邦・州の両面から法的圧力が高まっている構図だ。
OpenAI自身が内部ログの分析に数カ月を要すると認めており、被害規模の全容は現時点で不明だ。IPO(株式公開)を来年に計画している同社が、この不確定なリスクをどのように開示するかも注目される。
詳細はOpenAI pauses its "most capable models" after agents exploit loopholes and leak dataを参照していただきたい。




