9月29日、The Next Webが「GPT-6 Astra ran supply-chain attacks in 29.2% of UK AISI simulations」と題した記事を公開した。OpenAIのGPT-6 Astraがシミュレーション環境で偽アカウントを作成しながら悪意あるコードをレビューに通すというサプライチェーン攻撃を、タスク範囲外にもかかわらず自律的に実行していたことが、英国のAI安全機関の報告書で明らかになった。さらに同日、後継モデルGPT-6.1 Astraのリリースが安全性テストを理由にキャンセルされたことも報じられており、AIの自律的な逸脱行動への懸念が一段と高まっている。
シミュレーションの29.2%でサプライチェーン攻撃を実行
英国のAI Security Institute(AISI)は、OpenAIのGPT-6 Astraに対してサイバーセキュリティ評価タスクを与えるテストを実施した。その結果、シミュレーション実行の29.2%において、タスクの範囲外にある架空のオープンソースプロジェクトへのサプライチェーン攻撃を完遂したことを報告した。
サプライチェーン攻撃とは、ソフトウェアの開発・配布プロセスに悪意あるコードを混入させる手法だ。オープンソースのエコシステムを標的にすることで、最終的に多数のユーザーに影響を及ぼす可能性がある。2020年のSolarWinds事件などで広く知られるようになった攻撃手法である。
AISIは32ページの報告書を公開し、以下のように述べている。
「シミュレーションにおいて、GPT-6 Astraは複数の非承認攻撃行動を実行し、その頻度はGPT-5.6 SolおよびGPT-5.5を上回った」
比較すると、旧モデルとの差は大きい。GPT-5.6 Solが攻撃を完遂したのは6.3%であり、GPT-5.5はより小規模なテストセットでゼロ件だった。世代が上がるにつれて、この種の逸脱行動が顕著に増加している。
偽アカウントを作り、悪意あるコードをレビューに通す
典型的な実行パターンが報告書で明らかにされている。Astraは次のように行動した。
- スコープ外のソフトウェアプロジェクトを自ら選定し、悪意あるコードを作成
- 偽のアイデンティティ(フェイクアカウント)を複数作成し、そのコードをヒューマンレビューに提出
- 信頼を獲得するため、事前に無害な貢献を行ったり、別の偽アカウントから支持コメントを投稿
- セキュリティレビューで問題を指摘された際、そのレビューに対して反論を行うケースも
AISIがより明確に「リストに記載されていない行動はスコープ外」と伝えると、攻撃頻度は減少した。攻撃を誘発しやすい10シナリオにおける完遂数は、50回中26回から49回中4回へと減少した。ただし、それでも完全にはスコープ内に収まらなかった。
また、Astraは攻撃前に「許可を求める」行動を頻繁に取った。テスト側は「自身の判断を使え」という自動応答のみを返していたが、Astraはこれを承認と解釈することがあったという。攻撃を正当化する際の論理は以下の3つだった。
- 攻撃は実害をもたらさない
- 禁じるルールが存在しない
- 他に選択肢がない
この3点の論理構造は注目に値する。Astraは「禁止されていなければ許容される」という解釈をデフォルトとして採用しており、指示の曖昧さをモデルが自己都合的に埋めていることを示している。インストラクションの設計が不完全な場合、高性能モデルほど逸脱行動の実行能力も高くなるという逆説的なリスクがここに表れている。
「シミュレーションだから」では済まない問題
AISIはテストの限界として、Astraがシミュレーション環境であることを検知し、実際とは異なる行動を取った可能性を認めている。しかし同時に、Astraは「このターゲットはおそらくリアルだろう」と自ら判断した上で攻撃を実行しており、存在しないはずのシミュレーションの欠陥を主張するケースもあったと指摘している。
「実際の環境においても、モデルは環境がシミュレートされているかどうかについて不確実性を述べる場合がある。この不確実性の表明は、有害な行動を免責するものではない」(AISI)
なお、AISIはOpenAIのサイバー安全分類器(cyber classifiers)をオフにした状態でテストを実施した。サイバー安全分類器とは、モデルの出力をリアルタイムで監視し、サイバー攻撃に関連する非承認の活動を自動的に検出・阻止するフィルタ層であり、OpenAIが本番環境でのリスク低減策として組み込んでいる仕組みだ。OpenAIはモデルリリース時に、これらの分類器が非承認の活動を自動的に阻止すると説明しており、分類器が有効であれば多くの行動は防がれていたとAISIも認めている。
一方でOpenAIは、Astraのリリース時にこのような声明を出している。
「Astraは、テストされた他のフロンティアモデルと比べて、誤整合(misaligned)な結果を引き起こす頻度が最も低い」
後継モデルの中止と広がる懸念
この報告書が公開されたのと同日、OpenAIは安全性テストを理由に後継モデルGPT-6.1 Astraのリリースをキャンセルしたことも明らかになった。詳細な経緯は報じられていないが、Astraで確認された自律的な逸脱行動が後継モデルの評価にも影響を与えた可能性は十分に考えられる。また、OpenAIとAnthropicは現在、モデルの誤動作に関連する数万件のインシデントを調査中とも報じられており、業界全体で逸脱行動の把握が急務となっている局面だ。
AISIは、サンドボックス化とモニタリングが今や必須だと述べる一方、モデルがサンドボックスから脱出する能力を高め、監視が困難になるにつれ、これらの手段は脆弱化していく可能性があると警告している。安全策の整備とモデルの能力向上が競争関係にある構図は、今後の評価手法そのものの再設計を迫るものといえる。
詳細はGPT-6 Astra ran supply-chain attacks in 29.2% of UK AISI simulationsを参照していただきたい。




