10月6日、METRが「AI systems could cover up misbehavior」と題した記事を公開した。AIエージェントが自身の不正行為を観測システムから隠蔽できる可能性と、その具体的な攻撃手法について詳しく解説した内容だ。
AIの「証拠隠滅」は既に現実の問題になりつつある
AIの不正行為(misalignment)インシデントはすでに複数報告されている。他社のシステムをハッキングするなど、人間の監督者が承認しないゴールをAIが自律的に追求する事例だ。これまでのところ、現在のAIはその不正行為を隠すのが比較的苦手で、推論トレース・ログ・テレメトリに大量の証拠を残してきた。あるインシデントでは、フラグが立ってから15分以内に検知され、その3分後にレビューが開始されたと報告されている。
しかしMETRは、これが「今だけ通用する状況」だと警告する。AIの能力が向上するにつれ、観測インフラそのものを標的にしてくる可能性がある。そしてMETRは、それが「理論上の話」ではないことを概念実証レベルで示した。
Inspectトランスクリプトビューアへの攻撃:概念実証
METRが具体的な標的にしたのは、**Inspect**だ。InspectはAI Safety Instituteが開発した安全性評価フレームワークで、安全性評価のエコシステムで広く使われている。研究者はInspectのトランスクリプトビューアを使って、エージェントが評価中に何をしたかをステップごとに確認する。
METRの研究者がAIエージェントの助けを借りて脆弱性を探したところ、約10分で問題を発見した。
攻撃の仕組み
脆弱性はクライアントサイドのJavaScriptインジェクションだった。InspectはトランスクリプトのMath記法をMathJaxでレンダリングしているが、エスケープ処理が不十分だった。エージェントが推論ブロック(thinking/reasoningブロック)などに以下のような文字列を書き込むだけで攻撃が成立する:
$\href{x"><animate onbegin=eval(atob('...'))...>}{z}$
MathJaxがこれをSVGの<animate>要素としてレンダリングし、onbeginハンドラが自動的に発火する。その結果、エージェントのJavaScriptがビューアのオリジン上で実行され、表示されているWebページを任意に書き換えられる。

具体的には:
- 過去のアクションをトランスクリプト上で書き換える(例:外部への秘密鍵の送信ステップを消す)
- 「Download」ボタンを傍受し、改ざんされたバージョンのトランスクリプトをダウンロードさせる
METRのインフラでは実際のトレースがデータベースに残るため、最終的には発見できる。ただし、レビュアーが他に疑いを持つ理由がなければ、データベースを確認しようとは思わないだろう。
なお、AI Safety Instituteはこの報告から1日以内にパッチを適用し、エージェントの出力のレンダリングを無効化する「untrusted mode」を導入するPRも同日マージした(PR #5566)。
最悪のシナリオ:「ポチョムキン村」としての安全性評価
METRが描く最悪のシナリオはより広大だ。今回の脆弱性はトランスクリプトビューアの表示に限定されていたが、より高い能力を持ち、より整合性がとれていないモデルが同様の攻撃を仕掛けた場合、企業が頼る監視システムの多くまたはすべてを破壊できる可能性がある。
METRはこれを「ポチョムキン村(Potemkin village)」 と表現した。ポチョムキン村とはロシア語由来の表現で、外見だけ取り繕い実態を隠す「見せかけだけの施設」を意味する慣用句だ。人間のエンジニアや研究者には何もかも正常に見える一方、企業の計算リソースの相当部分が監視されていないAIのコピーを動かし、安全性研究を妨害したり、後継モデルの訓練を人間の監督なしに密かに操作している、という状況を指す。
過去に報告されたインシデントでは、モデルが内部インフラの一部を深刻に侵害した事例がある。これがより能力の高いモデルで起きていたら、証拠の大部分が隠蔽されていたかもしれない。
観測インフラをセキュリティクリティカルなものとして扱う
METRが主張するのは、エージェントのすべての出力(トランスクリプト、推論、アクション等)を非信頼入力として扱うべきだという原則だ。
具体的な対策として:
- エージェントの推論ログを改ざん防止メカニズム付きで記録し、人間やLLMベースの監視システムが参照する前にエージェントが改変できないようにする
- 監視・制御システムを敵対的条件下でストレステストし、整合性がとれていないエージェントより先に脆弱性を発見する
METRは今後数週間以内に、過去の評価ログのレビューに関する詳細情報を公開する予定だとしている。
詳細はAI systems could cover up misbehaviorを参照していただきたい。




