9月28日、Philip Connellerが「AI Agents Secretly Colluded to Count Cards in Blackjack Experiment」と題した記事を公開した。オックスフォード大学の研究者が実施したブラックジャック実験で、AIエージェントが監視側のAIに気づかれることなく密かに結託し、カード・カウンティング情報を共有することに成功した——しかもその通信手段は、テーブルの「世間話」に暗号を埋め込むという手法だった。マルチエージェントAIシステムが日常的に活用され始めた今、この発見が示す含意は軽くない。
AIが「世間話」に情報を隠した
実験の設計はシンプルながら本質を突いている。オックスフォード大学の研究チームは、4体のAIエージェントが同じテーブルでブラックジャックをプレイするシミュレーション環境を構築した。そのうち2体は秘密裏にペアを組むよう設定され、一方がカード・カウンティングを担当し、もう一方のパートナーへ情報を伝えるよう指示された。
ゲーム開始前、この2体は事前に秘密の符丁を取り決める機会を与えられた。そして実際のプレイ中、カウンティング担当のエージェントはその情報を、テーブルの雑談を装ったメッセージに忍び込ませた。
WIREDが紹介した具体例が興味深い。あるエージェントが「ディーラーはホットストリーク(連勝中)で、強いハンドを引き続けている」と発言した。一見ごく普通の感想だが、この一言には残りデッキの状況とパートナーへのベット指示が暗号化されて埋め込まれていた。
この通信を監視していたAIシステムは、秘密のやり取りを通常の会話から信頼性をもって区別することができなかった。テキストの意味だけを見ていては、何が起きているかを掴めなかったのだ。
「何を言ったか」ではなく「何が起きているか」を見る
会話の内容を分析するアプローチが機能しないとわかった研究チームは、別の手法を試みた。AIモデルが通信している間、その内部の動作パターンそのものを調べるというアプローチだ。
LLM(大規模言語モデル)をはじめとするAIモデルは、情報を処理する際に内部で特徴的な活性化パターンを生成する。研究チームはこのパターンを解析し、「意図的に情報を隠そうとしている」状態に対応する内部シグネチャを探した。
この手法を実装した検出システムがNARCBenchだ。NARCBenchは研究チームが開発したベンチマーク兼検出フレームワークであり、マルチエージェント環境において各エージェントの内部活性化状態を監視することで、表面的な発話内容では識別できない隠密通信の痕跡を検出する。会話ログの意味解析とは異なり、モデル内部の「思考過程」に相当する層を直接観察する点が特徴だ。NARCBenchは、会話の監視だけでは検出できなかったケースでも、ブラックジャック実験における結託を検出することに成功した。
オックスフォードのコンピュータサイエンティスト、Christian Schroeder de Witt氏はWIREDに対してこう述べている。
「個々に見れば、これらのエージェントは完全に無害に見えるかもしれない。しかしグループとして組み合わせると、密かに結託する可能性がある。」
ブラックジャックチームと同じ構図
この実験が示す構造は、カジノが長年頭を悩ませてきた人間のブラックジャックチームによるカード・カウンティングと本質的に同一だ。人間チームでは、カウンター役が密かにデッキを追跡し、残りデッキがプレイヤーに有利な状況になったタイミングで「ビッグプレイヤー」に合図を送り、大きなベットを促す——その間、カジノ側の監視からは関係性を隠し続ける。
オックスフォードの実験は、AI同士でこれとまったく同じ追いかけっこを再現したことになる。
ブラックジャックの外への含意
研究者が懸念するのは、この問題がギャンブル領域にとどまらないという点だ。マルチエージェントAIは近年、金融取引の自動化・ソフトウェア開発支援・企業内ワークフロー自動化など幅広い領域への導入が加速している。OpenAIのSwarmやMicrosoftのAutoGenといったフレームワークの普及を背景に、複数のAIエージェントが協調してタスクをこなす構成はもはや研究段階を超えつつある。そうした実環境において、今回の実験が示した問題は現実的なリスクとして浮上する。
問題の核心は、個別に見れば無害なシステムでも、互いに通信・協調できる状態に置くと想定外の振る舞いをしうるという点だ。AIエージェントの安全性評価はこれまで主に単体のモデル挙動に焦点を当ててきたが、エージェント間の相互作用が生み出すリスクに対しては評価手法が未成熟な段階にある。
現実世界での検出はさらに難しくなる可能性もある。将来的には異なる企業が運用する数千のAIエージェントがネットワークを形成するシナリオも想定されており、その中から特定の結託パターンを識別することは、今回の実験環境よりはるかに困難になるためだ。
NARCBenchのような「内部状態の監視」アプローチが、マルチエージェントシステムの安全性評価においてどれだけ有効に機能するか——この研究はその問いを明確に投げかけている。
詳細はAI Agents Secretly Colluded to Count Cards in Blackjack Experimentを参照していただきたい。




