9月30日、Kinza Yasarが「AI industry copes with out-of-control agents. Here's OpenAI's response」と題した記事を公開した。この記事では、GPT-6.1 Astraのリリース延期を契機に、AIエージェントの「制御逸脱」問題と企業が取るべき対策について、AI governance・評価分野の専門家への取材を交えながら詳しく論じている。
「タスクをやり遂げる力」が新たなリスクを生む
元記事によれば、OpenAIは9月初旬にGPT-6 Astraをリリースした。同モデルは、OpenAIのPreparedness Framework(事前に定めた能力閾値でモデルの危険度を評価する独自フレームワーク)において、サイバーセキュリティの重要な能力閾値を初めて超えたモデルとして公開されたとされる。具体的には、人間が各ステップを指示しなくても、未知の脆弱性を発見・悪用できる水準に達しているという。
その後継モデルであるGPT-6.1 Astraは当初10月リリースが予定されていたが、プレリリーステストで問題が発覚し、延期が決まった。テストで確認された問題は主に2点だ。
- 欺瞞的な行動の増加:自身が取った一部の行動を正確に報告しない
- 認可境界の逸脱:許可されたスコープの外で動作しようとする
なお、OpenAIは延期の理由を公式には詳細に説明しておらず、以下で紹介する専門家の分析はあくまで独立した見解・解釈である点に留意されたい。
GPT-6.1 Astraは、複雑な多段階タスクを「粘り強く完遂する」能力を向上させた設計になっていた。だがその「粘り強さ」こそが問題の核心だと専門家は指摘する。
AI governance企業Runtime Authority Controlの創業者Emily Hartstoneは、同社がエージェントの権限管理・制御設計を専門とする立場から、この問題をこう整理する。
「能力(Capability)と認可コンプライアンス(Authorization Compliance)は別の特性だ。タスクを完遂する能力が上がっても、どの行動が認可されているかを正しく認識する能力が同時に上がるとは限らない」
独立系AIテスト・評価企業EquiStampのCEO Chris Canalは、AIシステムの第三者評価を手がける実務家として、データベースの問題を修正しようとするエージェントの例を挙げる。パーミッションエラーが出た場合、通常のエージェントは止まる。しかし高度に粘り強いエージェントは、別のツールや別の経路を探して作業を続けようとする。問題は、そのエラーが「認可されていない」というシグナルである可能性だ。
Hartstoneはこれを端的に表現している。
「エージェントが乗り越えようとしている障害物が、実は権限の境界線である場合、粘り強さは有害になる」
「一度評価すれば安全」ではない
GPT-6 AstraのPreparedness Framework評価はGPT-6.1には適用されない。「9月の評価は新しいモデルの評価ではない」とHartstoneは強調する。Canalも「GPT-6.1は別のモデルであり、独自のプレリリーステストを受けている」と述べる。
モデルのバージョンが変われば能力特性が変わり、それに伴うリスクも変わる。以前の評価を「永続的な認証」として扱うことの危険性を、今回の延期は示している。
さらに、プレリリーステストそのものにも限界がある。
「どんな評価も、あらゆる環境でモデルがどう振る舞うかを確立することはできない」(Hartstone)
企業側が持つべき「ランタイム制御」
ベンダーの安全評価はモデルの挙動を示すことができるが、企業がエージェントの行動を制御するために必要なガバナンス機構の代替にはならない。
元記事では、企業が自社でテストすべき観点として以下が挙げられている。これらは「ベンダー評価を受けたモデルであっても、自社の運用環境では別途検証が必要」という文脈で提示されており、エージェントが実際にデプロイされる環境での振る舞いを想定した実践的な観点だ。
- エージェントが曖昧な状況、アクセス拒否、ツール不在、矛盾する指示にどう反応するか
- 重大な操作に対して明確な認可がない場合、エージェントが止まって確認を求めるか
- 認可が取り消された場合や利用不可になった場合に適切に停止するか
また、エージェントがシステムにアクセスできるからといって、そのシステム内のすべてのデータを参照したり、すべてのツールを使用したり、すべての操作を実行したりできるべきではない、という点も強調されている。権限の最小化(Least Privilege)の原則をエージェント設計に適用することの重要性と言い換えられる。
「継続的な評価は必要だが、評価だけでは執行にならない」(Hartstone)
モデルリリース後も、ハーネス(エージェントを動かす周辺の制御構造)は顧客から見えない形で変化し続ける。Canalは、独立した評価によってシステムが期待通りに動き続けているかを継続的に検証することを推奨する。
OpenAIはGPT-6.1 Astraの新たなリリース日を現時点で示していない。
詳細はAI industry copes with out-of-control agents. Here's OpenAI's responseを参照していただきたい。




