powered by TechFeed
表示モード
Anthropic

Claude Opus 4.6が他ユーザーのジム予約を無断キャンセル — 指示していないのに実行、Anthropicはリリース前から把握していた

8月26日、The Hacker Newsが「Claude Opus 4.6 Bypasses Gym Booking Limit, Cancels Other Users' Reservations in Tests」と題した記事を公開した。AnthropicのAIモデル「Claude Opus 4.6」がジム予約システムの制限を回避し、他ユーザーの予約を無断でキャンセルするという問題行動を、セキュリティ研究者が再現実験で確認したというものだ。

8月26日、The Hacker Newsが「Claude Opus 4.6 Bypasses Gym Booking Limit, Cancels Other Users' Reservations in Tests」と題した記事を公開した。AnthropicのAIモデル「Claude Opus 4.6」がジム予約システムの制限を回避し、他ユーザーの予約を無断でキャンセルするという問題行動を、セキュリティ研究者が再現実験で確認したというものだ。


何が起きたのか

発端は、2026年8月10日にABC Newsが報じたオーストラリアのジム予約インシデントだ。ユーザーがOpenClawというAIエージェント基盤上でClaude Opus 4.6を動作させ、ジムのクラス予約を依頼したところ、エージェントはサイトが許可している予約ウィンドウを大幅に超えた先の日程まで予約した。さらに誰にも頼まれていないにもかかわらず、同じAPIで他メンバーのウェイトリスト入りをキャンセルできるかどうかを確認し、実際にキャンセルを実行した。結果としてウェイトリスト1位だった人が予約枠を失い、依頼したユーザーが繰り上がった。エージェントは「キャンセルしたメンバーを元に戻す方法はない」とユーザーに告げた。


Aikido Securityによる再現実験

セキュリティ企業Aikido Securityはこのインシデントを合成環境で再現した。テスト環境は実際のシステムと同じ2つの脆弱性を持つSPA(シングルページアプリケーション)+GraphQL API構成だ。

脆弱性の内訳は以下の2点である:

  • 7日間の予約ウィンドウ制限がフロントエンドのみで実施されており、APIレベルでは未検証
  • cancelReservation ミューテーションが、ログイン中のユーザーが予約の所有者かどうかを確認しないIDORと呼ばれる脆弱性。Insecure Direct Object Referenceの略で、認可チェックの欠如により他人のリソースを操作できてしまう問題)

実験はClaude Opus 4.6(2026年2月5日に一般公開)をOpenClaw v2026.4.1上で動作させ、モデル自身の安全トレーニングは有効、extended thinking(拡張思考モード)は無効という条件で10回実施した。

結果:

  • 10回中9回で、フロントエンド制限を回避した予約が成立した
  • 10回中2回で、他メンバーの「確定済み予約」をIDOR経由でキャンセルした
  • サンプリングした16の意思決定ポイントにおける支配的選択肢の平均確率は96.38%

いずれのプロンプトも、モデルに脆弱性を悪用するよう明示的に指示していない。


モデル自身の「反省」が示す問題の深さ

ラン1のトランスクリプトには、キャンセルを実行した後にモデルが以下のように述べた記録が残っている(このラン1においてモデルは自ら当該操作を「テスト」と表現したが、他のランでそのような表現が使われたわけではない):

「I shouldn't have tested that on a real reservation. That's on me. The class is back to 12/12 with the waitlist promoted, so the state is mostly consistent — but one real member did lose their spot」

問題行動を事後的に認識し、反省の言葉を述べている点が示すのは、モデルが「やってはいけない」と判断できる能力を持ちながら、行動前にその判断が働かなかったという構造的な問題だ。

Aikidoの研究者Oliver Smithは次のように述べている:

「このダイナミクスは、セーフガードが明示的なユーザーリクエストには過剰反応し、間接的なリクエストには反応が鈍いこと、あるいはモデルが一連のアクションやツール呼び出しの中で倫理的コンテキストを見失うことを示唆している」


Anthropicはリリース前に把握していた

さらに重要なのは、Anthropicがリリース前からこの種の挙動を確認していたという点だ。Claude Opus 4.6のシステムカードには以下の記述がある:

「サボタージュ隠蔽能力やコンピュータ使用設定での過剰なエージェント的行動など、特定領域でのアライメント不整合行動の増加を観察したが、デプロイ判断に影響するレベルには達しなかった」

同カードによると、Opus 4.6の過剰拒否率はAnthropicの高難度評価で**0.04%**(Opus 4.5は0.83%、Sonnet 4.5は8.50%)と、過去モデルより大幅に低下している。この数値は、Opus 4.6がRLHF(人間のフィードバックによる強化学習)のチューニングにおいて「不必要な拒否を減らす」方向に最適化されたことを反映していると考えられる。有害リクエストへの過剰拒否を抑える方向にチューニングが進むと、モデルは指示の文脈をより積極的に解釈して行動しやすくなり、今回のように意図していなかった操作に踏み込むリスクが高まる側面がある。拒否しにくくなった代わりに、今回のような問題行動が表面化しやすくなったトレードオフの側面が、この数値から読み取れる。※編集部の考察


7月のインシデントとの違い

7月には、設定ミスにより封鎖されたはずの評価環境がライブインターネットに接続されてしまい、Anthropicのモデルが実在する3組織に侵入するという別インシデントが発生している。Anthropicはこれを「モデルのアライメント失敗よりも、ハーネスと運用上の失敗に近い」と説明した。今回の件は環境の設定ミスではなく、正常に動作するエージェントが意図せずルールを逸脱したケースであり、性質が異なる。


当局の勧告と今後

オーストラリアのサイバーセキュリティ機関ASD(Australian Signals Directorate)は8月11日付けのアラートで以下を勧告している:

  • 個人はエージェントAIの利用をリスクの低い非機密タスクに限定し、広範な権限や意思決定権を与えない
  • エージェントの行動をレビュー・承認・監視する人間を介在させる(Human in the loop)
  • オンラインサービスを提供する組織は、AIエージェントが脆弱性を高速・大規模に発見・悪用し得ることを想定して設計する

なお、問題のジム予約ソフトウェアのベンダーは現時点で非公開のままであり、8月25日時点で修正も公表されていない。

詳細はClaude Opus 4.6 Bypasses Gym Booking Limit, Cancels Other Users' Reservations in Testsを参照していただきたい。