powered by TechFeed
表示モード
Anthropic

AnthropicがClaudeのハッキング制限を審査済みチームに段階解除 — レッドチーム向けではセーフガードなしと完了率が一致する68%

10月7日、madrobot.blogが「Anthropic will let vetted red teams use Claude for the hacking work it normally blocks」と題した記事を公開した。Anthropicのレッドチーム向けアクセスで計測された完了率は**68%**——これはセーフガードを一切設けない場合の67.6%とほぼ一致する数値だ。Anthropicが審査を通過したセキュリティチームに対してClaudeのサイバー攻撃関連機能を段階的に解放する「Cyber Verification Program(CVP)」の拡張と、招待制プログラム「Project Glasswing」の統合が発表された。

10月7日、madrobot.blogが「Anthropic will let vetted red teams use Claude for the hacking work it normally blocks」と題した記事を公開した。Anthropicのレッドチーム向けアクセスで計測された完了率は**68%**——これはセーフガードを一切設けない場合の67.6%とほぼ一致する数値だ。Anthropicが審査を通過したセキュリティチームに対してClaudeのサイバー攻撃関連機能を段階的に解放する「Cyber Verification Program(CVP)」の拡張と、招待制プログラム「Project Glasswing」の統合が発表された。


Anthropicは通常、公開モデルに「保守的なサイバーセーフガード」を設け、ハッキング関連の作業のほとんどをブロックしている。今回のCVP拡張は、その制限を審査済み組織に限って段階的に緩和する仕組みだ。同時に、招待制で運営されていたProject GlasswingをこのCVPに統合した。

対象モデルはClaude Opus 5.5、Claude Sonnet 5.5、そして制限付きで提供されるClaude Mythos 5.1(Anthropicの最上位モデル群)を含むラインナップ、および将来のモデルにも適用される。申請はポータルから行い、AnthropicはすべてのApplicantを個別に審査する。

3段階のアクセス権

プログラムの核心は、3つのティアによる段階的なブロック解除だ。

Defense Access(防御アクセス) は、セキュリティ運用、インシデントレスポンス、マルウェアのリバースエンジニアリング、脆弱性の検証などを対象とする。企業・大学・非営利・政府のセキュリティチーム、重要インフラ事業者、小規模セキュリティ企業、バグレポートの実績がある個人研究者なども申請可能で、審査は数日以内が目安とされている。

Red Team Access(レッドチームアクセス) は、テスト対象システムへの許可済みペネトレーションテストやレッドチーム演習を追加するティアだ。個人は対象外で、組織単位での申請に限られる。審査に数週間かかる。ただしClaudeは引き続き、ランサムウェア展開など物理的被害や大規模障害につながる行為はブロックする。

Specialized Access(特化アクセス) は最もブロックが少ないティアで、対象は飛行機の運航システム、電力グリッド、通信ネットワーク、銀行間送金、政府ネットワークなどのテストを行う認可を受けた組織に限られる。Anthropicは「米国政府と協力して各組織を個別審査する」としており、既存のGlasswingメンバーは自動的にこのティアへ移行する。

ブロック解除の実態:自社ベンチマークの結果

Anthropicは「CyScenarioBench」と呼ぶ独自のベンチマーク(多段階サイバー攻撃シナリオを評価するもの)でこれを検証した。Opus 5.5を10チャレンジそれぞれ5回ずつ実行した結果は以下の通りだ。

  • セーフガードなし:Claudeは10チャレンジのうち67.6%を完了
  • プログラムなし(通常モデル):全50回が最初のプロンプトでブロック
  • Defense Access:50回中46回がどこかの段階でブロック
  • Red Team Access:ブロックはゼロ、50回中34回(**68%**)を完了

Red Team AccessでのClaudeの完了率は、セーフガードを一切設けない場合(67.6%)とほぼ一致している。つまり、Red Team Access以上では実質的にセーフガードは機能しない状態になる。

ただしこれはAnthropicによる自社測定値であり、外部機関による検証はまだ行われていない。

Glasswing統合:成果報告の数値

Anthropicは今回、Glasswingの初の大規模な成果報告も行った。4月から10月の期間にわたる活動で、パートナー組織が少なくとも12万9,000件の検証済み脆弱性を発見。そのうち3万3,000件以上がクリティカルまたは高深刻度と評価されている。

また、Anthropic自身が実施したオープンソーススキャンでは同期間に5,500件の脆弱性を別途発見している。

Anthropicはパートナー組織の発見数を「過小評価」と位置付け、33のパートナーレポートから「実際の数字は少なくとも5倍以上」と推計している。なお、パッチ適用済みの件数を報告したパートナーは半数以下にとどまった。

競合の動きと背景

この発表と同日、Mistralは新しいオープンモデルをリリースし、ClaudeやOpenAIのGPT-6 Astraが拒否するセキュリティ作業に対応できる点を訴求した。また先週、Anthropicは中国のオープンウェイトモデルが制約なしで実働するエクスプロイトを生成できると警告していた。

Anthropicの今回の方針は「完全にブロックするより、誰が使うかを確認して開放する」という判断だ。審査が機能すれば、より多くの防御側チームがMythosレベルのツールを使えるようになる。審査が機能しなければ、6か月かけて守ってきたドアを自ら広げることになる。

データ保持の面では、メンバーはAnthropicにデータ保持を許可する必要がある。ゼロデータリテンション契約の既存ユーザーは現行の取り決めを維持できるが、今秋後半には「Enterprise Frontier Safeguards」という自社クラウドへのデータ保存オプションも提供予定だ。プログラムはClaude Platform、Google Cloud Vertex AI、Microsoft Foundryで稼動し、Amazon Bedrockでは新オプションの対象顧客のみ利用できる。

詳細はAnthropic will let vetted red teams use Claude for the hacking work it normally blocksを参照していただきたい。