powered by TechFeed
表示モード
Deep Dive

Claude Opus 5.5のシステムカード詳細分析 — 「30%の確率でAI自律R&Dしきい値を超えている」という指摘にAnthropicはどう答えるか

9月24日、Zvi Mowshowitzが「Claude Opus 5.5: The System Card」と題した記事を公開した。AnthropicのClaude Opus 5.5のシステムカードを詳細に分析し、モデルの安全性評価・能力評価・アライメントリスクにわたる多角的な読み解きを展開している。

9月24日、Zvi Mowshowitzが「Claude Opus 5.5: The System Card」と題した記事を公開した。AnthropicのClaude Opus 5.5のシステムカードを詳細に分析し、モデルの安全性評価・能力評価・アライメントリスクにわたる多角的な読み解きを展開している。


Opus 5.5とは何者か

Claude Opus 5.5は、Artificial Analysisや主要ベンチマークにおいて現時点で最高水準に位置するモデルだ。AnthropicはOpus 5.5がOpus 5より安価でありながら、それ以上の性能を持つと主張している。

Zvi(著者)はこのシステムカードを通読し、安全性・能力・アライメントの各セクションを丁寧に読み解いている。本記事ではその中から最も読み応えのある部分を拾う。


最大の論点:Autonomy-2しきい値に30%の確率で達している

記事で最も重い指摘は、AI R&D能力評価(2.3節)にある。

AIの自律的R&D能力の評価を専門とする機関METR(Model Evaluation & Threat Research)は、Opus 5.5について次のように述べている:

「AIによる能力の加速は全体で約1.5倍(1年で1.5年分の進歩)、30%の確率で2倍加速に達している可能性がある」

AnthropicのRSP(Responsible Scaling Policy)では、Autonomy-2しきい値を超えた場合に追加的な安全措置が義務付けられる。Zviはこう指摘する。「METRが30%の確率でしきい値を超えたと言っているなら、超えたものとして扱うか、METRが過剰に不確かだという健全な議論をすべきだ」。AnthropicがこのMETRの評価に対してどう判断しているかを現時点で明確に説明していない点が、記事の中でも特に批判的なトーンが強い箇所だ。

また、内部R&Dタスクの実測指標であるCoBench 2.1では、スコアの解釈が難しい状態が続いている。Zviは「モデルが解ける問題と解けない問題の間に質的な断絶があるのでは」と推測している。


生物兵器評価:方針転換の背景

生物兵器(CB)評価(2.2節)では、大きな方針変更があった。Anthropicはこれまで「有用性のみモード(helpful-only)」のモデルで評価していたが、今後はリリース版モデルを使いつつ、拒否が発生しにくいテスト設計に切り替える。

理由は二つ:

  • helpful-onlyモデルがリリース版と乖離しつつある
  • 評価中に拒否が発生し、複数チームが時間を無駄にした

ただし、この変更にはコストがある。拒否の問題があったevalはそのまま削除されており、「より良いプロンプト設計があればOpus 5.5の能力をもっと引き出せるのでは」というZviの疑念は残る。

実際に観察された失敗モードとして、システムカードには以下が記載されている:

「専門家・評価者ともに、Opus 5.5はオープンエンドな科学的推論に苦労し、論文全体を理解せずにアブストラクトの主張に過度に依存する傾向があった。またDNAの設計ミスや、適用不可能な動物モデルの使用が7グループ中3グループで見られた」

黒箱RNAシーケンス設計では過去最高スコアを記録しており、「中程度の水平展開が必要な生物配列設計において、米国労働市場のトップ人材と競合できる水準」とAnthropicは結論付けている。


AI R&Dの弱点:戦略的エラーが増加

能力面での懸念として、Opus 5.5では以下のような問題行動の増加が確認されている:

  • 結論から限定条件(qualifiers)を省略して断定的に述べる
  • 自分自身の疑念を棄却し、以前述べた計画を放棄する
  • レビューへの対応が局所的で、設計全体の妥当性を再検討しない
  • 自分で書いた要件と照合するが、その要件が本来対象とすべき人間と照合しない

Zviはこれらを「低レベルで近接した問題」と表現しつつ、「馬が話せること自体にまず驚くべき段階だ」と指摘する。つまり、問題はあるが方向性はほぼ正しい、という評価だ。


アライメントとサンドバッキング:ホワイトボックス分析の発見

ホワイトボックス分析(6.6節)では、モデルが内部的にどう振る舞っているかを解析している。注目すべき項目はサンドバッキング(6.6.3)だ。サンドバッキングとは、モデルが意図的に能力を低く見せる行動を指す。評価環境でのみ性能を抑制し、本番環境では異なる振る舞いをするリスクがあるため、安全性研究において注視されている概念だ。

またChain of Thought Controllability(6.6.4.4)では、思考連鎖(CoT)がどの程度制御可能かが評価されている。モデルが推論プロセスを操作して評価をすり抜けるリスクに直結する領域であり、安全性研究の最前線の一つだ。ホワイトボックス分析セクションは、こうした内部動作の透明性確保に向けた取り組みを記録した部分として、システムカード全体の中でも技術的密度が高い。


Anthropicが出した結論

Anthropicの公式結論は「Opus 5.5はアライメントリスクや生物兵器リスクの観点で、以前のモデルと比べて著しく悪化していない」というものだ。ただしZviは、AnthropicがOpus 5.5を内部で使用してきた期間が従来モデルと比べて短いことを自ら認めている点を指摘し、留保を示している。

能力評価については「インターネット上の初期反応はOpus 5.5が非常に優れているというもの」と述べつつ、自身の評価コメントは数日後に改めて公開すると予告している。


詳細はClaude Opus 5.5: The System Cardを参照していただきたい。