9月22日、METRが「Summary of METR's predeployment evaluation of Claude Opus 5.5」と題した記事を公開した。AIがAI自身の開発を加速する時代、その「限界」はどこにあるのか——本評価はまさにその問いに正面から向き合ったものだ。独立機関METR(Model Evaluation & Threat Research)がClaude Opus 5.5のリリース前に実施したAI R&D能力評価の結果は、「完全自動化には至らない」という、ある意味で冷静な結論だった。
第三者機関が事前評価を実施
評価は無償契約のもとで行われた独立評価である。ただし、METRが初稿を作成した後、Anthropicがレビューと編集を行う機会があったと明記されており、最終テキストはAnthropicのClaude Opus 5.5 System Cardに収録されている。
評価が焦点を当てたのは、主に以下の2点だ:
- (A) Claude Opus 5.5を使うことで、AnthropicのAI R&Dは劇的に加速するか
- (B) Claude Opus 5.5の開発プロセス自体が、すでにAIによって劇的に加速されていたか
アライメント特性(モデルが人間の意図に沿って行動するか)の検証は今回の評価スコープ外とされている。
評価に使われた5つのタスク
METRはAPI経由で10営業日のアクセスを得て、以下の5タスクを用いた能力テストを実施した:
- Budget NanoGPT Speedrun:人気のNanoGPT Speedrun競技をAI R&D向けに制約したタスク
- Language Model Conceptual Argumentation(LMCA):概念的推論を測定するデータセットを用いたタスク
- Train a Program:ソフトウェアの挙動を再現するMLモデルをエージェントが訓練するタスク
- Gaming Bot:視覚情報なしのAPIでビデオゲームをプレイするPythonプログラムを書くタスク
- Sunlight:オープンエンドなリサーチを行い、レポートを書くタスク
これらはいずれも「長期的・自律的なタスク遂行能力」を測るものであり、単純な質問応答ではなくエージェント的な動作が要求される。なお、METRはこれらのタスク設計の背景として、以前公開したFrontier Risk Reportで示した「AIが自律的にR&Dを推進できるかどうかの閾値」という問題意識を共有しており、今回の評価もその継続的な取り組みの一環として位置づけられている。
結論(A):AI R&Dの完全自動化には至らない
METRの評価結果は、前モデル「Fable 5.1」との比較を軸に述べられている。Fable 5.1はAnthropicの内部モデル系列の呼称であり、外部公開名とは異なる。Anthropicは外部向けにはClaude 3系列などの名称を用いており、Fable 5.1がどの公開モデルに対応するかは今回の評価では明示されていない。読者はこの点を念頭に置いて数値を解釈する必要がある。
「Claude Opus 5.5はFable 5.1を上回るが、AI R&Dを完全自動化できる水準には達していないと判断する」
具体的には:
- Budget NanoGPT・Gaming Bot(検証可能タスク)とLMCA・Sunlight(検証困難タスク)の両方でFable 5.1を上回る
- ただし改善は段階的なもの(incremental improvement)であり、不連続な跳躍ではない
- 熟練した人間の専門家が長期・オープンエンドなタスクを解く場合と比べると、Claude Opus 5.5には質的な弱点がまだ残る
- AI R&Dの完全自動化には、先見性・フィードバックループの自律的生成・研究者としての「判断力」や「センス」に相当する能力の大幅な改善が必要と見ており、その点での進展は確認できなかった
一方で、研究者の生産性向上や限定的なR&D自動化には引き続き貢献すると評価している。
結論(B):開発はAIによってある程度加速されていたが、劇的ではない
Claude Opus 5.5の開発プロセスにAIがどの程度貢献したかについては、別チームによる実験的・予備的レポートが用いられた。このレポートはアクセス権限の違いから、結論のみがMETRの評価チームに共有され、根拠の詳細は開示されていない。
その結論として引用された数値は:
「AIによる総合的な能力加速は約1.5倍(1年で1.5年分の進捗)、2倍加速の可能性は約30%」
1.5倍加速という数値は、AI開発の文脈では一見インパクトがあるように映る。しかし、METRの内部評価でもClaude Opus 5.5はFable 5.1から「トレンド通りの改善」にとどまると判断しており、この数値が示すのはあくまで「着実な積み上げ」であって、開発工程の質的な変容ではないとMETRは解釈している。なお、この推計が適用される期間がClaude Opus 5.5の開発期間なのか、別の期間なのかは不明とされている点にも留意が必要だ。
評価プロセスの透明性という論点
今回の報告書で構造的に面白いのは、METRがその独立性の限界を自ら明示している点だ。Anthropicによるレビュー機会の存在、別チームからの結論のみ共有(根拠非開示)、開示できない追加情報源の存在など、評価プロセスの制約が率直に記述されている。
AI安全性評価において第三者機関がどこまで独立性を保てるかは、業界全体の課題として議論が続いており、本レポートはその一事例として参照価値がある。「AIがAIを評価し、AIがAIを開発する」という入れ子構造が現実のものになりつつある今、評価プロセス自体の設計をどう担保するかは、今後ますます重要な問いになるだろう。
詳細はSummary of METR's predeployment evaluation of Claude Opus 5.5を参照していただきたい。




