6月22日、Anthropicが「Introducing Claude Opus 5.5」と題した記事を公開した。新モデル「Claude Opus 5.5」の性能・コスト効率・安全性の詳細が紹介されている。
68万行のコードマイグレーションを1日以内に完了、エンジニアチームなら数週間かかる規模の作業を単独でこなす——Claude Opus 5.5は、AIコーディングアシスタントの競争に新たな基準を持ち込んだ。前世代のOpus 5よりコストは40%安く、出力速度は30%以上速い。2026年のフロンティアモデル競争においてAnthropicは「高性能かつ安価」という軸を明確に打ち出してきた。
Opus 5より40%安く、30%速い
Claude Opus 5.5は、Anthropicが展開する「Claude 5.5ファミリー」の第1弾だ。同ファミリーはAnthropicのモデル階層(Opus=最上位、Sonnet=中位、Haiku=軽量)に沿って順次展開される予定で、後述のとおりSonnet 5.5とHaiku 5.5も数週間以内にリリースされる。
Opus 5と比較したコスト・速度の改善は以下の通りだ。
| トークン種別 | Claude Opus 5.5 | Claude Opus 5 |
|---|---|---|
| キャッシュ読み込み | $0.20/1Mトークン | $0.50 |
| 入力トークン | $4/1Mトークン | $5 |
| 出力トークン | $20/1Mトークン | $25 |
| キャッシュ書き込み | $5/1Mトークン | $6.25 |
エージェント型ワークロードやコーディング作業ではキャッシュ読み込みが大半のコストを占めるため、キャッシュ読み込みの60%削減は実用上の意味が特に大きい。さらにClaude CodeおよびClaude Platformでは最大2.5倍速の「Fastモード」も利用可能だ(入力$8/出力$40、1Mトークンあたり)。
コーディング性能:680,000行の移行を1日以内で完了
エンジニアにとって最も目を引くのはコーディング面の実績だ。
- あるテスターは68万行のコードマイグレーションを1日以内に完了した。同じ作業をエンジニアチームが行えば数週間かかる規模だ。
- 20万行のコードベースの監査と修正をOpus 5.5は3時間以内に完了。Opus 5は同作業に20時間以上かかり、使用トークン数も2.5倍だった。
- ウェブアプリ全ページのロード時間短縮タスクでは、Opus 5.5が40回中39回成功。Opus 5は改善幅が小さく、アプリの挙動も変えてしまった。
- ロードバランサーとして広く使われるHAProxyをCからRustへ移植するタスクでは、Opus 5.5が9.5時間で完了(競合モデルのFable 5.1は12時間)、コストは51%削減だった。
「Fable 5.1」はGoogleが開発するフロンティアモデルで、コーディング・エージェント性能において業界内で主要な比較対象のひとつとなっている。
Anthropicが参照するFrontierCodeベンチマークでは、Opus 5.5はOpenAIのGPT-6 AstraにスコアでリードしながらコストはGPT-6 Astraの**約20%**にとどまる。CursorBench(コーディングエージェント評価ベンチマーク)ではGPT-5.6 Solを11ポイント上回り、コストは約3分の1だ。
実際に利用した企業エンジニアのコメントも具体的だ。
「38回のプロンプトと4日間かかっていた複雑なコーディングタスクが、11回のプロンプトと3時間に収まった。出力のクオリティも高く、手直しも少なかった。」
— Harley Barnes, Executive Manager AI Technology, Quantium
「公開ベンチマークで、Claude Opus 5.5はOpus 5より多くのタスクを解決しながら、呼び出し回数は約40%少なく、トークン数は半分だった。」
— Deepak Singh, VP of Agentic AI, Kiro
安全性:過去最高のアライメントスコア
Opus 5.5は、Anthropicが実施する「自動化行動監査(automated behavioral audit)」でこれまでの全モデル中最高スコアを記録した。この監査は数千件のシミュレーションシナリオでモデルを評価する内部評価プロセスで、今回はより長いタスク・達成不能なタスク・実際のインシデントを模したシナリオまで範囲が拡大されている。
- プロンプトインジェクション耐性はコーディング・ツール使用・コンピュータ操作・Webブラウジングのすべての設定でOpus 5と同等以上
- AIセキュリティ企業Gray Swanのベンチマークでは、Opus 5.5はFable 5.1と並んでプロンプトインジェクション成功率が最も低いモデルとなった
- 取り消しが困難なアクションを実行する確率が従来モデルより大幅に低い
生物学・サイバーセキュリティの能力がFable 5.1相当と評価されたことから、同モデルと同様のセーフガードが適用される。生命科学分野での利用はLife Sciences Verification Programへの審査申請が必要で、サイバーセキュリティ分野は数週間以内にCyber Verification Programが拡充される予定だ。
ベンチマーク結果
主要ベンチマークの結果は以下の通りだ。Anthropicは「この能力レベルではベンチマークのマージンが実世界の差を反映しにくくなっている」とも注記しており、数値の差よりも実タスクでの効率・コスト優位を強調している点は押さえておきたい。
| ベンチマーク | Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra |
|---|---|---|---|---|
| Terminal-Bench 4.0 | 66.4% | 55.8% | 52.3% | 57.9% |
| FrontierCode v1.1 | 54.4% | 50.3% | 48.0% | 53.3% |
| CursorBench 4.0 | 57.8% | 51.8% | 46.6% | — |
| Humanity's Last Exam | 67.7% | 65.6% | 63.6% | 57.2% |
| OSWorld 2.0 | 81.8% | 80.7% | 74.0% | — |
Sonnet 5.5・Haiku 5.5も近日公開
Claude Sonnet 5.5とClaude Haiku 5.5は数週間以内にリリース予定で、同様の性能・効率・安全性の改善が盛り込まれる。Pro・Max・Teamプランでは5時間の使用量上限の引き上げと、サブスクリプションユーザーへのレート制限リセット機能も提供される。
詳細はIntroducing Claude Opus 5.5を参照していただきたい。




