9月28日、Anthropicが「Introducing Claude Sonnet 5.5」と題した記事を公開した。新モデル「Claude Sonnet 5.5」は、エージェント型コーディング評価で前世代の約7倍のスコアを記録し、上位モデルのOpus 5.5を超える場面もあった。価格はOpus 5.5の半額水準に設定されており、性能とコスト効率を同時に追求する開発チームにとって有力な選択肢となりそうだ。
GitHub Copilot、Cursor、Devinなど、AIコーディングエージェントをめぐる競争が激化するなか、各社のモデルには長時間にわたる複合タスクを自律的にこなすエージェント的処理能力がより強く求められるようになっている。Anthropicは今年8月にClaude 5.5ファミリー(※)の第1弾としてOpus 5.5を投入しており、今回のSonnet 5.5はその第2弾にあたる。Haiku 5.5は数週間以内の追加が予定されている。
※ Claude 5.5ファミリーはAnthropicの現行最上位世代。Opus・Sonnet・Haikuは上位から順に、処理能力重視・バランス重視・速度/コスト重視のモデル系列を指す。
コーディング性能が桁違いに向上
Sonnet 5.5で最も目を引くのがコーディング評価の数字だ。長時間にわたる端末操作・ファイル操作を含む複合タスクを評価するベンチマーク「Terminal-Bench 4.0」では、前世代のSonnet 5が**10.3%だったのに対し、Sonnet 5.5は70.6%**を記録した。スコアが7倍近く跳ね上がっており、同評価でOpus 5.5(66.4%)をも上回る結果となっている。
実際の開発現場でも手応えが報告されている。
「Epicの初期テストでは、Claude Sonnet 5.5は上位モデルに期待するクオリティをクリアした。システム設計のレビューやデータフロー審査で水準を満たし、数万行のゲームプレイシステムアーキテクチャを処理し、数時間にわたるタスクをこなした。」
— Daniel Vogel, COO, Epic Games
「Sonnet 5がウェブ検索に頼りすぎる傾向と、高いトークン消費量、この2つが新モデルでは解消されている。シンプルなレビューと中程度のレビューを今すぐ移行する予定だ。」
— David Loker, VP of AI, CodeRabbit
コードベースへの素早い理解と、ツール呼び出しをバッチ処理する効率性も評価されている。Base44の検証では、118件の実際のアプリ構築においてOpus 5と同等品質のアプリを平均3.6イテレーション(Opus 5は7.7回)で完成させたという。
Opus 5.5との棲み分け
Claude 5.5ファミリーは現時点でOpus 5.5とSonnet 5.5の2モデル体制だ。用途別の推奨は以下の通りだ。
| 用途 | 推奨モデル |
|---|---|
| 複雑・オープンエンドな判断を要する作業 | Opus 5.5 |
| バグ修正・ドキュメント・スライド作成など日常タスク | Sonnet 5.5 |
| 大量処理・コスト重視 | Haiku 5.5(近日公開) |
44職種・9業界にわたる実業務タスクを評価するAnthropicの独自ベンチマークGDPval-AAでは、OpusとSonnetのスコアがほぼ並ぶ結果となっている。ただしAnthropicは「複雑なオープンエンドの判断においてはOpus 5.5が引き続き明確に優位」と明記しており、高度な戦略立案や曖昧な問題解決には上位モデルを選ぶべきという位置づけは変わっていない。なお、GDPval-AAはAnthropicが設計した実務シナリオベースのベンチマークであり、第三者機関による独立評価ではない点は留意しておきたい。
コストと速度:Opus 5.5の半額、かつトークン消費も削減
価格はOpus 5.5の半額水準に設定されている。前世代のSonnet 5(入力$3/出力$15)からも値下がりしており、性能向上と値下げが同時に実現した形だ。
| トークン種別 | Sonnet 5.5 | Sonnet 5(前世代) | Opus 5.5 |
|---|---|---|---|
| 入力 | $2 / 100万トークン | $3 / 100万トークン | $4 / 100万トークン |
| 出力 | $10 / 100万トークン | $15 / 100万トークン | $20 / 100万トークン |
| キャッシュ読み取り | $0.20 / 100万トークン | — | $0.20 / 100万トークン |
| キャッシュ書き込み | $2.50 / 100万トークン | — | $5 / 100万トークン |
価格の低下に加え、同一タスクあたりのトークン消費量も大幅に減少している。Balyasny Asset Managementの財務Q&Aタスクでは、1回あたりの使用トークンがSonnet 5の497kから121kへと約75%減少した。これにより実効コストは最大30%削減できるとされている。出力速度もSonnet 5比で30%以上高速化している。
ナレッジワークへの強み
コーディング以外の領域でも改善が見られる。社内テストでは、上場企業の決算資料・カンファレンスコールのトランスクリプトとスライドテンプレートを与えて10枚の経営レビュー資料を作成させたところ、専門家2名が「そのまま送付できる」と判断した初稿が生成されたという。
Slackのテストでは、プロンプトを変更せずにSlackbotの評価を実施したところ、出力トークンが約14%削減されながら品質も向上したと報告されている。
安全性:コーディング能力向上に伴う追加対策
Sonnet 5.5はSonnet 5からサイバーセキュリティ能力が大幅に向上しており、Anthropicはこれを受けて、従来はOpus級モデルに適用していたサイバーセキュリティ向けのセーフガードとフォールバック機能をSonnetとして初めて実装した。バイオセキュリティのセーフガードはSonnet 5と同水準を維持している。いずれの対策も高リスクな一部のリクエストのみを対象としており、通常のソフトウェア開発やライフサイエンス業務への影響はないとされている。
アライメント評価では、約1,850シナリオの自動行動監査においてSonnet 5以上の結果を示し、コンテナ逸脱(サンドボックスからの脱出)を試みる頻度はOpus 5.5に次いで低い水準となっている。
Sonnet 5.5はClaude.aiおよびAnthropic APIで本日より利用可能だ。
詳細はIntroducing Claude Sonnet 5.5を参照していただきたい。




