powered by TechFeed
表示モード
Anthropic

Claude Sonnet 5.5、コーディング評価でSonnet 5の約7倍スコアを記録 — Opus級の性能をSonnet価格で実現

9月29日、Anthropicが「Introducing Claude Sonnet 5.5」と題した記事を公開した。新モデル「Claude Sonnet 5.5」はコーディング評価のTerminal-Bench 4.0でSonnet 5比約6.8倍のスコアを記録し、Opus 5.5をも上回る数値を叩き出した。価格はSonnet 5と同額のまま、速度は30%以上向上している。

9月29日、Anthropicが「Introducing Claude Sonnet 5.5」と題した記事を公開した。新モデル「Claude Sonnet 5.5」はコーディング評価のTerminal-Bench 4.0でSonnet 5比約6.8倍のスコアを記録し、Opus 5.5をも上回る数値を叩き出した。価格はSonnet 5と同額のまま、速度は30%以上向上している。


Claude 5.5ファミリーとは:世代・構成の整理

Claude 5.5は、Anthropicが2025年9月に展開を始めた最新世代のモデルファミリーだ。Claude 3・Claude 4に続く位置づけで、「5.5」というバージョン番号は前世代(Claude 5)のマイナーアップグレードではなく、エージェント・長時間タスク対応を主眼に置いた実質的な新世代として公開されている。

ファミリーは、複雑な判断が必要な重タスク向けのOpus 5.5と、日常的なタスク向けのSonnet 5.5の2モデル体制で構成される(コスト重視のHaiku 5.5は数週間内に追加予定)。

Sonnet 5.5の最大のポイントは、Opus 5.5に近い性能を、Sonnet 5と同じ価格で、より速く・安く実現した点だ。具体的には:

  • 出力速度:Sonnet 5比で30%以上高速化
  • タスクあたりコスト:最大30%削減(同一価格で必要トークン数が減少)
  • 価格:入力トークン $2/百万、出力トークン $10/百万、キャッシュリード $0.20/百万(Sonnet 5と同額)

コーディングベンチマークで最も際立つ性能向上

エンジニアが最も注目すべきは、コーディング評価での数値だ。

Terminal-Bench 4.0(エージェント型コーディング評価。ターミナル操作を伴う実タスクをどこまで自律実行できるかを測る指標)でSonnet 5.5は70.6%を記録。Sonnet 5の10.3%から大幅に跳ね上がり(約6.8倍)、Opus 5.5の66.4%すら上回っている。

CursorBench 4.0(AIコードエディタ「Cursor」の実際のコーディングセッションから抽出したタスクを評価するベンチマーク)でも**55.5%**を記録し、Opus 5.5の57.8%との差は約2ポイントにとどまる。

早期テスター各社のフィードバックも具体的だ:

「Epic の初期テストでは、Claude Sonnet 5.5 は上位モデルに期待するのと同等の品質基準をクリアし、システム設計監査やデータフローレビューでも安定していた。数万行規模のゲームプレイシステムアーキテクチャを扱い、レスポンスは速く、数時間にわたるタスクも完遂した。」
— Daniel Vogel, COO, Epic Games

「118件の実アプリビルドで、Claude Sonnet 5.5 は Opus 5 と同等レベルのアプリを生成した。平均イテレーション数は3.6回で、Opus 5 の7.7回を大きく下回った。ツール呼び出しの失敗件数も比較したモデルの中で最少だった。」
— Gabriel Grinberg, AI Engineering Lead, Base44

ツール呼び出しのバッチ処理がSonnet 5より効率的で、ステップ数とコストが削減されるという報告も複数の早期テスターから挙がっている。


ナレッジワークでもOpus 5.5と拮抗

44職種・9業種の実業務タスクを評価するGDPval-AA(職種横断の実務能力を測るベンチマーク。数値は各モデルのElo風スコアで表される)では、Sonnet 5.5のスコアが1844でOpus 5.5(1846)とほぼ同水準。Sonnet 5(1449)からは約400ポイント上昇している。なお、このベンチマーク上ではGPT-6 Sol(1487)のスコアも上回っているが、あくまでGDPval-AAという特定の評価軸での比較である点は留意が必要だ。

コンピューター操作を評価する**OSWorld 2.1(実際のデスクトップOS環境上でのGUI操作タスクを自律実行する能力を測るベンチマーク)では80.1%(Opus 5.5は81.8%)、チャート認識のChartographyでは61.6%**(Sonnet 5は15.6%)と、ビジュアル・UI系でも大きく改善している。

また、ポケモン赤をスクリーンショットのみでプレイしてクリアした初のSonnetモデルという記述もあり、長期的なビジョン理解タスクへの対応力向上が伺える。

Balyasny Asset Managementの事例では、2,441件の金融タスクでSonnet 5と比較して回答あたりのトークン数が497k→121kに減少(約75%削減)という報告もある。


安全性:サイバー対策を初めてSonnetに適用

Sonnet 5.5はサイバーセキュリティ能力がSonnet 5から大幅に向上したことを受け、Opusクラスのモデルに適用してきたサイバーセーフガードとフォールバック機構を初めてSonnetに導入している。通常のソフトウェア開発やライフサイエンス業務への影響はないとしている。

自動化行動監査(約1,850シナリオ)では、アライメント・誤用への耐性・誠実性の大半の指標でSonnet 5と同等以上の結果を示した。コンテナ脱出を試みる頻度はOpus 5.5に次ぐ低さで、自社モデルの中でコンテナの限界を探る行動が最も少ないモデルとなっている。


エフォートレベルによるコスト・速度のチューニング

Sonnet 5.5は「エフォートレベル」の調整に対応しており、低設定では高速・低コスト、高設定ではより丁寧な推論を行う。Claude CodeやAnthropicアプリではデフォルトがMedium、Claude PlatformではHighに設定されている。

ベンチマークのコスト効率グラフによれば、Low〜Mediumエフォートで動作させた場合、Sonnet 5の最高スコアをタスクあたりコストの約10分の1で上回るケースもある。


詳細はIntroducing Claude Sonnet 5.5を参照していただきたい。