powered by TechFeed
表示モード
Anthropic

Claude Haiku 5.5、コンピュータ操作スコアが15.7%→72.4%に急伸しつつ価格は最大90%減 — ただしトークナイザー変更で実際の削減幅は縮まる可能性

10月8日、The Decoderが「Claude Haiku 5.5 arrives with massive price cuts proving the AI pricing arms race is far from over」と題した記事を公開した。AnthropicがリリースしたClaude Haiku 5.5は、コンピュータ操作スコアを前世代の約4.6倍に引き上げながら、価格を最大90%引き下げるという大幅な刷新を果たした。「性能も価格も同時に改善する」というAIモデルの進化パターンが続いており、OpenAI・Google・Metaが相次いで小型・高速モデルの性能向上と値下げを競い合うなか、今回のリリースはその競争がさらに加速していることを示す一例だ。

10月8日、The Decoderが「Claude Haiku 5.5 arrives with massive price cuts proving the AI pricing arms race is far from over」と題した記事を公開した。AnthropicがリリースしたClaude Haiku 5.5は、コンピュータ操作スコアを前世代の約4.6倍に引き上げながら、価格を最大90%引き下げるという大幅な刷新を果たした。「性能も価格も同時に改善する」というAIモデルの進化パターンが続いており、OpenAI・Google・Metaが相次いで小型・高速モデルの性能向上と値下げを競い合うなか、今回のリリースはその競争がさらに加速していることを示す一例だ。


OSWorldスコアが15.7%→72.4%へ。コンピュータ操作エージェントとしての実力

Haiku 5.5で最も目を引くのは、コンピュータ操作タスク(Computer Use)でのスコアだ。OSWorld 2.1ベンチマークで**72.4%**を記録し、前世代のHaiku 4.5(15.7%)から約4.6倍に跳ね上がった。OSWorld 2.1はWebブラウザやデスクトップアプリなどをモデルが実際に操作してタスクを完遂できるかを評価する標準的なコンピュータ操作ベンチマークで、スコアが高いほど現実的なPC操作タスクに対応できることを意味する。コンピュータ操作タスクはトークン消費量が多いため、安価で高速なモデルとの相性が良く、Haiku 5.5はそのユースケースに特化した存在になりつつある。

エージェント型コーディングのベンチマーク「Terminal-Bench 4.0」でも**39.2%**を達成。Terminal-Bench 4.0はターミナル操作を通じたコーディングエージェントの実務的能力を測るベンチマークで、Haiku 4.5のスコアはゼロだったため、実質的に別次元の能力を持つモデルとなった。

また、広範な学術・専門知識を問う難関ベンチマーク「Humanity's Last Exam」(ツールなし)では45.9%(Haiku 4.5は10.2%)、知識ベンチマーク「GDPval-AA v2.1」では1,620(Haiku 4.5は735)を記録した。GDPval-AA v2.1は多分野にわたる知識の深さと推論能力を総合的に評価する指標だ。

比較対象としてAnthropicはOpenAIの小型モデルGPT-6 Lunaを提示しており、Haiku 5.5はテストした全カテゴリでLunaを上回った。ただし、同社の上位モデルSonnet 5.5(OSWorld: 83.9%)との差はまだ大きい。

ベンチマーク Haiku 5.5 Haiku 4.5 GPT-6 Luna Sonnet 5.5
OSWorld 2.1(コンピュータ操作) 72.4% 15.7% 48.9% 83.9%
Terminal-Bench 4.0(エージェント型コーディング) 39.2% 0.0% 16.4% 70.6%
Humanity's Last Exam(ツールなし) 45.9% 10.2% — 56.9%
GDPval-AA v2.1(知識ベンチマーク) 1,620 735 1,437 1,840

価格は最大90%減。ただしトークナイザー変更に注意

価格面では、プロンプトが10万トークン以下のリクエストに限り、最大**90%**の引き下げとなる。Anthropicによれば過去のHaikuリクエストの約90%がこの範囲に収まるという。主要な価格を以下にまとめる。

料金(100万トークンあたり) Haiku 5.5(10万以下 / 超過) Haiku 4.5
入力トークン $0.10 / $0.50 $1.00
出力トークン $0.50 / $2.50 $5.00
キャッシュ書き込み $0.125 / $0.625 $1.25
キャッシュ読み込み $0.01 / $0.05 $0.10

ただし、トークナイザーが変更されており、同じタスクで消費するトークン数が前世代より増加する点は注意が必要だ。以前のOpus 4.xシリーズでも同様の変更により、トークン使用量がトークナイザー変更だけで約30%増加したという経緯がある。実際のコスト削減効果は、単純な単価比較より小さくなる可能性がある。


初のHaikuが「思考レベル調整」に対応

Haiku 5.5はHaikuシリーズとして初めて、推論レベルの調整(adjustable reasoning levels)をサポートする。コスト重視か品質重視かをタスクに応じて切り替えられる。Anthropicは要約、分類、サブエージェント処理などの絞り込まれたタスクに向いているとしており、複雑なエージェント型コーディングにはSonnet 5.5やOpus 5.5の使用を推奨している。

セキュリティ面では前世代より制約が強化されているが、Sonnet 5.5より広範な防御的セキュリティタスクを許可している。ペネトレーションテストは引き続きブロックされる。


Sonnet 5.5のキャッシュ読み込みも50%値下げ、APIクレジットも提供開始

Haiku 5.5のリリースと同時に、AnthropicはSonnet 5.5のキャッシュ読み込みコストを50%削減(100万トークンあたり$0.20→$0.10)した。これにより、エージェント系タスクのコストが平均約20%下がるという。記事では、この動きをOpenAIのGPT-6.1シリーズへの対抗と位置づけている。OpenAI・Google・Metaがそれぞれo3-mini、Gemini Flash、Llama系モデルの価格を繰り返し引き下げてきた流れのなかで、Anthropicも今回の施策で追随した格好だ。

また、月次のAPIクレジット提供も開始された。Max-5xプランが$100、Max-20xプランが$200、TeamプランはユーザーごとにMax-5x相当、最大$500を毎月受け取れる。PythonおよびTypeScript SDKもアップデートされ、コンピュータ操作・ブラウザ操作のベータサポートが追加された。

Haiku 5.5はAWS、Google Cloud、Microsoft Azureを含む全プラットフォームで現在利用可能だ。


詳細はClaude Haiku 5.5 arrives with massive price cuts proving the AI pricing arms race is far from overを参照していただきたい。