powered by TechFeed
表示モード
Amazon

AWSがAIエージェントの「周辺コスト」を28%削減するOSSハーネスを公開 — Claude Code比では77%安く精度も上回る

9月21日、MarkTechPostが「AWS Strands Agents Team Releases Strands Harness: An Open-Source Agent Harness With 28% Lower Token Cost at Comparable Accuracy」と題した記事を公開した。AWSのStrands AgentsチームがオープンソースのAIエージェントハーネス「Strands Harness」をリリースし、同等の精度を維持しながら比較対象のハーネス群に対して平均28%のトークンコスト削減を達成したという内容だ。

9月21日、MarkTechPostが「AWS Strands Agents Team Releases Strands Harness: An Open-Source Agent Harness With 28% Lower Token Cost at Comparable Accuracy」と題した記事を公開した。AWSのStrands AgentsチームがオープンソースのAIエージェントハーネス「Strands Harness」をリリースし、同等の精度を維持しながら比較対象のハーネス群に対して平均28%のトークンコスト削減を達成したという内容だ。


Claude CodeやCodexで動いたエージェントが、自前ループで動かない問題

AIエージェントを開発したことのあるエンジニアなら覚えがあるはずだ。Claude CodeやOpenAIのCodexの上では動いたのに、自分でループを実装し直すと途端に不安定になる。そのギャップを埋めるために、AWSのStrands AgentsチームがStrands Harnessをリリースした。

ハーネスとは、モデル本体ではなく、その周辺システムのことだ。ループ制御、ツール呼び出し、コンテキスト管理、メモリ、エラーリカバリーといった要素がすべて含まれる。StrandsはすでにStrands Harness SDKとしてこれらの構成要素を公開していたが、Strands Harnessはそれを「すぐ使える状態」にパッケージ化したものだ。

ライセンスはApache 2.0。PythonとTypeScriptに対応し、ローカルでもクラウドでも動作する。


28%コスト削減の中身

AWSチームはAmazon EC2上で、Terminal-Benchの開発元が作った評価フレームワーク**Harbor**(複数ハーネスを横断してベンチマークを実行するためのオープンソース評価基盤)を用いた分散ベンチマークを実施した。対象ベンチマークはALFWorld、ContextBench、GAIAWebShopτ²-benchTerminal-Bench 2.1の6種類。

比較対象となったハーネスは以下の5つだ。

  • Claude Code:Anthropicが提供するターミナル上で動作するAIコーディングエージェント
  • Codex:OpenAIが提供するコーディング特化型AIエージェント
  • oh-my-pi:Pi向けのOSSエージェントハーネス実装
  • **OpenCode**:オープンソースのコーディングエージェントハーネス
  • DeepSeek Harness:DeepSeekモデル向けに最適化されたハーネス実装

最も具体的な比較が、Claude Fable 5(※編集部注:Anthropicが2026年に発表した大規模言語モデル。Claude 3.x系の後継にあたる)をモデルとして固定してTerminal-Bench 2.1を89試行で測定したデータだ。

ハーネス 実行コスト 精度
Strands Harness $56.29 69.7
Oh-my-pi $86.83 69.7
OpenCode $73.42 66.3
Claude Code $248.05 61.8
DeepSeek Harness $40.30 59.5

Claude Codeと比較すると、コストは77%安く、精度は7.9ポイント高い。同じ精度69.7を出したoh-my-piに対しても、コストで54%優位だ。

ただし、「28%コスト削減」という主たる数値はDeepSeek Harnessを含めた全比較対象の平均から算出されたものであり、Claude Code比の77%という数字は特定条件下の最大値である点に注意が必要だ。DeepSeek HarnessはStrands Harnessより約14%安いが、すべてのベンチマークでスコアが低かった。DeepSeekを除いた比較ではコスト優位性はさらに大きくなる。


コスト削減を支える3つのコンテキスト管理ルール

AWSチームはコスト・精度両面の改善を「コンテキスト管理が主な要因」と説明している。デフォルトで適用される3つのルールがその核心だ。

  • 1,500トークンを超えるツール結果はトランケート(切り詰め)する
  • コンテキスト使用率が85%を超えたらサマリー圧縮(compaction)を実行する
  • ウィンドウがオーバーフローした場合はループ内でコンテキストリカバリーを行う

この設計は独立した研究とも整合する。HarnessTax studyは7モデルにわたってClaude Code、Codex CLI、Piを比較し、「ハーネスの選択は成功率にほとんど影響しないが、同じモデルで最大5倍のコスト差が生じる」と報告している。コストの差はモデルではなく、ハーネスの実装で決まるという知見だ。


導入と使い方

インストールはワンライナー。

pip install strands-harness
# または
npm install @strands-agents/harness

使い方も最小限だ。

from strands_harness import create_harness

agent = create_harness(model="litellm/openai/gpt-5.6-sol")
agent("Research the top three vector databases and compare their pricing")

create_harness()一発で、Amazon Bedrock、Anthropic、OpenAI、Google、OllamaLiteLLMのいずれかのモデルをターゲットにしたエージェントが立ち上がる。

デフォルトで使えるツールはシェル、ファイル操作(読み書き・編集)、Web検索。大きなツール結果はファイルにオフロードし、リクエストの再利用部分はキャッシュする。セッションIDによる会話再開や、長期メモリも標準で備わっている。

Strands CLInpm install @strands-agents/strands-cli)を使えば、自然言語でエージェントをプロトタイピングし、/exportコマンドでPythonまたはTypeScriptのコードとして書き出すことも可能だ。ラップトップで試したエージェントがそのまま本番に組み込めるという設計になっている。


まとめ

  • Apache 2.0のオープンソースで、Python・TypeScript対応
  • 28%のトークンコスト削減を6ベンチマーク・複数ハーネスとの比較で報告(精度は同等)
  • Claude Codeと同一モデルで比較した場合、コスト77%削減・精度7.9ポイント向上(77%は特定条件下の最大値)
  • コスト削減の主因はコンテキスト管理(トランケート・圧縮・リカバリーの3ルール)
  • AWSチームはベンチマークに関するフォローアップ論文を準備中

ハーネスという「モデルの外側」の実装がコストと精度の両方を左右するという事実は、エージェント開発に取り組むエンジニアにとって見過ごせない示唆だ。Strands Harnessは、その問題に対してベンチマーク付きで具体的な答えを示したOSSである。

詳細はAWS Strands Agents Team Releases Strands Harness: An Open-Source Agent Harness With 28% Lower Token Cost at Comparable Accuracyを参照していただきたい。