powered by TechFeed
表示モード
主要ニュース

ExaのAIエージェント「Agent Ultra」がClaude・GPTを圧倒 — 企業リストアップ数で競合の約17倍、ただし自己報告ベンチマークに注意

9月26日、Michal Sutterが「Exa Launches Agent Ultra: A Subagent Swarm Deep Research API Built for Exhaustive List Building」と題した記事を公開した。ExaがサブエージェントSwarm型のDeep Research API「Agent Ultra」をリリースし、複数のベンチマークでClaude Opus 5.5やGPT-6 Astraを上回ったと主張している。ただし結果はすべてベンダー(Exa)による自己報告であり、独立した第三者による再現検証はまだ行われていない。その前提を踏まえた上で、内容を紹介する。

9月26日、Michal Sutterが「Exa Launches Agent Ultra: A Subagent Swarm Deep Research API Built for Exhaustive List Building」と題した記事を公開した。ExaがサブエージェントSwarm型のDeep Research API「Agent Ultra」をリリースし、複数のベンチマークでClaude Opus 5.5やGPT-6 Astraを上回ったと主張している。ただし結果はすべてベンダー(Exa)による自己報告であり、独立した第三者による再現検証はまだ行われていない。その前提を踏まえた上で、内容を紹介する。


Company Find-Allで競合の約17倍——数字が示すAgent Ultraの異次元

最も目を引くのがCompany Find-Allベンチマークの結果だ。タスクあたりに取得できたエンティティ数(企業数)の平均を比較すると、Agent Ultraが2,451件に対し、Opus 5.5は146件、GPT-6 Astraは113件、Perplexity Agentは98件。Exaはこの差を「+1579%」と表現しているが、比率として整理すると最も近い競合(Opus 5.5)の約17倍という水準だ。

このベンチマークは「企業の出し切り(Find-All)」、すなわち条件に合う企業をリストアップし尽くすタスクを評価するものだ。大規模なリスト構築や市場マップ作成を想定したユースケースにおいて、既存のエージェントとは桁違いの網羅性を示している。


4つのベンチマーク結果

Exaが公表したベンチマーク結果は以下の通り。いずれも各競合を最大努力設定(maximum effort)で実行したものとの比較である。繰り返しになるが、以下の数値はExa自身が公表・評価したものであり、独立検証は未実施である点に留意されたい。

ベンチマーク Agent Ultra Opus 5.5 GPT-6 Astra Perplexity Agent
WANDR(soft recall) 81.4% 72.3% 26.0% 40.1%
DeepSearchQA(F1) 93.9% 77.6% 85.3% 89.7%
WideSearch(row-level F1) 58.9% 51.6% 54.7% 56.0%
Company Find-All(平均エンティティ数/タスク) 2,451 146 113 98

コストについてもExaは主張を添えている。

  • WANDR: Opus 5.5比+9.1ポイント(絶対値)、コストは半分以下
  • DeepSearchQA: Perplexity比+4.7%、GPT-6 Astra比46%低コスト
  • WideSearch: Perplexity比+5.2%、4システム中最安コスト
  • Company Find-All: エンティティあたりのコストが4システム中最安

なお、WANDRはPerplexityが公開した500タスクの幅広いデータ収集ベンチマークで、評価ハーネスはオープンになっている。Exaは競合がすでに公開済みの数値はそれを引用し、未公開の場合は自社で評価したと説明している。


Agent Ultraの仕組み

Agent UltraはExa Agent APIの「努力レベル(effort level)」の最上位に位置する。APIの呼び出し時にeffort: "ultra"を指定するだけで利用でき、ホスト型APIとして提供される(オープンウェイトではなく、セルフホストは不可)。

内部では、タスクをサブタスクに分割し、複数のサブエージェントが並列で複数のドメインを同時にリサーチする。必要なステップにはフロンティアモデル(高性能な最先端モデル)を、十分なステップには高速モデルを自動でルーティングする設計だ。

実行時間とコスト:

  • 典型的な複雑タスク:約30分
  • 最大:3時間
  • 料金:デフォルトで1ランクあたり最大**$20**。maxCostDollarsで$1〜$100の範囲で調整可能
  • maxDurationSecondsで300〜10,800秒(5分〜3時間)の制御も可能
  • 途中でstopを呼べば、その時点までの結果と課金で終了できる

コードサンプル

from exa_py import Exa

exa = Exa()
run = exa.agent.runs.create(
    query="Find all companies building browser automation tools in the United States.",
    effort="ultra",
)
run = exa.agent.runs.poll_until_finished(run.id, timeout_ms=3 * 60 * 60 * 1000)
print(run.stop_reason)

SDKのポーリングヘルパーはデフォルトで1時間タイムアウトするため、3時間タスクを走らせる場合はタイムアウト値の明示的な指定かストリーミングが必要になる。OpenAI互換エンドポイント(/responses)経由ではreasoning.effort: "ultra"で呼び出せる。

Exa API Playgroundでテスト実行も可能だ。


想定ターゲット

Exaが挙げるユースケースは以下の3つだ。

  • モデルプロバイダー: 特定技術を実装した論文・リポジトリの網羅的収集、「ウェイト公開済みか、API提供のみか」といった条件の検証
  • 金融サービス: デューデリジェンス用マーケットマップの構築、申告書や裁判記録を横断したKYCリサーチ、ポートフォリオシグナルのモニタリング
  • GTM(Go-to-Market)チーム: アカウントリストの構築と引用URL付きのエンリッチメント

既存のリストを渡せば、そこに含まれる行は新しい結果から除外される機能も持つ。


詳細はExa Launches Agent Ultra: A Subagent Swarm Deep Research API Built for Exhaustive List Buildingを参照していただきたい。