powered by TechFeed
表示モード
Deep Dive

GPUだけでは足りない — エージェントAI時代、NvidiaがCPUをボトルネックと認め専用チップを設計した理由

10月6日、SiliconAngleが「Nvidia and CoreWeave rethink agentic AI infrastructure」と題した記事を公開した。この記事では、エージェントAIの普及に伴いCPUがインフラのボトルネックになりつつある問題に対し、NvidiaとCoreWeaveが取り組むアーキテクチャ設計について詳しく紹介されている。

10月6日、SiliconAngleが「Nvidia and CoreWeave rethink agentic AI infrastructure」と題した記事を公開した。この記事では、エージェントAIの普及に伴いCPUがインフラのボトルネックになりつつある問題に対し、NvidiaとCoreWeaveが取り組むアーキテクチャ設計について詳しく紹介されている。


GPUだけでは足りない――エージェントAI時代のCPUボトルネック

AIが「質問に答える」フェーズから「タスクを実行する」フェーズへ移行するにつれ、インフラへの要件も変わってきた。モデルの推論にはGPUが使われる一方、ツール呼び出し・API呼び出し・SQLクエリといったエージェントの「行動」はCPUが処理する。エージェントの稼働量が増えるほど、この実行系の負荷が無視できなくなる。

NvidiaでVera CPUのプロダクトマーケティングを担当するHannah Coutand氏はこう説明する。

「VeraはAIファクトリー全体を見渡したときに、どこがボトルネックになっているかを特定するために生まれた。CPUがそのひとつになっていると気づいた。最初からCPUを作ろうとしたわけではなく、ボトルネックを解消しようとした結果だ。」

Nvidiaが設計したVera CPUは、Armアーキテクチャをベースにした独自設計のプロセッサで、高速なコア、大容量のメモリ帯域幅、低レイテンシを備える。汎用サーバー向けに最適化された既存のArm系CPU(AmpereやAWS Gravitonなど)と異なり、Vera CPUはAIファクトリー内のワークロード、とりわけツール呼び出しや強化学習(RL)のループ処理を念頭に置いて設計されている点が特徴だ。


CoreWeaveのSandboxesで3倍の起動高速化を確認

CoreWeaveはVera CPUを単体で提供するスタンドアロン容量として提供することを発表した。同社はあわせて、エージェントが強化学習・推論フェーズでタスクを実行するための分離環境「Sandboxes」を提供している。

CoreWeaveでプロダクトのシニアディレクターを務めるHarsh Banwait氏によれば、Vera CPUを使ってSandboxesの性能を検証したところ、Sandboxの起動時間が約3倍に改善したという。

「シリコンから得られるパフォーマンスと、顧客がプロダクトに期待するエクスペリエンスを両立する上で、非常に重要な組み合わせだ。」

Sandboxesはエージェントが外部ツールや環境に対して安全にアクションを実行するための隔離実行環境で、強化学習のループを高速に回すためのインフラとして位置づけられている。エージェントが並列で大量のアクションを試行するRL的なワークロードでは、Sandboxの起動レイテンシが全体のスループットに直結するため、この改善幅は実用上の意味が大きい。


セキュリティも同一トレイに統合

エージェントAIのインフラでは、セキュリティの独立性も課題になる。NvidiaはOpen Agent Safety Platformを通じてこれに対応している。構成は次のとおりだ。

  • OpenShell(セキュアランタイム):Vera CPU上で動作し、エージェントの実行制御を担う
  • DOCA Sentry:BlueField-4 DPU(Data Processing Unit)上で動作し、独立した監視・ポリシー適用を行う

これらはすべてVera Rubinトレイという単一のハードウェア構成に収められている。「Vera Rubin」とは、Vera CPUとNvidiaの次世代GPUアーキテクチャ「Rubin」を組み合わせたシステム構成を指す製品ラインの呼称で、Vera CPUとBlueField-4 DPUが同一トレイに同梱される。セキュリティ機能がGPUと独立したレイヤーで動作するため、モデル側の処理と切り離して監査・制御できる構成になっている。


「弱いリンクが全体を引き戻す」

Banwait氏はインフラ全体の設計方針をこう表現した。

「ネットワーク、CPU、ストレージ、すべてが足並みを揃えて進化しなければならない。どこかのボトルネックに引き続き集中していく。システム全体が前進するとき、それが一体的に行われなければ、チェーンの最も弱いリンクが全体を引き戻すことになる。」

AIインフラの設計では、GPUの性能向上にばかり注目が集まりがちだ。しかしエージェントAIの実ワークロードでは、単一モデルへの推論リクエストではなく、複数ツールの呼び出しや環境との反復的なやり取りが主体となる。このとき、CPU・ネットワーク・ストレージのバランスが全体スループットを左右する。NvidiaとCoreWeaveの今回の取り組みは、その「見えにくいボトルネック」を正面から設計課題として扱い、シリコンレベルから再設計した点にある。


詳細はNvidia and CoreWeave rethink agentic AI infrastructureを参照していただきたい。