powered by TechFeed
表示モード
Deep Dive

AIエージェントの賢さを決めるのはモデルではなくインフラだった — CoreWeaveが「8時間でポストトレーニング完了」を実現した仕組み

10月6日、SiliconAngleが「GPU utilization in post-training shapes better AI agents」と題した記事を公開した。この記事では、ポストトレーニング時のGPU活用効率がAIエージェントの品質を左右するという、CoreWeaveとYou.comの幹部の主張について詳しく紹介されている。AIエージェント開発の「ボトルネック」が、モデルの知性からインフラ側の処理効率へと移行しつつある——その実態を、8時間でのポストトレーニング完了という具体的な実績から読み解いていく。「モデルの賢さ」はもはやボトルネックではないYou.comのCPO(最高製品責任者)であるSaurabh Sharmaは、AIエージェントの性能を決める要因がモデルの知性から「ツールの使いこなし」へと移行しつつあると述べている。

10月6日、SiliconAngleが「GPU utilization in post-training shapes better AI agents」と題した記事を公開した。この記事では、ポストトレーニング時のGPU活用効率がAIエージェントの品質を左右するという、CoreWeaveとYou.comの幹部の主張について詳しく紹介されている。AIエージェント開発の「ボトルネック」が、モデルの知性からインフラ側の処理効率へと移行しつつある——その実態を、8時間でのポストトレーニング完了という具体的な実績から読み解いていく。

「モデルの賢さ」はもはやボトルネックではない

You.comのCPO(最高製品責任者)であるSaurabh Sharmaは、AIエージェントの性能を決める要因がモデルの知性から「ツールの使いこなし」へと移行しつつあると述べている。

「天井はもはやモデルの知性ではない。モデルはどんどん賢くなっているが、エージェントの成否を決めるのは、そのモデルがツールをどれだけ使いこなせるかだ」

この発言はFullyConnectedイベント上のインタビューでのものだ。CoreWeaveのSVP(シニアバイスプレジデント)Corey SandersとともにtheCUBEの収録に応じた。

You.comは自前のWebインデックスを持ち、AIエージェントに検索レイヤーを提供する企業だ。CoreWeaveのパートナーネットワークに参加しており、NvidiaとともにCoreWeaveのRL Rollouts(後述)を活用した実証例を持つ。その対象となったのがNemotron 3.5 Lightning——Nvidiaが開発した軽量・高速推論向けの言語モデルだ。このモデルをYou.comのWeb検索ツールと組み合わせてポストトレーニングするのに要した時間はわずか8時間だったという。

「8時間でできるなら、これはもうフロンティアラボだけができることではない」とSharmaは述べた。

大規模な研究機関でなければ現実的でなかったポストトレーニングのサイクルが、インフラの最適化によって一般的な開発組織にも開かれつつあることを示す発言だ。

ポストトレーニングのループでGPU稼働率を高く保つ課題

ポストトレーニング(post-training)とは、事前学習済みモデルを特定のタスクや評価基準に合わせて継続的に改善するプロセスだ。強化学習(RL)を使って生成→評価→重み更新のサイクルを繰り返す。問題は、このサイクルの合間にGPUがアイドル状態になりやすいことだ。

CoreWeaveはCoreWeave Forgeを発表し、モデルのデプロイ・評価・改善を一連のループとして接続する仕組みを提供している。その中核となるのが現在プレビュー中のRL Rollouts機能だ。

GPUの稼働率を下げないために、CoreWeaveが特に力を入れているのがウェイト(モデルパラメータ)の同期コスト削減だ。Sandersはその仕組みを次のように説明した。

「ウェイト同期において、毎回コールドスタートするのではなくホットスタートできるよう取り組んできた。ウェイトを常にオブジェクトストレージから取得するのではなく、近くにいる他のピアからウェイトを受け取る仕組みにした」

オブジェクトストレージのボトルネックを回避し、近隣ノードからウェイトを直接受け渡すことでラウンド間のダウンタイムを圧縮するアプローチだ。強化学習のループにおいて「生成」と「学習」のフェーズ間でモデルの重みを再配布する処理は頻繁に発生するため、この最適化がエンドツーエンドのスループットに直接影響する。

インフラ側の工夫:ストレージをGPUに合わせて設計する

もう一つの改善点はCoreWeave AI Object Storageだ。クロスリージョン書き込みをサポートし、あるリージョンでのポストトレーニングの結果を別のリージョンのジョブが即座に利用できる。

「ローカルマシンに書くように書ける。でも裏側ではグローバルシステムとして扱っている」とSandersは述べた。

「GPUにデータをできるだけ速く、簡単に渡す」という設計思想でストレージを構築しているという点が、汎用クラウドとの差別化として強調されている。ポストトレーニングにおいては、チェックポイントの保存・読み込みや評価データのI/Oがボトルネックになりやすく、このストレージ設計がGPU稼働率の維持に直結する。

まとめ:エージェント品質の改善速度はインフラが決める

SharmaとSandersの主張を整理すると、エージェントの品質改善のサイクルを速めるには、モデルアーキテクチャだけでなくインフラ側でのウェイト配信とデータ移動の最適化が不可欠だということだ。8時間でのポストトレーニングという実績は、このアプローチが大規模ラボ以外にも開かれつつある可能性を示している。モデルの性能が急速にコモディティ化していく中で、「どれだけ速くモデルをタスクに適応させられるか」という反復速度こそが、AIエージェント開発の競争軸になりつつある。

詳細はGPU utilization in post-training shapes better AI agentsを参照していただきたい。