powered by TechFeed
表示モード
主要ニュース

CoreWeaveが「GPU提供」からAI推論フルスタックへ転換 — モデルリロードを15倍高速化する強化学習向け新機能が話題に

10月8日、SiliconAngleが「AI inference gets a full stack as CoreWeave launches Forge」と題した記事を公開した。CoreWeaveがAI推論のフルスタックプラットフォーム「Forge」をローンチし、推論インフラの最適化に向けたマネージドサービス群を整備したことについて詳しく紹介されている。

10月8日、SiliconAngleが「AI inference gets a full stack as CoreWeave launches Forge」と題した記事を公開した。CoreWeaveがAI推論のフルスタックプラットフォーム「Forge」をローンチし、推論インフラの最適化に向けたマネージドサービス群を整備したことについて詳しく紹介されている。


推論がAIクラウドの主戦場になりつつある

AIワークロードの重心がトレーニングから推論(Inference)へと移行しつつある。モデルを学習させるフェーズが一巡し、今度はそのモデルをいかに速く・安く本番提供するかが、クラウドプロバイダーの競争軸になってきた。

theCUBE Researchがまとめたユーザー調査では、あるヘルスケア企業の推論ワークロード比率が1年目の約10%から2年目には40%に上昇し、12ヶ月以内に約50%に達する見込みだという。この変化を受け、CoreWeaveはGPUキャパシティの提供にとどまらず、その上位レイヤー──ストレージ、ネットワーク、ソフトウェア──へと事業を拡張している。


Forgeとは何か

CoreWeave Forgeは、Fully Connectedイベントで発表されたプラットフォームで、以下の4つの機能領域を一つに統合する。

  • Serving(モデルサービング)
  • Observability(監視・可観測性)
  • Post-training(ファインチューニング等のトレーニング後処理)
  • Evaluation(モデル評価)

Serving

Servingはモデルを本番環境へデプロイし、リクエストをさばくコア機能だ。内部ではvLLMエンジン、量子化モデル、カスタムのSpeculative Decoderといったオープンソースのツールを積み重ねてスタックを構成している。「オープンソースに貢献しながら、その上にマネージドサービスを重ねていく」というアプローチをChowdhary氏は強調している。

Observability

Observabilityはデプロイ済みモデルの動作をリアルタイムで監視・追跡する機能だ。推論レイテンシやスループット、エラー率といったメトリクスを継続的に収集することで、本番環境における品質劣化や異常を早期に検出できる。単なるインフラ監視にとどまらず、モデルの応答品質を可視化する「AIオブザーバビリティ」の領域をカバーする点が特徴とされている。

Post-training

Post-trainingは、ベースモデルをタスクや用途に合わせて最適化するファインチューニングやRLHF(人間のフィードバックによる強化学習)などの処理を担う。Serving基盤と同一プラットフォーム上で完結するため、チェックポイントの受け渡しや環境の切り替えといった摩擦を減らしながらイテレーションを回せる設計になっている。

Evaluation

Evaluationはデプロイ前後のモデル品質を定量的に測定する機能だ。モデルの更新や切り替えに際して回帰が生じていないかを体系的に検証できる。ObservabilityやPost-trainingと組み合わせることで、開発・評価・改善のループを単一プラットフォーム内で完結させることが目的とされている。

料金体系は無料スタートのフリーミアム型で、追加機能へのアクセスは有料ティアで提供される。個人開発者でも最初から商用グレードのパフォーマンスと信頼性を利用できる設計になっている、とCoreWeaveのプロダクト&AIサービス担当VPのUrvashi Chowdhary氏は述べている。

「たとえ個人開発者として今日サインアップしたとしても、最高のパフォーマンスと信頼性を得られる。妥協する必要はない」(Chowdhary氏)


最大のポイント:RL Rolloutsによる推論ボトルネックの解消

エンジニア的に最も興味深いのが、**CoreWeave RL Rollouts**という新機能だ。

強化学習(RL)でエージェント型モデルをトレーニングする際、報酬関数やVerifierを使って新しいモデルチェックポイントが次々と生成される。このチェックポイントを推論環境にデプロイするたびに発生するリロードの遅延が、トレーニングループ全体のボトルネックになっていた。

RL RolloutsはNVIDIAのDynamoフレームワーク上に構築されている。Dynamoは分散推論環境におけるスケジューリングやKVキャッシュ管理を最適化するNVIDIAのオープンソース推論フレームワークで、2025年にNVIDIAが公開した。CoreWeaveはこのDynamoを基盤として、稼働中のデプロイメントに新しいチェックポイントをホットロードする仕組みを実装している。テスト結果では、モデルリロードのレイテンシがベースライン比で15倍改善したとされている。

「RLロールアウト中は、新しいモデルチェックポイントを継続的に作成し続ける。それを推論環境にロールアウトして、トレーニングを続けながら推論をスケールさせたい。それを15倍高速化できた」(Chowdhary氏)

トレーニングと推論が密結合しているエージェント型AIの開発では、この遅延削減はイテレーションサイクル全体の速度に直結する。RL時の推論ボトルネックはHugging FaceやLLM開発のMLエンジニアの間で長らく課題として議論されてきたトピックであり、15倍という数字の再現性については今後注目が集まるとみられる。


推論インフラ市場の文脈

CoreWeaveはもともとGPUレンタルに特化したクラウドとして急成長した企業だ。しかし、AWS・Google Cloud・Azureといったハイパースケーラーが推論専用サービスを強化する中、差別化の軸を「ハードウェアの生提供」から「最適化済みフルスタック」へとシフトさせている。Forgeはその戦略の具体化といえる。


詳細はAI inference gets a full stack as CoreWeave launches Forgeを参照していただきたい。