powered by TechFeed
表示モード
Deep Dive

LLM推論のKVキャッシュをGPUメモリの外に追い出す — オブジェクトストレージからRDMA直接転送で再計算の14倍速を達成

10月9日、StorageReviewが「Scality AI Inference Factory Serves KV Cache From Object Storage Over RDMA, 14x Faster Than Recompute」と題した記事を公開した。LLM推論における長大なコンテキストのコスト問題——KVキャッシュの再計算か、高価なGPUメモリへの保持か——に対して、ScalityはオブジェクトストレージへのオフロードとRDMA直接転送という第三の道を提示する。再計算比で最大72倍、ベースラインで14倍という実測値を伴う新スタック「Scality AI Inference Factory」の中身を見ていく。

10月9日、StorageReviewが「Scality AI Inference Factory Serves KV Cache From Object Storage Over RDMA, 14x Faster Than Recompute」と題した記事を公開した。LLM推論における長大なコンテキストのコスト問題——KVキャッシュの再計算か、高価なGPUメモリへの保持か——に対して、ScalityはオブジェクトストレージへのオフロードとRDMA直接転送という第三の道を提示する。再計算比で最大72倍、ベースラインで14倍という実測値を伴う新スタック「Scality AI Inference Factory」の中身を見ていく。


リコンピュートの14倍、KVキャッシュをオブジェクトストレージから直接提供

Scality CTOのGiorgio Regni氏は次のように述べている。

「ScalityのADI上のKVキャッシュは、サービング経路に置けるほど高速だ。ADIからコンテキストを復元する時間はGPUメモリと同じオーダーであり、リコンピュートより14倍速い。ストレージがKVキャッシュをGPUサーバー内に保持し続ける理由はもはやない。」

この「14倍」という数字の背景にある仕組みが本題だ。

LLM推論でコンテキストが長くなるほど、プロンプトのPrefill(KVキャッシュの計算)は重くなる。返ってきたセッションをまた同じGPUで処理するか、キャッシュを再計算するか——という問題を、Scalityはオブジェクトストレージへのオフロードで解決しようとしている。

具体的なデータパスはこうだ。GPU側がメモリを確保し、どのオブジェクトをそこに配置するかをADI(Scality AI Data Infrastructure)に伝える。ストレージサーバーはTLC NVMeからRAMへPCIe経由でオブジェクトを移動させ、NICがRDMA(Remote Direct Memory Access:ホストCPUを介さずネットワーク越しにメモリ間でデータを直接転送する技術)でGPUメモリに直接書き込む。CPU・カーネル・ソフトウェアスタックを完全にバイパスする経路であり、Scalityはこのパスでネットワーク回線速度の**97%**を達成したと述べている。


実測値:72倍差が出たケースも

Scalityのテスト環境はあえて控えめな構成だ——8GPU×1サーバー、数世代前の5台のストレージサーバー、100Gb/s RDMAリンク×4(ネットワークがボトルネック)。製品自体は400Gb/sファブリックで動作するとしており、テストに使用したGPUの型番は非公開となっている。なお、ストレージサーバーの詳細な世代・スペックも元記事には記載がなく、結果の厳密な再現性評価は難しい点は留意されたい。

主要なベンチマーク結果は以下の通り:

  • 14Kトークンのコンテキスト:ADIからの復元は166ms、HBM(High Bandwidth Memory:GPU内蔵の広帯域メモリ)からの提供は83ms、リコンピュートは2.3秒 → ADIは14倍高速
  • 438,764トークン(GLM-5.2):リコンピュート529秒に対し、ADIからの読み出しは7.3秒 → 72倍の差。このセッション1件で生成されたKVキャッシュは189GB(約430KB/トークン)。これは8枚のGPU全体のHBM残量を超える
  • 8TBのKVキャッシュ保持:1GPUメモリの80倍以上、サーバー全体の約10倍に相当。キャッシュサイズが69GBから8TBに変化しても、最初のトークンまでのレイテンシは355〜373msの範囲に収まった
  • Gemma-3 27B(54.86GB)のモデルロード:1GPU分を1.9秒で完了(約28.9GB/s)。Scalityによれば、GPUサーバーのローカルドライブの約10倍の速度

アーキテクチャの構造

スタック全体の構成を整理する。

vLLMとDynamoをベースにしたサービング層がPrefillとDecodeを分離する。これはDisaggregated Servingと呼ばれる手法で、プロンプト処理(Prefill)と出力トークン生成(Decode)をそれぞれ専用のGPUプールに分け、独立してスケールさせるアーキテクチャだ。KVキャッシュはvLLMが固定サイズの名前付きブロックに分割し、ADIがオブジェクトとして保存する。Prefillプールが新しいプロンプトのキャッシュを計算してADIに書き込み、任意のDecodeプールがそれを読み出すため、特定のGPUにセッションが固定されない。

ADIへのアクセスには「Scality AI Connector」が使われる。通常のS3制御プレーンをシンプルな専用プレーンに置き換え、シングルパス認証を採用し、XMLとマルチパートフレーミングを除去している。

なお、Scalityはvllmのコアに手を入れず、KVオフロードコネクタ(必要なキャッシュブロック数の約5倍を取得していたバグ)を修正した。モデルロード用のオープンソースローカルModelExpressローダーを拡張し、オブジェクトストレージから直接ウェイトを取得できるようにしている。出荷スタックにScalityがフォークしたコンポーネントは含まれていないとのことだ。


対象ハードウェアと検証済みモデル

Dell・HPE・Lenovo・Supermicroの標準サーバーに対応。ADIはNVMe上でマルチペタバイトスケールで動作し、大容量KVキャッシュ向けにHDDへのRDMAアクセスも備える。TLCフラッシュ・HDD・オプションのテープを単一ネームスペースで自動階層化する。

検証済みモデルファミリーはMistral・Gemma・Qwen・DeepSeekなど7系統、対応エージェントフレームワークはLangGraph・Pydantic AIなど複数。Claude Code・Codex・OpenCodeはローカルエンドポイントに向けるだけで動作するとされている。

ソフトウェアライセンスまたはフルマネージドサービスとして提供開始。元記事公開日(10月9日)時点ではパリで開催のScality Dayにて実機デモが行われていた。


詳細はScality AI Inference Factory Serves KV Cache From Object Storage Over RDMA, 14x Faster Than Recomputeを参照していただきたい。