powered by TechFeed
表示モード
Deep Dive

552Bパラメータの巨大LLMを自宅4台構成で494トークン/秒 — 高速推論特化サービスに匹敵するスループットをオンプレで実現できる時代に

10月6日、WccftechのRohail Saleemが「The 552B DeepSeek V4.1-Flash Model Offers A Peak Output Of 494 Tokens/Second When Powered By An At-Home Rig Spanning 4x NVIDIA DGX Spark Units」と題した記事を公開した。自宅に並べた4台のNVIDIA DGX Sparkで552BパラメータのLLMを動かし、ピーク494トークン/秒を記録したという数値は、Cerebrasのような高速推論特化サービスに匹敵する水準だ。「ローカルで大規模モデルを動かすと遅い」という常識が、着実に崩れてきている。

10月6日、WccftechのRohail Saleemが「The 552B DeepSeek V4.1-Flash Model Offers A Peak Output Of 494 Tokens/Second When Powered By An At-Home Rig Spanning 4x NVIDIA DGX Spark Units」と題した記事を公開した。自宅に並べた4台のNVIDIA DGX Sparkで552BパラメータのLLMを動かし、ピーク494トークン/秒を記録したという数値は、Cerebrasのような高速推論特化サービスに匹敵する水準だ。「ローカルで大規模モデルを動かすと遅い」という常識が、着実に崩れてきている。


552BパラメータのLLMを自宅で動かす、その実力

ローカルLLM実行の文脈で「大規模モデル」と「実用的なスループット」を両立するのは長らく困難だったが、その壁が着実に下がっている。独立系アナリスト・Moor Insights & Strategy創業者のPatrick Moorheadが、自宅に4台のNVIDIA DGX Sparkを並べた構成でDeepSeek V4.1-Flash(552Bパラメータ)を動作させ、ピーク494トークン/秒という数値を記録した。

この数字は、Cerebrasが提供する高速推論特化サービスに匹敵する水準だ。ただし、Cerebrasはウェーハスケールチップを活用した極めて特殊なアーキテクチャであり、汎用的なクラウドAI推論サービス全般の代表ではない点には留意が必要だ。それを踏まえてもなお、コンシューマー向けに近い価格帯のハードウェア4台でこの数値を達成したことの意義は大きい。


構成:4ノードDGX Sparkのリング接続

Moorheadの構成は、コンパクトな「tec MOJO」ラックに4台のDGX Sparkを収め、追加の冷却ファンを下部に設置したものだ。

各DGX Sparkの主なスペックは以下のとおりである:

  • CPU:20コアARM(Cortex-X925×10 + Cortex-A725×10)
  • GPU:GB10 iGPU(第5世代Tensor Core搭載、FP32で31 TFLOPS、NVFP4で1,000 TOPS)
  • メモリ:128 GB LPDDR5X(CPU/GPU共有)、帯域幅 約273 GB/s
  • NIC:ConnectX-7 SmartNIC、デュアル200 Gb/s QSFPポート
  • 消費電力:140〜240 W(アダプター込み)

4台を合計すると統合メモリ約512 GBになる。

接続方式として、Moorheadはスイッチレスのリングトポロジーを採用した。QSFPケーブルで以下のように接続している:

  • Spark 1 ↔ Spark 2 ↔ Spark 3 ↔ Spark 4 ↔ Spark 1(環状)

NVIDIAは本来、200 GbEスイッチを用いたスター(Star)トポロジー(中央のスイッチに全ノードを接続する方式)を推奨しているが、スイッチを省くことでコスト削減を実現している。その代償として帯域の効率は若干落ちるが、後述のベンチマーク結果を見れば実用上の問題はほぼないといえる。


なぜV4.1-Flashがこの構成にはまるのか

DeepSeek V4.1-Flashは総パラメータ数552Bながら、MoE(Mixture of Experts)アーキテクチャにより推論時のアクティブパラメータ数を大幅に絞っている。具体的には:

  • プリフィル段階でアクティブなパラメータ:8B
  • デコード段階でアクティブなパラメータ:16B
  • エキスパート構成:共有エキスパート×1 + ルーティングエキスパート×384(うち6つがアクティブ)

さらに、元記事によれば、CED(Causal Encoder-Decoder)、CSA2(Compressed Sparse Attention 2)、FP4量子化、SWA Bounded Replayといった独自アーキテクチャの組み合わせにより、KVキャッシュを1トークンあたりわずか890バイトまで圧縮しているとされる。

  • CED(Causal Encoder-Decoder):エンコーダーとデコーダーを因果的に結合し、プリフィル効率を高める設計
  • CSA2(Compressed Sparse Attention 2):スパース化によりAttentionの計算・メモリコストを削減する機構
  • SWA Bounded Replay:Sliding Window Attention(局所的なウィンドウ内のみAttentionを計算する手法)の変形で、長文脈での効率を改善するとされる

これらの圧縮技術の組み合わせが、512 GBの統合メモリでも余裕を持って収まる理由だ(実際のメモリ使用量は476 GB)。ただし、これらのアーキテクチャの詳細はWccftechの元記事を根拠としており、DeepSeek公式の技術レポートとの照合を経ていない点は留意されたい。


ベンチマーク結果

指標 数値
ピーク出力(コード、32並列リクエスト) 494 tok/s
ピーク出力(散文、32並列リクエスト) 280 tok/s
シングルリクエスト(散文) 約58 tok/s
シングルリクエスト(コード) 約96 tok/s
プロンプト処理速度 約4,764 tok/s
初回トークンまでの時間(アイドル時) 約0.2秒

コスト試算

構成ごとのコストは以下のとおりだ:

  • DGX Spark×4(128 GBモデル):**$22,000〜$36,000**
  • QSFPダイレクトアタッチケーブル(リング接続分):数百ドル
  • ラック・追加ファン・電源分配など:数百ドル

合計:$25,000〜$40,000程度

高額ではあるが、この構成を24時間365日稼働させた場合の電力コストについても触れておきたい。4台の負荷時消費電力は合計で約1,600〜2,400 Wと見積もられる。仮に平均2,000 Wで月720時間稼働させると月間電力消費は約1,440 kWhとなり、米国平均の電気料金(約$0.16/kWh)で換算すると月額約$230程度になる計算だ(※編集部の考察:電気料金は地域・契約によって大きく異なるため、あくまで目安である)。ハードウェアの初期投資が大きい一方、OpenAIやAnthropicのAPIのようなリクエスト制限や従量課金が発生しない点は、大量推論を必要とするユースケースでは大きなアドバンテージになる。


詳細はThe 552B DeepSeek V4.1-Flash Model Offers A Peak Output Of 494 Tokens/Second When Powered By An At-Home Rig Spanning 4x NVIDIA DGX Spark Unitsを参照していただきたい。