10月6日、WccftechのRohail Saleemが「The 552B DeepSeek V4.1-Flash Model Offers A Peak Output Of 494 Tokens/Second When Powered By An At-Home Rig Spanning 4x NVIDIA DGX Spark Units」と題した記事を公開した。自宅に並べた4台のNVIDIA DGX Sparkで552BパラメータのLLMを動かし、ピーク494トークン/秒を記録したという数値は、Cerebrasのような高速推論特化サービスに匹敵する水準だ。「ローカルで大規模モデルを動かすと遅い」という常識が、着実に崩れてきている。
552BパラメータのLLMを自宅で動かす、その実力
ローカルLLM実行の文脈で「大規模モデル」と「実用的なスループット」を両立するのは長らく困難だったが、その壁が着実に下がっている。独立系アナリスト・Moor Insights & Strategy創業者のPatrick Moorheadが、自宅に4台のNVIDIA DGX Sparkを並べた構成でDeepSeek V4.1-Flash(552Bパラメータ)を動作させ、ピーク494トークン/秒という数値を記録した。
この数字は、Cerebrasが提供する高速推論特化サービスに匹敵する水準だ。ただし、Cerebrasはウェーハスケールチップを活用した極めて特殊なアーキテクチャであり、汎用的なクラウドAI推論サービス全般の代表ではない点には留意が必要だ。それを踏まえてもなお、コンシューマー向けに近い価格帯のハードウェア4台でこの数値を達成したことの意義は大きい。
構成:4ノードDGX Sparkのリング接続
Moorheadの構成は、コンパクトな「tec MOJO」ラックに4台のDGX Sparkを収め、追加の冷却ファンを下部に設置したものだ。
各DGX Sparkの主なスペックは以下のとおりである:
- CPU:20コアARM(Cortex-X925×10 + Cortex-A725×10)
- GPU:GB10 iGPU(第5世代Tensor Core搭載、FP32で31 TFLOPS、NVFP4で1,000 TOPS)
- メモリ:128 GB LPDDR5X(CPU/GPU共有)、帯域幅 約273 GB/s
- NIC:ConnectX-7 SmartNIC、デュアル200 Gb/s QSFPポート
- 消費電力:140〜240 W(アダプター込み)
4台を合計すると統合メモリ約512 GBになる。
接続方式として、Moorheadはスイッチレスのリングトポロジーを採用した。QSFPケーブルで以下のように接続している:
- Spark 1 ↔ Spark 2 ↔ Spark 3 ↔ Spark 4 ↔ Spark 1(環状)
NVIDIAは本来、200 GbEスイッチを用いたスター(Star)トポロジー(中央のスイッチに全ノードを接続する方式)を推奨しているが、スイッチを省くことでコスト削減を実現している。その代償として帯域の効率は若干落ちるが、後述のベンチマーク結果を見れば実用上の問題はほぼないといえる。
なぜV4.1-Flashがこの構成にはまるのか
DeepSeek V4.1-Flashは総パラメータ数552Bながら、MoE(Mixture of Experts)アーキテクチャにより推論時のアクティブパラメータ数を大幅に絞っている。具体的には:
- プリフィル段階でアクティブなパラメータ:8B
- デコード段階でアクティブなパラメータ:16B
- エキスパート構成:共有エキスパート×1 + ルーティングエキスパート×384(うち6つがアクティブ)
さらに、元記事によれば、CED(Causal Encoder-Decoder)、CSA2(Compressed Sparse Attention 2)、FP4量子化、SWA Bounded Replayといった独自アーキテクチャの組み合わせにより、KVキャッシュを1トークンあたりわずか890バイトまで圧縮しているとされる。
- CED(Causal Encoder-Decoder):エンコーダーとデコーダーを因果的に結合し、プリフィル効率を高める設計
- CSA2(Compressed Sparse Attention 2):スパース化によりAttentionの計算・メモリコストを削減する機構
- SWA Bounded Replay:Sliding Window Attention(局所的なウィンドウ内のみAttentionを計算する手法)の変形で、長文脈での効率を改善するとされる
これらの圧縮技術の組み合わせが、512 GBの統合メモリでも余裕を持って収まる理由だ(実際のメモリ使用量は476 GB)。ただし、これらのアーキテクチャの詳細はWccftechの元記事を根拠としており、DeepSeek公式の技術レポートとの照合を経ていない点は留意されたい。
ベンチマーク結果
| 指標 | 数値 |
|---|---|
| ピーク出力(コード、32並列リクエスト) | 494 tok/s |
| ピーク出力(散文、32並列リクエスト) | 280 tok/s |
| シングルリクエスト(散文) | 約58 tok/s |
| シングルリクエスト(コード) | 約96 tok/s |
| プロンプト処理速度 | 約4,764 tok/s |
| 初回トークンまでの時間(アイドル時) | 約0.2秒 |
コスト試算
構成ごとのコストは以下のとおりだ:
- DGX Spark×4(128 GBモデル):**$22,000〜$36,000**
- QSFPダイレクトアタッチケーブル(リング接続分):数百ドル
- ラック・追加ファン・電源分配など:数百ドル
合計:$25,000〜$40,000程度
高額ではあるが、この構成を24時間365日稼働させた場合の電力コストについても触れておきたい。4台の負荷時消費電力は合計で約1,600〜2,400 Wと見積もられる。仮に平均2,000 Wで月720時間稼働させると月間電力消費は約1,440 kWhとなり、米国平均の電気料金(約$0.16/kWh)で換算すると月額約$230程度になる計算だ(※編集部の考察:電気料金は地域・契約によって大きく異なるため、あくまで目安である)。ハードウェアの初期投資が大きい一方、OpenAIやAnthropicのAPIのようなリクエスト制限や従量課金が発生しない点は、大量推論を必要とするユースケースでは大きなアドバンテージになる。




