powered by TechFeed
表示モード
主要ニュース

NVIDIAがデスクトップAIコンピュータ「DGX Spark 64GB」を発表 — クラウドAPIのトークン課金から解放され、1PFLOPの演算性能を自机で常時稼働させる

10月3日、Jean-marc Mommessinが「NVIDIA Announces DGX Spark 64GB: A 1-PetaFLOP Grace Blackwell Desktop for Local AI Agents, Fine-Tuning, and Inference」と題した記事を公開した。NVIDIAはGB10 Grace Blackwellスーパーチップ搭載のデスクトップAIシステム「DGX Spark」に64GB構成を追加した。AIエージェントのトークン消費量が急増する中、クラウドAPIのトークン単位課金を回避しながら1PFLOPの演算性能をデスクで常時稼働させる選択肢として位置づけられている。

10月3日、Jean-marc Mommessinが「NVIDIA Announces DGX Spark 64GB: A 1-PetaFLOP Grace Blackwell Desktop for Local AI Agents, Fine-Tuning, and Inference」と題した記事を公開した。NVIDIAはGB10 Grace Blackwellスーパーチップ搭載のデスクトップAIシステム「DGX Spark」に64GB構成を追加した。AIエージェントのトークン消費量が急増する中、クラウドAPIのトークン単位課金を回避しながら1PFLOPの演算性能をデスクで常時稼働させる選択肢として位置づけられている。


クラウドAPIのトークン課金から解放される1PFLOPデスクトップ

NVIDIAは、GB10 Grace Blackwellスーパーチップ搭載のデスクトップAIシステム「DGX Spark」に64GB構成を追加した。Acer、ASUS、Dell、Gigabyte、HP、MSIから販売される。

このタイミングには理由がある。AIエージェントはツール呼び出し、リトライ、長いコンテキスト、多段階の計画処理を通じて継続的にトークンを消費する。元記事によれば、トークン消費量は2026年初頭から14倍に増加している。クラウドAPIではそのトークンすべてに課金が発生するが、自前のハードウェアであればトークン単位の費用はゼロだ。

NVIDIAのメッセージはシンプルだ。「メータリングされたAPIの代わりに、自分のデスクでオープンモデルと常時稼働エージェントを動かし、ワークロードが増えたらDGX Sparkをクラスタリングせよ」。


スペック:何が入っているか

GB10スーパーチップは、第5世代Tensor CoresのBlackwell GPUと20コアGrace Arm CPU(Cortex-X925×10 + Cortex-A725×10)を組み合わせたものだ。

スペック DGX Spark 64GB
スーパーチップ NVIDIA GB10 Grace Blackwell
AI演算性能 最大1 PFLOP FP4(スパーシティあり)
メモリ 64GB LPDDR5x、コヒーレント統合型
メモリ帯域幅 273 GB/s
ストレージ 1・2・4TB NVMe M.2(自己暗号化)
ネットワーク ConnectX-7 NIC、200GbE / Wi-Fi 7 / BT 5.3
OS NVIDIA DGX OS(Ubuntuベース)
サイズ / 重量 150×150×50.5mm / 1.2kg
最大モデル規模 最大1000億パラメータ
発売日 2026年10月23日

設計上の最大の特徴はUnified Memory(統合メモリ)だ。CPUとGPUがNVLink-C2C経由で単一のメモリプールを共有する。その帯域幅はPCIe Gen 5の5倍。システムRAMとVRAM間でのウェイトコピーが不要になるため、複数のモデル、KVキャッシュ、ツールプロセスを同一アドレス空間に置けるのがエージェントワークロードにとって実用的な利点だ。

また、標準的なコンセントで動作する。サーバールームも特別な冷却設備も不要で、24時間365日稼働のエージェント用途に向く。

ソフトウェア面では、DGX OSに初回起動時からPyTorch、Jupyter、Ollamaを含むNVIDIA AIスタックが同梱されている。NVIDIA NemoClaw(NVIDIAが提供するエージェントフレームワーク)はコマンド一発でインストールでき、OpenClawエージェント(NVIDIAのオープンエージェント実装)にプライバシー・セキュリティ制御を追加する。


64GBで動くオープンモデルの実態

NVIDIAは64GBを「今日の30〜35Bクラスのオープンモデルには十分」と位置づける。

モデル 開発元 規模 フットプリント 想定用途
Muse Glimmer Meta 29.6B dense 約17GB(量子化) メインエージェントモデル
Nemotron 3.5 Lightning NVIDIA 30B MoE NVFP4チェックポイント 長時間稼働エージェント
Qwen3.8-27B Alibaba Qwen 27B dense 約13.5GB(4-bit) 汎用エージェント・コーディング

注意点もある。元記事によれば、Muse GlimmerはMetaが提供するオープンモデルとして紹介されているが、そのBF16フル精度版は55GB以上を必要とし、コンテキスト用のメモリがほぼ残らない。量子化した約17GB版が64GB環境での現実的な選択肢だ。DeepSeek V4 Flashのような大規模モデルは1台では動かず、NVIDIAの公式ベンチマークでは64GBを4台クラスタリングして実行している。


1台で何ができるか、できないか

元記事はできることとできないことをどちらも明示している。まず実用性が高いユースケースを2つ取り上げ、続いて適さない用途を示す。

常時稼働のパーソナルエージェント:Muse GlimmerやNemotron 3.5 Lightningと連携するエージェントを立ち上げ、GitHubリポジトリ、テストランナー、arXivのRSSフィードなどのツールを与えて夜間に走らせる。プライベートなコード・ノート・メールはマシンの外に出ない。

自社リポジトリでのファインチューニング:64GBでは70Bモデルに対するQLoRA(量子化を活用した低ランク適応の手法)が収まる。NVIDIAの計測では、nanochat分散ファインチューニングで単一ノードあたり約18,400トークン/秒を記録している。自社コードベースや過去のPRレビューで訓練し、社内規約を知るコーディングアシスタントとしてローカルで提供できる。

他にも、Hugging Faceに公開された新モデルの当日評価(API費用なしで50回再実行できる)、複数モデルを統合メモリ上で協調させるマルチエージェント構成、エッジ・ロボティクスのプロトタイピングなどが挙げられている。

一方、適さないケースも明示されている。

  • 100人規模の同時ユーザーへの提供には向かない:273 GB/sの帯域幅が同時デコードスループットの上限になる
  • 長い入力・短い出力に最適化されている:リポジトリ全体、ログダンプ、論文群を読んで短い結果を返す処理に向く
  • 64GBは1台あたり最大1000億パラメータが上限:それ以上は2台クラスタか128GB構成を選ぶ必要がある

2台クラスタリングで何が変わるか

全機にConnectX-7(200GbE)が標準搭載されており、クラスタリングはオプションではなくネイティブ機能だ。

構成 統合メモリ AI演算性能(FP4)
64GB × 1台 64GB 最大1 PFLOP
64GB × 2台 128GB 最大2 PFLOPS
128GB × 4台 512GB 最大4 PFLOPS

NVIDIAの発表では、64GB×2台のクラスタは128GB単体に対して最大1.7倍の性能を発揮するとしている。2台で帯域幅が546 GB/sに倍増することが主な理由だ。

クラスタ管理はNVIDIA Sync(WindowsおよびmacOS対応)が担う。ConnectX-7の設定を自動化し、最大4台のノードをサポートする。Tailscaleメッシュを使えばクラウドを経由せず拠点をまたいで接続することも可能だ。

ステップバイステップのマルチノード構成ガイドはbuild.nvidia.com/sparkに公開されている。DGX Spark 128GB版は引き続き販売される。

詳細はNVIDIA Announces DGX Spark 64GB: A 1-PetaFLOP Grace Blackwell Desktop for Local AI Agents, Fine-Tuning, and Inferenceを参照していただきたい。