Podvek
控制台

NVIDIA DGX Spark:规格,以及它适合做什么

一台紧凑的 AI 电脑,CPU 和 GPU 共用 128GB 内存。这里讲它里面有什么,这对你的工作意味着什么。

更新于 2026年10月7日

规格

NVIDIA DGX Spark 规格,来自 NVIDIA 数据表
组件规格
超级芯片NVIDIA GB10 Grace Blackwell,CPU 与 GPU 通过 NVLink-C2C 互联
CPU20 核 Arm:10 个 Cortex-X925 加 10 个 Cortex-A725
GPUNVIDIA Blackwell 架构,第五代 Tensor Core
内存128 GB LPDDR5x,CPU 与 GPU 共享的一块缓存一致的统一内存,256 位
内存带宽最高 273 GB/s
AI 性能FP4 稀疏下最高 1 petaFLOP(理论值)
存储4 TB NVMe M.2,带自加密(我们提供的版本)
网络ConnectX-7 200 Gbps,10 GbE RJ-45,Wi-Fi 7
电源240 W 外置电源
尺寸与重量150 x 150 x 50.5 mm,1.2 kg
操作系统NVIDIA DGX OS,基于 Ubuntu 24.04

怎么理解宣传数字

1 petaFLOP 是依赖稀疏性的理论 FP4 数字。它不能和数据中心 GPU 常用的稠密 FP8 或 FP16 数字直接比较,所以不要用它来预测你的任务会跑多快。

对日常体验影响最大的是内存带宽。273 GB/s 远低于数据中心 GPU,限制了大型稠密模型生成文本的速度。怎么估算见带宽那篇博客。

因为内存是统一的,这台机器上 nvidia-smi 会把内存占用显示为「Not Supported」,不过每个进程的 GPU 显存仍然会列出。请用系统工具或在框架内部查看占用。为什么这个容易让人困惑。

NVIDIA 说它用来做什么

  • 用 FP4 精度对最高 2000 亿参数的模型做推理。
  • 微调最高 700 亿参数的模型。
  • 两台互联(256GB):FP4 下最高 4000 亿参数的模型。四台需要外接交换机:最高 7000 亿。
  • 原型开发,然后把工作迁移到 DGX Cloud 或数据中心。

登录之后会看到什么

这是我们在一台全新实例上会先敲的几条命令。输出展示的是你应该看到的样子:名字和数值依据 NVIDIA 的规格,但我们自己还没有在 DGX Spark 上实测过。

示意输出,我们还没有实测示意输出
$ nvidia-smi -L
GPU 0: NVIDIA GB10 (UUID: GPU-…)
$ nvidia-smi --query-gpu=name,compute_cap --format=csv,noheader
NVIDIA GB10, 12.1
$ nproc
20

NVIDIA 标注的是 20 个 Arm 核心,并在开发者论坛上说 GB10 的计算能力是 12.1。compute_cap 这个查询字段不一定在每个驱动版本上都有,所以这一行是最可能不一样的。

我们出租的规格

出租规格
规格机器数统一内存状态
单节点1128 GB最先开放
双节点2,用 200G 线缆互联256 GB即将上线
四节点4,经交换机互联512 GB即将上线

哪些情况它不是合适的工具

它不是用来在吞吐上和数据中心 GPU 竞争的。如果你要高速服务大量用户,或者从头训练模型,数据中心 GPU 是更好的选择。数字见对比页。

常见问题

DGX Spark 有多少内存?

128 GB LPDDR5x 统一内存,CPU 和 GPU 共用,带宽最高 273 GB/s。

它能跑 700 亿参数的模型吗?

能。NVIDIA 称它可以微调最高 700 亿参数的模型,并用 FP4 对最高 2000 亿参数的模型做推理。70B 模型的权重在 4 位下约 35GB,在 FP8 下约 70GB。

1 petaFLOP 的数字能和 H100 比吗?

不能。它是稀疏条件下的理论 FP4 数字,而数据中心 GPU 通常按稠密 FP8 或 FP16 标注。

准备好了就开机

先充值,再选规格。没有空闲机器时,排队不收费。