规格
| 组件 | 规格 |
|---|---|
| 超级芯片 | NVIDIA GB10 Grace Blackwell,CPU 与 GPU 通过 NVLink-C2C 互联 |
| CPU | 20 核 Arm:10 个 Cortex-X925 加 10 个 Cortex-A725 |
| GPU | NVIDIA Blackwell 架构,第五代 Tensor Core |
| 内存 | 128 GB LPDDR5x,CPU 与 GPU 共享的一块缓存一致的统一内存,256 位 |
| 内存带宽 | 最高 273 GB/s |
| AI 性能 | FP4 稀疏下最高 1 petaFLOP(理论值) |
| 存储 | 4 TB NVMe M.2,带自加密(我们提供的版本) |
| 网络 | ConnectX-7 200 Gbps,10 GbE RJ-45,Wi-Fi 7 |
| 电源 | 240 W 外置电源 |
| 尺寸与重量 | 150 x 150 x 50.5 mm,1.2 kg |
| 操作系统 | NVIDIA DGX OS,基于 Ubuntu 24.04 |
怎么理解宣传数字
1 petaFLOP 是依赖稀疏性的理论 FP4 数字。它不能和数据中心 GPU 常用的稠密 FP8 或 FP16 数字直接比较,所以不要用它来预测你的任务会跑多快。
对日常体验影响最大的是内存带宽。273 GB/s 远低于数据中心 GPU,限制了大型稠密模型生成文本的速度。怎么估算见带宽那篇博客。
因为内存是统一的,这台机器上 nvidia-smi 会把内存占用显示为「Not Supported」,不过每个进程的 GPU 显存仍然会列出。请用系统工具或在框架内部查看占用。为什么这个容易让人困惑。
NVIDIA 说它用来做什么
- 用 FP4 精度对最高 2000 亿参数的模型做推理。
- 微调最高 700 亿参数的模型。
- 两台互联(256GB):FP4 下最高 4000 亿参数的模型。四台需要外接交换机:最高 7000 亿。
- 原型开发,然后把工作迁移到 DGX Cloud 或数据中心。
登录之后会看到什么
这是我们在一台全新实例上会先敲的几条命令。输出展示的是你应该看到的样子:名字和数值依据 NVIDIA 的规格,但我们自己还没有在 DGX Spark 上实测过。
$ nvidia-smi -L
GPU 0: NVIDIA GB10 (UUID: GPU-…)
$ nvidia-smi --query-gpu=name,compute_cap --format=csv,noheader
NVIDIA GB10, 12.1
$ nproc
20NVIDIA 标注的是 20 个 Arm 核心,并在开发者论坛上说 GB10 的计算能力是 12.1。compute_cap 这个查询字段不一定在每个驱动版本上都有,所以这一行是最可能不一样的。
我们出租的规格
| 规格 | 机器数 | 统一内存 | 状态 |
|---|---|---|---|
| 单节点 | 1 | 128 GB | 最先开放 |
| 双节点 | 2,用 200G 线缆互联 | 256 GB | 即将上线 |
| 四节点 | 4,经交换机互联 | 512 GB | 即将上线 |
哪些情况它不是合适的工具
它不是用来在吞吐上和数据中心 GPU 竞争的。如果你要高速服务大量用户,或者从头训练模型,数据中心 GPU 是更好的选择。数字见对比页。
常见问题
DGX Spark 有多少内存?
128 GB LPDDR5x 统一内存,CPU 和 GPU 共用,带宽最高 273 GB/s。
它能跑 700 亿参数的模型吗?
能。NVIDIA 称它可以微调最高 700 亿参数的模型,并用 FP4 对最高 2000 亿参数的模型做推理。70B 模型的权重在 4 位下约 35GB,在 FP8 下约 70GB。
1 petaFLOP 的数字能和 H100 比吗?
不能。它是稀疏条件下的理论 FP4 数字,而数据中心 GPU 通常按稠密 FP8 或 FP16 标注。