公布的规格
| DGX Spark | H100 SXM | H100 PCIe | |
|---|---|---|---|
| 内存 | 128 GB LPDDR5x,与 CPU 统一 | 80 GB HBM3 | 80 GB HBM2e |
| 内存带宽 | 最高 273 GB/s | 3.35 TB/s | 2,000 GB/s |
| 功耗 | 整机 240 W 电源 | GPU 最高 700 W | GPU 350 W |
| 形态 | 桌面级整机,1.2 kg | 数据中心模组 | 数据中心 PCIe 卡 |
H100 的数字只是 GPU 本身。DGX Spark 是一台完整的电脑,所以它的功耗数字还包含 CPU、内存和存储。
这些数字说明什么
按公布的数字算,H100 SXM 的内存带宽大约是 DGX Spark 的 12 倍(3,350 除以 273)。这是我们自己算的,不是 NVIDIA 的说法。对于每生成一个 token 都要读完整个模型的任务,比如用大型稠密模型生成文本,速度和带宽几乎成正比,所以 H100 会快得多。
DGX Spark 有 128GB,H100 只有 80GB。需要超过 80GB 来放权重和缓存的模型,在 H100 上必须拆到多块卡或者重度量化,在一台 DGX Spark 上则可以放下。
spark, h100_sxm = 273, 3350 # GB/s,NVIDIA 公布
print(round(h100_sxm / spark, 1)) # 12.3,我们自己算的
# FP8 的稠密 70B 模型,权重约 70 GB,每生成一个 token 要读一遍:
print(round(spark / 70, 1)) # 3.9 tokens/s,DGX Spark 上的速度上限DGX Spark 更合适的情况
- 模型大于 80GB,而你想避开多卡的复杂度。
- 你在做原型、实验,或者用参数高效的方法微调,比起跑得快,更在意能马上开始。
- 你想要一台干净、独占、有 root 权限、按分钟计费的机器。
H100 更合适的情况
- 目标是吞吐:服务大量用户,或者从头训练。
- 你的模型本来就能放进 80GB,而且要尽可能快。
- 你需要围绕 H100 系统建立的数据中心软件和互联方案。
NVIDIA 把 DGX Spark 定位为原型开发、微调和本地推理,之后再把工作迁移到 DGX Cloud 或数据中心。我们不声称它能替代数据中心 GPU。
常见问题
DGX Spark 和 H100 一样快吗?
不一样。按 NVIDIA 公布的数字,它的内存带宽比 H100 SXM 低大约十二倍,所以文本生成这类受内存限制的任务慢得多。
那为什么还选它?
为了容量和省事。一台机器里的 128GB 能放下单块 80GB GPU 放不下的模型,而且是按分钟计费的独占机器。