规则一:数字要带上它的前提
一个速度数字,没有模型、精度、软件和测量者就没什么意义。来源里缺其中任何一项,我们就写「未说明」,而不是替它补上。光是软件就能让结果差很多:对 gpt-oss-20b,NVIDIA 用 llama.cpp 报告解码每秒 82.74 个 token,LMSYS 用 Ollama 报告 49.7。见推理速度能期待多少。
规则二:只比较可比的东西
我们把 DGX Spark 和 H100 放在一起,比的是内存容量、内存带宽、功耗和形态,因为 NVIDIA 对两者都公布了这些数字。我们不把 Spark 的 FLOPS 和 H100 的放在一起,只有当倍数是公布数字的直接相除时才写,并标明是我们自己算的。见DGX Spark 对比 H100。
三个很容易写错的细节
1. 「1 petaFLOP」这个数字
NVIDIA 数据表的脚注说,最高 1 petaFLOP 的 AI 性能是使用稀疏特性的理论 FP4 吞吐。数据中心 GPU 通常按稠密 FP8 或 FP16 标注,所以两者不能比,而且都不能告诉你你的任务会跑多快。
2. nvidia-smi 里的显存
CPU 和 GPU 共用一块内存,所以 NVIDIA 的已知问题页面说,这台机器上 nvidia-smi 把显存占用显示为「Not Supported」,每个进程的 GPU 显存仍然会列出。如果一张 DGX Spark 的截图里 nvidia-smi 显示了整齐的已用/总量显存条,那它不是这颗芯片上截的。
3. 计算能力(compute capability)
根据 NVIDIA 员工在 NVIDIA 开发者论坛上的回复,GB10 的计算能力是 12.1(sm_121)。如果某段代码或某个租用页面说 DGX Spark 是 SM 10.0,它说的就不是这颗芯片。你可以直接问机器:
nvidia-smi --query-gpu=name,compute_cap --format=csv,noheader我们自己还没有在 DGX Spark 上运行过这条命令,所以这里不贴它的输出。等我们有了实测输出,会标上「实测」、日期和软件版本,放到这个站上。
常见问题
DGX Spark 是 1 petaFLOP 的机器吗?
NVIDIA 标注最高 1 petaFLOP 的 AI 性能,数据表脚注说这是使用稀疏特性的理论 FP4 吞吐。它和稠密 FP8 或 FP16 的数字没有可比性。
为什么 nvidia-smi 看不到我的显存占用?
CPU 和 GPU 共用一块内存。NVIDIA 的已知问题页面说,这台机器上 nvidia-smi 把显存占用显示为 Not Supported,每个进程的 GPU 显存仍然会列出。