公布的规格
| DGX Spark | GeForce RTX 5090 | |
|---|---|---|
| 内存 | 128 GB LPDDR5x,与 CPU 统一 | 32 GB GDDR7 |
| 内存带宽 | 最高 273 GB/s | 1,792 GB/s |
| 是什么 | 带 Arm CPU 的完整 AI 电脑 | 装在电脑里的显卡 |
这些数字说明什么
RTX 5090 的内存带宽大约是 DGX Spark 的 6.6 倍(1,792 除以 273,我们自己算的)。对于能放进 32GB 的模型,它生成文本会快得多。LMSYS 的评测里,gpt-oss-20b(MXFP4,Ollama,批大小 1)在 RTX 5090 上解码是每秒 205 个 token,在 DGX Spark 上是 49.7。两者用同样的方法测量,大约四倍的差距和带宽差距方向一致。
不过 32GB 是硬上限。70B 模型即使量化到 4 位,权重也要约 35GB,放不下。DGX Spark 则能放下,还有富余。
一个简单的选择办法
| 你的模型需要 | 更合适的选择 |
|---|---|
| 包含缓存在内约 27 GB 以内 | RTX 5090,追求速度 |
| 包含缓存在内 27 到 108 GB | DGX Spark,因为它放得下 |
| 超过 108 GB | 双节点或四节点 DGX Spark(即将上线) |
我们的经验法则:每台机器只用 85% 的内存(32GB 里用 27,128GB 里用 108),剩下的留给操作系统和运行时开销。这是算术,不是实测,依赖它之前请用你自己的模型核对。
def weights_gb(params_billion, bytes_per_param):
return params_billion * bytes_per_param
print(weights_gb(70, 0.5)) # 4 位下 35.0 GB:放不进 27 GB,放得进 108 GB
print(weights_gb(32, 0.5)) # 4 位下 16.0 GB:RTX 5090 放得下两者都可以用租的,不用买
如果只是偶尔几次实验需要大内存机器,按分钟租 DGX Spark,可以避免买一台大部分时间都闲着的硬件。
常见问题
做 AI 哪个更快?
对能放进 32GB 的模型,RTX 5090 更快,因为它的内存带宽高得多。更大的模型,只有 DGX Spark 能放下。