Podvek
控制台

为什么出字速度看内存带宽:DGX Spark 的 273 GB/s 意味着什么

一个简单的计算,就能解释为什么 70B 模型在这台机器上感觉慢,而更大的混合专家模型却很快。

更新于 2026年10月7日

上限

生成一个 token,稠密模型基本要把全部权重从内存里读一遍。所以最快的速度就是内存带宽除以模型在内存里的大小。这是一个上限:它没有计入 KV 缓存和其他任何开销。

273 GB/s 的 DGX Spark 上解码速度的上限
稠密模型内存里的权重上限,tokens 每秒
70B,FP870 GB约 3.9
70B,4 位约 35 GB约 7.8

LMSYS 测得 Llama 3.1 70B(FP8,SGLang)是每秒 2.7 个 token,低于 3.9 的上限,处在同一量级,符合预期。

为什么混合专家模型不一样

混合专家模型总参数很多,但每个 token 只激活其中一部分,所以每个 token 读的数据远少于它的总大小。NVIDIA 报告 gpt-oss-120b(MXFP4,llama.cpp)在 DGX Spark 上解码约每秒 55 个 token,比稠密 70B 的数字快得多,尽管它整体更大。这两个数字来自不同的发布者和软件,所以请比较规律,而不是精确的比例。

这台机器和别的比

内存带宽(NVIDIA 公布的数字)及与 DGX Spark 的比例
设备内存带宽相对 DGX Spark 的倍数
DGX Spark273 GB/s1 倍
H100 PCIe2,000 GB/s约 7.3 倍
RTX 50901,792 GB/s约 6.6 倍
H100 SXM3.35 TB/s约 12 倍
H2004.8 TB/s约 18 倍

该怎么办

  • 做量化。每个权重的字节越少,每个 token 要读的越少,生成越快。
  • 需要响应快的大模型时,优先选混合专家模型。
  • 做批处理。权重读一次可以服务多个请求,所以即使单路速度不变,总吞吐也随批大小上升。
  • 让这台机器做它的容量擅长的事:大模型、长上下文、实验、微调。

常见问题

这个上限等于实测速度吗?

不等于,它只是上限。把 KV 缓存、软件开销和其他工作算进去,实际速度会更低。

准备好了就开机

先充值,再选规格。没有空闲机器时,排队不收费。