上限
生成一个 token,稠密模型基本要把全部权重从内存里读一遍。所以最快的速度就是内存带宽除以模型在内存里的大小。这是一个上限:它没有计入 KV 缓存和其他任何开销。
| 稠密模型 | 内存里的权重 | 上限,tokens 每秒 |
|---|---|---|
| 70B,FP8 | 70 GB | 约 3.9 |
| 70B,4 位 | 约 35 GB | 约 7.8 |
LMSYS 测得 Llama 3.1 70B(FP8,SGLang)是每秒 2.7 个 token,低于 3.9 的上限,处在同一量级,符合预期。
为什么混合专家模型不一样
混合专家模型总参数很多,但每个 token 只激活其中一部分,所以每个 token 读的数据远少于它的总大小。NVIDIA 报告 gpt-oss-120b(MXFP4,llama.cpp)在 DGX Spark 上解码约每秒 55 个 token,比稠密 70B 的数字快得多,尽管它整体更大。这两个数字来自不同的发布者和软件,所以请比较规律,而不是精确的比例。
这台机器和别的比
| 设备 | 内存带宽 | 相对 DGX Spark 的倍数 |
|---|---|---|
| DGX Spark | 273 GB/s | 1 倍 |
| H100 PCIe | 2,000 GB/s | 约 7.3 倍 |
| RTX 5090 | 1,792 GB/s | 约 6.6 倍 |
| H100 SXM | 3.35 TB/s | 约 12 倍 |
| H200 | 4.8 TB/s | 约 18 倍 |
该怎么办
- 做量化。每个权重的字节越少,每个 token 要读的越少,生成越快。
- 需要响应快的大模型时,优先选混合专家模型。
- 做批处理。权重读一次可以服务多个请求,所以即使单路速度不变,总吞吐也随批大小上升。
- 让这台机器做它的容量擅长的事:大模型、长上下文、实验、微调。
常见问题
这个上限等于实测速度吗?
不等于,它只是上限。把 KV 缓存、软件开销和其他工作算进去,实际速度会更低。