每个参数多少字节
模型权重占用的内存大约是参数数量乘以每个参数的字节数。精度越低,字节越少。
| 精度 | 每个参数字节数 | 70B 模型 | 120B 模型 |
|---|---|---|---|
| FP16 或 BF16 | 2 | 140 GB | 240 GB |
| FP8 | 1 | 70 GB | 120 GB |
| 4 位(FP4、GGUF Q4) | 约 0.5 | 约 35 GB | 约 60 GB |
这里只算了权重。KV 缓存、激活值和操作系统也要占空间,有些 4 位格式还会因为缩放系数多出一点开销。70B 模型用 FP16 放不进 128GB;用 FP8 可以放下,但余量有限;用 4 位则很宽裕。
llama-quantize model-f16.gguf model-Q4_K_M.gguf Q4_K_M你会遇到的格式
- NVFP4 和 MXFP4:4 位浮点格式。DGX Spark 的 GPU 有 FP4 硬件支持,NVIDIA 2026 年 1 月的文章称 NVFP4 能把内存占用减少约 40%。
- FP8:内存是 FP16 的一半,通常只带来很小的质量损失。
- GGUF:llama.cpp 使用的文件格式,有 Q4、Q8 等量化级别,可以按模型选择。
量化与速度
因为解码速度受内存带宽限制,每个 token 读的字节更少,通常意味着生成更快。4 位模型读的数据量大约是同一模型 FP16 的四分之一。
在你自己的任务上检查质量
精度降低可能损害准确度,影响因模型和任务而异。选定之前,把你的评估集在每个版本上都跑一遍。
常见问题
70B 模型用 FP8 放得下吗?
权重约 70GB,能放进 128GB,并给中等大小的 KV 缓存留出空间。上下文很长或批很大会占用更多内存。