Podvek
控制台

DGX Spark 上的量化:FP4、FP8 和 GGUF

量化是大模型能装下的原因。选哪种格式,决定省多少内存,也决定能用哪些软件。

更新于 2026年10月7日

每个参数多少字节

模型权重占用的内存大约是参数数量乘以每个参数的字节数。精度越低,字节越少。

不同精度下权重内存的近似值
精度每个参数字节数70B 模型120B 模型
FP16 或 BF162140 GB240 GB
FP8170 GB120 GB
4 位(FP4、GGUF Q4)约 0.5约 35 GB约 60 GB

这里只算了权重。KV 缓存、激活值和操作系统也要占空间,有些 4 位格式还会因为缩放系数多出一点开销。70B 模型用 FP16 放不进 128GB;用 FP8 可以放下,但余量有限;用 4 位则很宽裕。

用 llama.cpp 把 16 位 GGUF 转成 4 位示意输出
llama-quantize model-f16.gguf model-Q4_K_M.gguf Q4_K_M

你会遇到的格式

  • NVFP4 和 MXFP4:4 位浮点格式。DGX Spark 的 GPU 有 FP4 硬件支持,NVIDIA 2026 年 1 月的文章称 NVFP4 能把内存占用减少约 40%。
  • FP8:内存是 FP16 的一半,通常只带来很小的质量损失。
  • GGUF:llama.cpp 使用的文件格式,有 Q4、Q8 等量化级别,可以按模型选择。

量化与速度

因为解码速度受内存带宽限制,每个 token 读的字节更少,通常意味着生成更快。4 位模型读的数据量大约是同一模型 FP16 的四分之一。

在你自己的任务上检查质量

精度降低可能损害准确度,影响因模型和任务而异。选定之前,把你的评估集在每个版本上都跑一遍。

常见问题

70B 模型用 FP8 放得下吗?

权重约 70GB,能放进 128GB,并给中等大小的 KV 缓存留出空间。上下文很长或批很大会占用更多内存。

准备好了就开机

先充值,再选规格。没有空闲机器时,排队不收费。