Podvek
控制台

在租用的 DGX Spark 上微调大语言模型

128GB 统一内存,足以微调那些在常见的 24GB 或 32GB 显卡上放不下的模型。

更新于 2026年10月7日

NVIDIA 说它能做什么

NVIDIA 产品页称,单台 DGX Spark 可以微调最高 700 亿参数的 AI 模型,并对最高 2000 亿参数的模型做推理,数据表注明 2000 亿这个数字是按 FP4 精度算的。NVIDIA 2026 年 1 月的软件更新文章还介绍了在两台互联的机器上,用 FSDP 和 LoRA 对最高 700 亿参数的模型做分布式微调。

为什么关键是内存

微调要给模型权重、优化器状态、梯度和激活值都留出空间。DGX Spark 的 CPU 和 GPU 共用一块 128GB 内存,在小显卡上必须拆分或卸载的模型,在这里可以整个放进内存。代价是内存带宽:273 GB/s 远低于数据中心 GPU,所以同样的训练会比 H100 慢。

适合这台机器的方法

  • LoRA 和 QLoRA:只训练小的适配器矩阵,而不是所有权重。QLoRA 把基础模型保持在 4 位,700 亿参数的模型就是这样装下的。
  • 较小模型的全量微调:NVIDIA 的基准测试里包括对 Llama 3.2 3B 做全量微调。
  • 在双节点规格上,用 FSDP 加 LoRA 做跨两个节点的分布式微调。

公布的吞吐量

NVIDIA 的性能文章公布了三次微调在单台 DGX Spark 上的「peak tokens/sec」。文章把它定义为批大小 × 步数 × 序列长度 ÷ 总训练时间,而且只跑了 64 步。请把每个数字当作那个配置下的一个数据点,而不是承诺:实际训练还要加上数据加载、评估和保存检查点的时间,序列更长结果也会变。

NVIDIA 公布的单台 DGX Spark 微调吞吐(PyTorch,序列长度 2048,64 步)
模型方法批大小峰值 tokens 每秒
Llama 3.2 3B全量微调813,519.54
Llama 3.1 8BLoRA46,969.59
Llama 3.3 70BQLoRA8759.79

按每秒约 760 个 token 算,700 亿参数 QLoRA 训练 10 亿个 token,大约要 366 小时的算力。其他规模怎么算,见《70B QLoRA 微调要花多少钱》。

qlora.py:最小的 QLoRA 配置(没有在 DGX Spark 上测试过)示意输出
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer, BitsAndBytesConfig
from peft import LoraConfig, get_peft_model

name = "meta-llama/Llama-3.3-70B-Instruct"
bnb = BitsAndBytesConfig(
    load_in_4bit=True,
    bnb_4bit_quant_type="nf4",
    bnb_4bit_compute_dtype=torch.bfloat16,
)
model = AutoModelForCausalLM.from_pretrained(name, quantization_config=bnb, device_map="auto")
tokenizer = AutoTokenizer.from_pretrained(name)

lora = LoraConfig(r=16, lora_alpha=32, target_modules=["q_proj", "v_proj"], task_type="CAUSAL_LM")
model = get_peft_model(model, lora)
model.print_trainable_parameters()

这是 transformers 加 PEFT 的标准写法,用来说明一次 QLoRA 训练长什么样。我们没有在 DGX Spark 上跑过它。bitsandbytes 有没有可用的 aarch64 加 CUDA 13 版本,依赖它之前要先确认。

为什么这件事适合租而不是买

微调的使用是突发式的:几次很长的训练,然后是几天的数据准备和评估。按分钟计费意味着你只为训练本身付钱,而不是为两次实验之间闲置的机器付钱。

常见问题

单台 DGX Spark 能微调 70B 模型吗?

NVIDIA 称单台 DGX Spark 可以微调最高 700 亿参数的模型。NVIDIA 自己的 70B 基准测试用的是 QLoRA,也就是把基础模型保持在 4 位。

它和 H100 一样快吗?

不一样。内存带宽低得多,训练会更久。它的优势是容量:128GB 统一内存。

准备好了就开机

先充值,再选规格。没有空闲机器时,排队不收费。