为什么评测适合租
基准测试、回归测试和 A/B 对比是爆发式运行的:启动任务,等它跑完,看数字。按分钟付费,两小时的评测就只花两小时的钱,没有闲置的机器需要摊销。
干净的环境
- 开一台全新的实例,这样不会有以前运行留下的东西。
- 安装确切版本的推理软件和评测工具,并把版本记下来。
- 固定随机种子、采样设置和提示词。
- 把所有模型版本放在同一个实例里、同一次会话里跑,保证硬件条件一致。
- 把原始输出和日志拷出来,然后删除实例。
要记录什么
- 模型名称、精度,以及软件和它的版本。
- 批大小、上下文长度和采样设置。
- 预填充速度和解码速度都要记,不只记其中一个。
- 你任务的质量指标,和速度数字放在一起。
这块硬件公布的速度数字会随框架和版本变化,所以请拿你自己的几次运行互相比较,而不是和别处的数字比。
一台机器不够时
对 128GB 放不下的模型,可以用双节点规格,它把两台机器的 256GB 合在一起。
常见问题
租用机器上的多次结果可以互相比较吗?
每次租用都是没有别人在用的独占机器,这有利于一致性。但仍然要记录软件版本和设置,它们对结果的影响比机器本身更大。