组成部分
- 嵌入模型:把文档和查询变成向量。
- 向量索引或数据库:找出最接近的文档。
- 可选的重排模型:对靠前的结果重新排序。
- 生成模型:根据检索到的文本写出回答。
为什么放在一台机器上有帮助
在小显卡上,你往往要在这几个模型里选哪个能放进显存。有了 CPU 和 GPU 共享的 128GB,嵌入模型、重排模型和量化后的生成模型可以同时留在内存里,向量索引则放在系统内存中。开始之前,先把每个模型的权重加起来,算法见《128GB 装得下什么》。
适合按分钟计费的工作流
- 开机,把文档拷过去。
- 把文档切块并做一次嵌入,把索引保存到你自己的存储里。
- 启动生成模型,反复调整提示词、切块大小和检索设置。
- 用评估集跑一遍管线,记录结果。
- 把索引和结果拷出来,然后删除实例。
两次租用之间没有持久存储,所以要拷出来的是索引。下次直接恢复,不必重新做嵌入。
把结果对外提供
每个实例有十个业务端口。你可以把 API 放在其中一个上,用于演示或内部测试,前面要加认证。
常见问题
两次租用之间能保留我的向量数据库吗?
机器上不能。删除实例前把索引拷出来,下次租用时再恢复。