Podvek
控制台

在一台机器上搭检索增强生成(RAG)管线

RAG 系统需要几个模型和一个数据库。在共用一块内存的单机上,它们可以放在一起。

更新于 2026年10月7日

组成部分

  • 嵌入模型:把文档和查询变成向量。
  • 向量索引或数据库:找出最接近的文档。
  • 可选的重排模型:对靠前的结果重新排序。
  • 生成模型:根据检索到的文本写出回答。

为什么放在一台机器上有帮助

在小显卡上,你往往要在这几个模型里选哪个能放进显存。有了 CPU 和 GPU 共享的 128GB,嵌入模型、重排模型和量化后的生成模型可以同时留在内存里,向量索引则放在系统内存中。开始之前,先把每个模型的权重加起来,算法见《128GB 装得下什么》。

适合按分钟计费的工作流

  1. 开机,把文档拷过去。
  2. 把文档切块并做一次嵌入,把索引保存到你自己的存储里。
  3. 启动生成模型,反复调整提示词、切块大小和检索设置。
  4. 用评估集跑一遍管线,记录结果。
  5. 把索引和结果拷出来,然后删除实例。

两次租用之间没有持久存储,所以要拷出来的是索引。下次直接恢复,不必重新做嵌入。

把结果对外提供

每个实例有十个业务端口。你可以把 API 放在其中一个上,用于演示或内部测试,前面要加认证。

常见问题

两次租用之间能保留我的向量数据库吗?

机器上不能。删除实例前把索引拷出来,下次租用时再恢复。

准备好了就开机

先充值,再选规格。没有空闲机器时,排队不收费。