
一、RAG 是什么,为什么不能随便找台机器跑
RAG(Retrieval-Augmented Generation,检索增强生成)的思路很朴素:把企业内部的制度、手册、合同、技术文档先切碎存进向量数据库,用户提问时先检索出最相关的片段,再把片段连同问题一起交给大模型生成答案。好处是答案有出处、可追溯,而且不用重新训练模型,改文档就能改知识。
但不少企业一开始低估了它的硬件需求,以为"找个带显卡的机器就能跑"。实际上 RAG 是一条三段式流水线,每一段对硬件的偏好都不同,配置失衡就会在某一段卡死——要么文档入库慢得离谱,要么并发一上来推理就排队。
- 文档处理段:解析 PDF、Word、扫描件,做 OCR、切块、生成向量;
- 向量检索段:把问题向量化,在向量库里做相似度检索并排序;
- 大模型推理段:把检索结果和问题一起喂给大模型,生成最终答案。
如果你想先搞清大模型部署的整体账,可以先看企业私有化部署大模型需要什么服务器,那篇讲的是"总账",本文讲的是 RAG 这条线的"细账"。
二、文档处理段:最容易被忽略的 CPU 与内存消耗
很多人把注意力全放在显卡上,结果发现最慢的环节是入库。十万页 PDF 的解析、OCR 与切块,是典型的CPU 密集型 + 内存密集任务:
- CPU:建议 16 核起步,做 OCR 的机器核越多越快,主频比核数更影响单页速度;
- 内存:解析大 PDF 时单进程常吃到几 GB,建议按"并发进程数 × 2GB"估算,128GB 是常见起点;
- 存储:原文与中间产物读写频繁,建议用 NVMe SSD 做工作盘,机械盘只做归档;
- 显卡:生成 Embedding 向量可以用 GPU 加速,但用 CPU 也能跑,只是慢数倍。
硬盘怎么选、NVMe 与 SATA 的差别,可参考企业级硬盘选购指南。入库是一次性任务,建议单独安排一个夜间批处理窗口,不要和白天推理抢资源。
三、向量检索段:内存容量比显卡更关键
向量数据库(Milvus、Qdrant、pgvector 等)的性能瓶颈通常不在算力,而在内存能否装下索引。以 1536 维向量为例,一百万条向量原始数据约 6GB,加上 HNSW 索引开销后往往要 1.5 到 2 倍,也就是 10GB 以上;一千万条就要上百 GB 内存。
- 经验法则:让向量索引常驻内存,检索延迟才能稳定在毫秒级;
- 内存优先级:向量库节点优先堆内存,容量按"向量条数 × 单条占用 × 1.8"估算;
- 磁盘兜底:索引放内存、原始向量与元数据落 SSD,避免全量落机械盘导致检索抖动;
- ECC 内存:长期运行的服务节点建议用 ECC 内存,降低位翻转导致索引损坏的风险。
内存规格与容量规划的方法,可参考服务器内存条怎么选。
四、大模型推理段:显存决定模型能开多大
推理段的硬件逻辑很直接:显存要装得下模型权重 + KV 缓存。粗略估算,FP16 精度下每十亿参数约需 2GB 显存,再加 20% 到 40% 的 KV 缓存与运行时开销:
- 7B 模型:FP16 约需 16GB 显存,一张 24GB 卡即可,可开一定并发;
- 14B 到 32B 模型:建议 48GB 到 80GB 显存,单卡或双卡;
- 70B 级模型:需要多卡并行或量化,整机建议 2 到 4 张 80GB 卡;
- 量化换显存:INT8 约省一半显存,INT4 再省一半,但会损失部分精度,知识库问答场景通常可接受。
显存与模型规模的对应关系,可参考一台GPU服务器能跑多大的AI模型;推理场景的整机选型见AI推理服务器配置推荐。
五、单机方案与分离部署,怎么选
小规模起步不必上集群,两种常见路线:
- 单机一体:一台 GPU 服务器同时跑向量库与推理,部署简单、成本低,适合文档量十万页以内、并发 10 人以内;
- 分离部署:向量库单独一台(重内存),推理单独一台(重显卡),互不抢占资源,适合文档百万页级、并发几十人以上的场景。
判断标准是资源是否互相挤占:如果入库或检索时推理明显变慢,就该拆分。分离部署还要注意节点间网络,万兆起步,否则检索结果回传会成为新瓶颈,网络规划可参考服务器网络架构规划指南。
六、预算分档配置参考
按常见企业场景给三档参考(不含软件与实施):
- 入门档(约 5 万到 8 万):单路 CPU、128GB 内存、1 张 24GB 推理卡、2TB NVMe,适合 7B 模型 + 十万页文档;
- 标准档(约 15 万到 25 万):双路 CPU、256GB 内存、1 到 2 张 48GB 卡、4TB NVMe,适合 14B 到 32B 模型 + 百万页文档;
- 进阶档(约 40 万以上):双路高核 CPU、512GB 内存、4 张 80GB 卡、NVMe 阵列,适合 70B 级模型与高并发。
如果预算有限又想快速验证,也可以先用AI大模型一体机跑通流程,再决定是否自建。
七、几个常见踩坑提醒
- 只堆显卡不堆内存:向量库内存不足会让检索变成磁盘随机读,延迟从毫秒级掉到百毫秒级;
- 入库与推理同机同时跑:OCR 抢满 CPU 会让推理抖动,务必错峰;
- 忽略散热与供电:多卡整机的供电与散热规划,可参考GPU服务器机柜供电与散热怎么规划;
- 没做备份:向量索引重建成本极高,务必对原始文档与向量库做定期备份。
八、结语
RAG 知识库的硬件配置,核心是按段配资源:入库看 CPU 与内存,检索看内存,推理看显存,三者不要混为一谈。先把文档量、并发数、模型规模这三个数报出来,配置自然就清晰了。今朝恒业可提供 RAG 知识库服务器的整机与配件选型、报价与交付方案,按实际文档量与并发量出具配置清单。
延伸阅读推荐:

