
一、先分清:微调、推理、预训练是三件事
很多企业一上来就说"要训练大模型",其实多数需求只是微调。三者的资源消耗完全不是一个量级:
| 类型 | 做什么 | 资源量级 |
|---|---|---|
| 预训练 | 从零训练基座模型 | 千卡级,企业基本不碰 |
| 微调 | 用自有数据让模型学会业务 | 单机多卡可做 |
| 推理 | 部署已训好的模型对外服务 | 显存决定一切 |
企业真正要做的通常是"微调 + 推理"这一套。推理的配置逻辑见AI推理服务器配置推荐,本文只讲微调。
二、微调的两条路:LoRA 与全参微调
显存需求差得最远的就是这两种方式:
- LoRA / QLoRA:只训练一小部分附加参数,显存占用低、见效快、成本低,绝大多数企业场景够用;
- 全参微调:更新模型全部参数,效果上限更高,但显存占用是 LoRA 的数倍到十几倍,需要多卡甚至多机。
建议先问自己:是要"让模型懂我的业务术语",还是要"改变模型的整体能力"。前者 LoRA 就够,后者才需要全参。量化能进一步降低显存占用,原理与取舍见GPU显存不够怎么办。
三、显存是硬门槛:模型规模对照
微调的显存占用大致取决于模型参数量、精度和微调方式。经验参考(含优化手段后):
| 模型规模 | LoRA 微调 | 全参微调 |
|---|---|---|
| 7B | 单卡 24GB 可跑 | 2-4 卡 80GB |
| 13B | 单卡 48GB 较稳 | 4-8 卡 80GB |
| 70B | 多卡 80GB | 多机多卡 |
这只是量级参考,实际还受 batch size、序列长度、优化器影响。显存到底怎么算、怎么省,可读一台GPU服务器能跑多大的AI模型。如果只是 7B 模型的 LoRA 微调,一台单卡服务器就能起步,不必一上来就买 8 卡机。
四、显卡怎么选:别只看显存
微调对显卡的要求不止显存:
- 显存容量:决定能装多大的模型;
- 显存带宽:影响训练速度;
- 算力(FP16/BF16):决定迭代快慢;
- 卡间互联:多卡训练时,通信慢会拖垮整体效率。
不同型号的实际差距可参考H100 与 A100 对比,国产方案见国产GPU服务器选型对比。多卡互联的通信方案见GPU网络配置:InfiniBand/RoCE/NVLink。
五、CPU、内存与存储:别配成短板
微调时 GPU 是主角,但这几项配不好会明显拖慢:
- CPU:负责数据预处理和喂数据,核心数要够,否则 GPU 等数据;
- 内存:至少是显存总量的 1.5-2 倍,数据集加载时更吃内存;
- 存储:训练数据集大且反复读取,建议 NVMe SSD,别用机械盘。
训练机的整体配置逻辑见AI训练服务器配置方案;存储选型见企业级NVMe SSD选购指南。
六、三档微调硬件方案
| 场景 | 典型配置 | 适用 |
|---|---|---|
| 入门(7B LoRA) | 单卡 24-48GB + 高频 CPU + 128GB 内存 | 中小企业试点 |
| 进阶(13B 微调) | 2-4 卡 80GB + 双路 CPU + 256GB 内存 + NVMe | 有明确业务场景 |
| 专业(70B / 全参) | 8 卡 80GB + NVLink/IB + 512GB 内存 | 模型团队/大企业 |
别盲目追求 8 卡机。先用 LoRA 在单卡或双卡上验证效果,跑通了再扩,是最省钱的路径。成本构成见大模型推理服务器成本分析,私有化部署的整体路径见企业私有化部署大模型服务器怎么配。
七、常见误区
- 误区一:把微调当预训练。企业根本不需要预训练,预算会差几十倍;
- 误区二:只算显存不算带宽。带宽不足,训练慢到无法接受;
- 误区三:用游戏显卡做微调。显存和驱动都不合适,稳定性差;
- 误区四:一次买满 8 卡。需求没验证清楚,容易造成闲置浪费。
游戏卡与专业卡的差别见服务器GPU和游戏显卡的区别。
八、结语
大模型微调的配置逻辑可以概括为:先定微调方式(LoRA 还是全参),再定模型规模,最后按显存倒推显卡数量。多数企业从单卡 LoRA 起步就能看到效果,验证后再扩到多卡。今朝恒业可依据模型规模、微调方式与预算,给出从单卡入门到多卡集群的微调服务器配置与报价。
延伸阅读推荐:

