
一、先给一张速查表:不同规模模型各要多少卡
判断"能跑多大模型",第一度量不是 CPU或内存,而是显存(GPU VRAM)。下面是主流参数规模的参考需求(推理场景、量化后):
| 参数量 | 模型示例 | 参考显存 | 建议配置 |
|---|---|---|---|
| 1.5B-7B | Qwen2.5-7B等 | 16-24G | 单卡4090/单卡L20 |
| 13B-32B | Qwen2.5-32B等 | 40-80G | 单卡A100 80G或2×4090 |
| 70B-72B | Llama3-70B、Qwen-72B | 80-160G | 2×A100/H100或4×4090 |
| 130B-400B | DeepSeek大模型、MOE类 | 320G+ | 多机多卡,甚至整机集群 |
这里说的是量化后推理的起步参考;训练通常是推理需求的4-8倍显存。要搭建一套从单卡到8卡的自建方案,可参考AI训练服务器配置方案:从单卡到8卡H100集群。
二、怎么粗算显存需求
一个实用经验公式:显存 ≈ 参数量 × 单参数权重字节 × 系数。
- FP16/BF16 下每参数约2字节;
- 推理还额外需要KV Cache、激活值,一般乘以1.2-1.5;
- 训练时参数、梯度、优化器状态三份都要占显存,需求放大到4-8倍。
举例:70B 模型 FP16 → 约140G权重,加KV cache后推理需约160-200G显存,所以常见用 2×80G 或 4×48G;做训练就要8×80G起。显存不够时可量化到 INT8/INT4,显存需求降到约一半或四分之一。想系统性了解一套推理服务器的硬件到底怎么定,可读AI推理服务器配置推荐。
三、除了显存,还有两个常被忽略的瓶颈
很多人只盯显存,结果买到"显存够、跑不动"的机器。另外两个瓶颈:
- GPU 卡间互联带宽:模型拆到多卡时,卡间通信决定训练/推理效率。NVLink、NVSwitch 与 PCIe 的带宽差异巨大,配置不合适会出现"显存够但慢"。互联方案可看GPU服务器网络与互联:InfiniBand vs RoCE vs NVLink;
- 服务器内存与CPU:上下文窗口大时,KV Cache 可能溢出到内存,CPU 内存速度影响切卡;同时保证 CPU 提供足够并发调度能力。
四、显存不够的四种降级方案
- 量化:把模型从 FP16 压到 INT8/INT4,显存减半或更大,普遍首选;
- 张量/流水并行拆分:把模型切成多份跨卡放,配合高速互联;
- CPU+GPU混合(部分层跑CPU):慢但能跑,适合低并发验证;
- 减上下文窗口:缩小 KV Cache 占用的显存。
这些都是"能跑但别追求极致速度"的办法。如果你的目标本来就是高并发线上服务,还是要按足额显存配。整体怎么挑一套AI服务器,可参考GPU服务器选购指南。
五、亲手算一遍:三步定价法实战示范
与其背结论,不如学会自己算。以"部署一个 70B 的对话模型、要能承受 50 并发"为例,走一遍:
- 估权重:70B × FP16(2字节)≈ 140G,这是裸权重;
- 加 KV Cache:50 并发 × 每请求平均上下文 4K tokens,KV Cache 约需额外 30-60G,合计推理约需 170-200G显存;
- 定卡型:单卡80G不够,需 2×80G(A100/H100)或 4×48G;若要训练或高并发再翻倍。
这套"权重→KV→卡型"三步法,是采购和扩容前最有效的体检工具。如果还不确定自己的业务并发和上下文该怎么估,可以先用单卡把模型量化后跑通小并发,再按实测数据放大,比拍脑袋配卡可靠得多。完整部署一套推理环境的硬件清单可看AI推理服务器配置推荐。
六、结语
一台GPU服务器能跑多大AI模型,核心看显存,其次是卡间互联带宽和内存。先粗算显存需求(参数×字节×系数),再按推理/训练放大,最后用量化等做降级备选。摸清三个维度再配机器,才不至于"买错、跑不动、浪费钱"。
延伸阅读推荐:

