
一、为什么框架比显卡更影响体验
很多团队遇到"显卡不差但并发上不去、首字延迟很长"的问题,最后发现瓶颈在推理框架。原因很简单:大模型推理不是"一次算完",而是每个 token 都要走一遍前向计算,框架如何调度请求、如何管理显存,直接决定了同样的卡能扛多少并发。
选框架前先明确三个指标:吞吐量(每秒能出多少 token)、首字延迟(用户等多久看到第一个字)、并发数(同时服务多少人)。三者互相牵制,没有万能解。
二、vLLM:生态最广的通用选择
vLLM 是目前使用最广的开源推理框架,核心优势是PagedAttention 显存管理与连续批处理:
- 显存利用率高:把 KV 缓存按页管理,减少碎片,同样显存能开更大并发;
- 吞吐强:连续批处理让不同长度的请求混跑,GPU 利用率高;
- 兼容性好:支持的模型多、社区活跃、文档齐全;
- 适合:通用对话、知识库问答、需要快速上线且模型多样的场景。
显存与模型规模的匹配可参考一台GPU服务器能跑多大的AI模型。
三、SGLang:高并发与复杂流程的利器
SGLang 的强项是前缀缓存与结构化生成:
- RadixAttention 前缀缓存:多轮对话或固定系统提示词场景下,重复前缀只算一次,延迟明显下降;
- 结构化输出:原生支持约束解码,适合要输出 JSON 的业务;
- 适合:多轮对话、Agent 流程、固定提示词的批处理任务;
- 注意:生态与模型覆盖不如 vLLM 广,冷门模型可能要先适配。
四、TensorRT-LLM:极致性能但门槛高
TensorRT-LLM 是 NVIDIA 官方的推理优化方案,追求极致的低延迟与高吞吐:
- 深度优化:算子融合、量化支持完善,单位算力产出高;
- 代价:需要针对模型与显卡做编译,流程重、适配成本高;
- 适合:模型固定、访问量大、对延迟敏感的生产环境;
- 不适合:模型频繁更换、团队缺乏深度调优能力的情况。
五、框架对硬件的具体要求
- 显存:决定能开多大模型与多少并发,是首要指标;
- 显卡代际:新框架对新卡的优化更好,老卡可能不支持某些加速特性;
- 量化支持:INT8、FP8 等量化能省显存,但要确认框架与卡都支持;
- CPU 与内存:负责 tokenize、调度与结果拼装,太弱会成为瓶颈;
- 网络:多机多卡部署时,节点间通信带宽直接影响扩展效率。
多机多卡的组网方案可参考GPU服务器网络配置指南。
六、选型的判断标准
- 模型是否固定:固定优先 TensorRT-LLM,多变优先 vLLM;
- 是否多轮对话:多轮与固定提示词优先 SGLang;
- 团队能力:没有专职调优人员,先上 vLLM 跑通再优化;
- 业务目标:追求单请求低延迟,还是追求整体吞吐,方向不同选择不同;
- 显存预算:显存紧张时优先选显存管理更省的框架。
七、部署时的常见坑
- 显存溢出:并发开太大导致 OOM,要按显存反推最大并发,参考GPU显存不够怎么办;
- 只测单请求:单请求快不代表并发好,务必做并发压测;
- 忽略散热:长时间高负载下 GPU 降频,吞吐会掉,参考GPU服务器散热方案;
- 没做监控:显存、利用率、排队长度都要监控,否则故障时无从下手;
- 版本不匹配:驱动、CUDA、框架版本三者要成套,装卡参考服务器怎么装显卡。
八、结语
推理框架的选择本质是在吞吐、延迟、成本之间找平衡:通用场景选 vLLM,多轮与结构化场景选 SGLang,模型固定且量大再考虑 TensorRT-LLM。今朝恒业可提供大模型推理服务器的 GPU 选型、整机配置与部署支持,按模型规模与并发目标出具方案。
延伸阅读推荐:

