
一、为什么要把一块 GPU 分给多个人用
AI 部门最常见的浪费,是"一人一张卡、每人利用率不到两成"。一张 A100 或 H100 采购价动辄十几万,如果只是白天跑几个小推理、偶尔微调一下模型,绝大部分时间都在闲置。于是就有了 GPU 虚拟化这个需求:让一张物理卡同时服务多个使用者或虚拟机。
但 GPU 虚拟化不像 CPU 那样天生就能分时复用。CPU 有成熟的调度器和虚拟化扩展,GPU 早年只能整卡直通,真正可用的方案是后来才成熟的,而且三条技术路线差别很大——选错了要么白花钱,要么根本跑不起来。本文把三条路线讲清楚,再给出按场景对号入座的建议。
二、三条技术路线:直通、vGPU、MIG
先给一张总览表,后面逐条展开:
| 方案 | 切分粒度 | 隔离性 | 典型场景 |
|---|---|---|---|
| GPU 直通(Passthrough) | 整卡独占 | 强 | 训练、整卡独占给一台虚拟机 |
| vGPU(虚拟 GPU) | 按显存切 1/2、1/4 等 | 中 | 多人共用、图形与轻量推理 |
| MIG(多实例 GPU) | 硬件级最多 7 份 | 强 | A100/H100 上做多租户推理 |
这三条路线并不互斥,同一台服务器上可以按卡分别配置。但前提是卡本身和虚拟化平台都要支持,这一点后面会细说。GPU 与整机怎么匹配,可先参考GPU 服务器配置指南。
三、GPU 直通:性能最好,也最简单
直通(也叫 PCIe Passthrough)是把整块 GPU 卡直接交给某台虚拟机独占,虚拟机里看到的是一张完整的物理卡,驱动和 CUDA 都不用改。
- 优点:性能几乎无损耗,兼容性最好,不需要额外授权费;
- 缺点:一张卡只能给一台虚拟机,无法共享;虚拟机在线迁移通常不支持;
- 前提:主板和 BIOS 要开启 IOMMU / VT-d(AMD 平台是 AMD-Vi),且卡要落在独立的 IOMMU 分组里。
实践中最常见的坑是IOMMU 分组:如果 GPU 和主板上的其他设备(比如某个网卡或 USB 控制器)分在同一组,直通就会失败,或者连带把别的设备一起划走。买整机时让供应商提前确认分组情况,比事后折腾省事得多。
四、vGPU:把一张卡切成几份
vGPU 是把一张物理 GPU 的显存和算力按比例切分,比如 1/2、1/4、1/8,分给不同虚拟机使用。NVIDIA 的 vGPU 需要专门的授权,按虚拟机数量计费,这也是最容易被忽略的成本项。
- 适合:虚拟桌面、图形设计、多人共用的轻量推理;
- 不适合:大模型训练——切分后单实例显存太小,模型根本装不下;
- 成本提醒:除了软件授权,还要配一台 License Server,这笔账要提前算进预算。
如果是多台服务器、多人共用算力的场景,除了 vGPU,也可以考虑上层调度方案,思路见AI 训练专用集群怎么搭。
五、MIG:硬件级切分,隔离性最好
MIG(Multi-Instance GPU)是 A100、H100 这一代数据中心卡的原生能力,可以在硬件层面把一张卡切成最多 7 个实例,每个实例有独立的显存、缓存和计算单元,隔离性接近物理独立。
- 优点:隔离强、互不干扰,适合多租户推理服务,且不需要额外授权费;
- 缺点:只支持特定型号,切分比例受硬件约束,实例规格是预设的,不够灵活;
- 注意:MIG 实例的显存和算力是硬切,不能像 vGPU 那样弹性调整。
所以 MIG 更适合"多个团队各自跑稳定的推理服务",而不是"弹性变化的开发环境"。显存够不够装下模型,可参考一台 GPU 服务器能跑多大的 AI 模型。
六、按场景对号入座
| 你的场景 | 推荐方案 | 理由 |
|---|---|---|
| 一台虚拟机独占一张卡做训练 | GPU 直通 | 性能无损、零授权成本 |
| 多人共用做图形与虚拟桌面 | vGPU | 按显存切分,体验均衡 |
| 多团队跑稳定的推理服务 | MIG | 隔离强、无需授权费 |
| 开发测试环境、利用率本来就低 | 先别虚拟化,用调度平台 | 减少授权与运维复杂度 |
很多单位一上来就追求"把卡切得越细越好",结果切完之后每个实例都跑不动真正的模型。先明确业务负载,再决定切分方式,才不会白折腾。
七、硬件与授权成本别漏算
除了卡本身,GPU 虚拟化还有几笔隐性成本:
- vGPU 授权:按虚拟机计费,长期看总价可能比卡还高;
- License Server:vGPU 必须部署,需要一台额外的小服务器;
- 平台支持:不是所有虚拟化平台都支持 vGPU,选型前要核对兼容列表;
- 散热与供电:切分后并发任务变多,机柜散热压力反而更大,参考GPU 服务器机柜供电与散热怎么规划。
算总账时可以对照服务器 TCO 总拥有成本分析的方法,把五年内的授权、电费、维保一起摊开看。
八、几个常见的坑
- 坑一:以为所有卡都能切。消费级卡和部分老型号既不支持 vGPU 也不支持 MIG;
- 坑二:BIOS 没开 IOMMU。直通报错往往就是这一条,先查再折腾;
- 坑三:忽略授权到期。vGPU 授权过期后实例会掉,业务直接中断;
- 坑四:切分后忘了留显存余量。模型加上 KV Cache 会吃掉额外显存,切太细就跑不动。
装机阶段把这些确认清楚,比上线后返工便宜得多。GPU 卡怎么装、供电怎么接,见服务器怎么装显卡。
九、结语
GPU 虚拟化的核心判断只有一句话:训练用直通,图形多人共用用 vGPU,多租户推理用 MIG。先看业务负载,再看卡型号是否支持,最后算上授权成本,方案就清晰了。今朝恒业可依据实际负载与预算,帮你确认整机的 IOMMU 分组、卡型支持情况与授权需求,给出可落地的 GPU 服务器配置方案。
延伸阅读推荐:

