
一、GPU 故障分两类:不识别 vs 占用异常
服务器 GPU 问题通常分两种,排查方向不同:
| 类型 | 表现 | 主要根因方向 |
|---|---|---|
| 不识别/掉卡 | 系统里看不到显卡、频繁掉卡 | 驱动、供电、PCIe、固件 |
| 占用率异常 | 占用率低但卡顿,或占用率异常高 | 驱动、散热、应用配置、瓶颈 |
先分清是哪类,再动手。GPU 服务器与普通服务器差异大,选型与架构基础可先看GPU服务器配置指南:AI训练与推理场景的硬件选择。
二、GPU 不识别:按顺序排查
1. 驱动与固件
驱动不匹配是头号原因:先确认显卡型号与驱动版本、CUDA 版本兼容,用 nvidia-smi 看是否报错。驱动与固件版本匹配的完整排查思路可看服务器驱动与固件版本不匹配怎么解决。
2. 供电
GPU 供电不足会导致掉卡或不稳定。检查:电源功率是否足够(8 卡机通常要 2000W+)、供电线是否插紧、是否用了转接线(尽量用原装线)。电源选型可看服务器电源选型指南。
3. PCIe 接触与插槽
重新插拔显卡、更换 PCIe 插槽(部分机型插槽速率不同),清理金手指。多卡机注意PCIe 通道分配是否满足 x16/x8 需求,插槽规划可看服务器PCIe插槽指南。
4. 散热与过热
GPU 过热会自动降频甚至掉卡,看 nvidia-smi 的温度与功耗。GPU 服务器散热(风冷/液冷)的规划可看GPU服务器散热方案。
三、GPU 占用率异常:两类典型
1. 占用率低但任务卡顿
常见是CPU/内存/IO 成为瓶颈,GPU 在等数据。用 nvidia-smi 看显存与 GPU 利用率,同时看 CPU 与磁盘 IO——AI 训练常卡在数据读取(IO)上。训练服务器整机配置的均衡性可看AI训练服务器配置方案。
2. 占用率异常高/持续满载
确认是业务正常负载还是挖矿木马等异常进程。用 nvidia-smi 查看进程占用(PID),再用系统命令定位进程身份。服务器被入侵的排查与应急可看服务器中毒被黑怎么办:应急响应。
四、常用诊断命令速查
nvidia-smi:显卡列表、利用率、显存、温度、功耗、进程;nvidia-smi -l 1:每秒刷新监控;lspci | grep -i nvidia:确认 PCIe 设备是否被识别;dmesg | grep -i nvidia:查内核报错(掉卡时关键)。
系统级排查命令的基础用法可看服务器常用命令速查。
五、虚拟化场景的 GPU 直通问题
虚拟化平台上 GPU 不识别,多与直通配置(PCIe Passthrough)有关:没开启 VT-d/IOMMU、直通设备未正确绑定、驱动不支持。GPU 直通的配置要点可看虚拟化平台对比与GPU直通。
六、结语
服务器 GPU 不识别、占用率异常,先分类型:不识别按"驱动→供电→PCIe→散热"排查,占用异常重点看瓶颈与异常进程。nvidia-smi 是第一步诊断工具,配合 dmesg 能定位大多数问题。GPU 服务器价值高、故障影响大,拿不准时让专业工程师现场诊断,避免误操作损坏设备。
延伸阅读推荐:

