
一、先算明白:GPU服务器有多耗电
机柜规划的第一步永远是算功耗。GPU 是功耗大户,一台 8 卡 A100 整机满载通常在6kW-8kW,8 卡 H100 更高达10kW+,配上网络交换机、PDU 损耗,单柜规划要留足余量。
| 配置 | 单机满载功耗 | 单柜理论可放 |
|---|---|---|
| 2U单卡4090(推理) | 约0.8-1.2kW | 可放多台(视散热) |
| 4卡L40S | 约2-3kW | 约3-4台 |
| 8卡A100整机 | 约6-8kW | 风冷下约2-3台,液冷可更多 |
| 8卡H100整机 | 约10-12kW | 风冷约1-2台,核心场景上液冷 |
注意"单柜理论可放"只是容量,实际受供电、散热、承重三方约束,三者取最小。若你想系统判断单机要多大功耗和怎么配电源,参考GPU服务器散热方案:8卡A100/H100液冷vs风冷实测会更细。
二、机柜供电规划:瓦数、回路、PDU
供电是 GPU 机柜最容易翻车的一环,规划要点:
- 总瓦数:把柜内所有设备满载功耗 + 20%余量,就是本柜需向机房申请的供电;
- 单回路 vs 双回路:A/B 双路冗余是生产标配,单路断电即宕机;
- PDU 相位与插座:注意是三相还是单相、多少 C19/C13 口,别到货了插不下;
- 功率因数与UPS:UPS 容量按 P 值留余量,GPU 瞬时功耗波动大,UPS 要能扛突刺。
机柜内交换与网络设备的供电同样要算进总瓦数,网络设备选型可参考GPU服务器网络配置:InfiniBand vs RoCE vs NVLink。
三、散热规划:风冷 vs 液冷
GPU 高密度下,散热从"配几台风扇"升级成"决定机柜怎么设计":
- 风冷:8卡A100 可勉强风冷,但要注意热风道与冷/热通道,柜内气流不能短路,一般要求机柜前后深度与机房空调匹配;
- 液冷(冷板式):H100 等高功耗必选,冷板直触 GPU 带走大部分热量,机柜供电密度可大幅提升,但需机房配 CDU/管路;
- 噪音:8卡机满载噪音可达 80dB+,人站旁边受不了,需考虑隔离。
想深入了解液冷 vs 风冷的实测对比和选型,可读GPU服务器散热方案:8卡A100/H100液冷vs风冷实测。
四、机房承重与整体放不放得下
一台 8 卡整机通常 140-180kg,一柜插满就是数百公斤,要把机房楼板承重算进去;同时柜内深度(一般选 1000mm+)、前后门开度、走线槽都要为 GPU 高密度预留。规划时建议做一张"供电-散热-承重"三个Xs清单逐项打勾,避免到托管时才发现问题。
五、一份 8 卡GPU机柜方案的完整测算示例
假设要跑一套 8 卡 H100 训练节点:
- 单机约 10-12kW,配双回路 → 本柜整柜供电申请约 15-18kW;
- 散热选冷板液冷 + CDU,机柜内可稳定放 2-3 台;若被迫风冷,则降到 1-2 台并严格做冷热通道;
- 承重:整柜按 400kg+ 复核楼板;
- 配 40G/100G 网络交换机,与计算节点同柜或同架,缩短链路。
整个"从零搭一套 GPU 集群"的流程,包括网络、调度、存储,可看GPU服务器集群建设与算力调度实战。
规划时还要记得为扩容与节能留空间:GPU 功耗随时钟频率和负载剧烈波动,若能开启动态降频/电源管理,闲时功耗能明显下降;机柜内的供电、散热若按"只够当前机器"来配,后续加卡就得几乎推倒重来。所以建议预留一档余量,并按"先加散热再加固态供电"的顺序逐步升级,避免一次到位造成浪费。
六、结语
GPU服务器机柜规划的本质是供电、散热、承重三者的平衡,GPU 高功耗让散热从"配风扇"升级为"设计机房"。先算清单机功耗与本柜总瓦数,再按风冷/液冷决定柜内容量与机房配套,最后复核承重与噪音,机柜就能安全稳定地运行起来。
延伸阅读推荐:

