第 5 章
电力散热与上云选择
第 3 章的 DGX H100 规格表里有两个数字:最大功耗约 10.2 kW,重量约 130 kg。这一章就从这两个数字说起,GPU 服务器对机房提出了哪些普通服务器没有的要求,以及什么时候干脆不自己建、直接上云。
功率密度:AI 机柜为什么难伺候
传统数据中心的机柜,过去普遍按每柜几 kW 到十几 kW 的功率设计,一个机柜里放十几二十台普通服务器。AI 服务器把这个数字推高了一个数量级:
| 设备 | 功耗 |
|---|---|
| 一台 DGX H100 | 最大约 10.2 kW |
| 一台 DGX B200 | 最大约 14.3 kW |
| 一柜放 4 台 DGX H100 | 40 kW 以上 |
| 一柜 GB200 NVL72 | 约 120 kW |
一台 DGX H100 就吃掉了一个传统机柜的全部电力预算。很多老机房的应对办法是一个机柜只放一两台,其余空着,结果空间用不满,电和冷却先到顶。
功率密度带来两个直接问题:
- 供电:机房总容量、每个机柜的配电线路、PDU(机柜配电单元)都要按高功率重新规划,大功率机柜一般用三相电;
- 散热:服务器消耗的电几乎全部变成热,40 kW 的机柜就是一台 40 kW 的"电暖器",冷却能力必须跟上,否则 GPU 过热降频(第 7 章)。
供电冗余
AI 训练一次跑几周,断电的代价很大,所以供电层层做冗余:
- 服务器电源冗余:DGX H100 有 6 个 3.3 kW 电源,4+2 冗余,坏两个照常运行;
- 双路供电:服务器的电源分别接到 A、B 两路独立的供电线路上,一路断了另一路顶上;
- UPS 和发电机:市电中断时 UPS(不间断电源)先顶住,柴油发电机随后启动;
- N+1 与 2N:N+1 是在满足需求的 N 套设备之外多备一套;2N 是整套系统完整复制一份,可靠性更高,成本也翻倍。
PUE
衡量机房能效的常用指标是 PUE(电能使用效率):
PUE = 数据中心总耗电 ÷ IT 设备耗电
IT 设备以外的耗电主要是冷却、供配电损耗和照明。PUE 越接近 1 越好,1.0 意味着所有电都用在了计算上。行业平均大约在 1.5 左右,新建的高效机房能做到 1.2 甚至更低。功率密度越高,冷却的耗电占比越容易失控,这是 AI 机房普遍转向液冷的一个原因。
散热:从风冷到液冷
| 方式 | 原理 | 适合的密度 | 代价 |
|---|---|---|---|
| 风冷 | 机房空调把冷风送进机柜,服务器风扇把热风排出 | 常规密度;一般认为到每柜三四十 kW 就很吃力 | 最成熟、最便宜 |
| 冷热通道封闭 | 把冷风和热风隔开,不让它们混 | 提升风冷效率 | 改造成本低 |
| 背板换热器(RDHx) | 机柜后门装水冷盘管,热风出机柜前先被冷却 | 比纯风冷高 | 需要把水引到机柜 |
| 冷板式液冷(DLC) | 冷板直接贴在 GPU、CPU 上,冷却液流过带走热量 | 高密度,NVL72 这类机柜的标配 | 需要冷却液分配单元(CDU)和机房水路 |
| 浸没式液冷 | 整台服务器泡在不导电的冷却液里 | 最高 | 改造大,维护方式完全不同 |
液冷能带走更多热量的原因很直接:按体积算,水能吸收的热量是空气的三千多倍。风冷只能靠加大风量,风扇本身也耗电,到一定密度就走不下去了。
几个具体的例子:DGX H100 和 DGX B200 还是风冷;GB200 NVL72 必须用冷板式液冷,没有液冷条件的机房装不了。
设施还要考虑什么
除了电和冷,建一个 AI 机房还要检查这些条件:
| 项目 | 要考虑什么 |
|---|---|
| 空间 | 机柜数量、机柜的高度和深度(DGX H100 占 8U),维护通道 |
| 承重 | 单台 DGX H100 约 130 kg,一整柜 NVL72 有一吨多,楼板承重要核算 |
| 电力容量 | 园区和楼层的总供电能否支撑,扩容周期多长 |
| 冷却容量 | 空调或液冷系统的总冷量;液冷还需要机房水路 |
| 网络与布线 | 大量光纤和线缆的走线槽、配线架;轨道优化拓扑的线缆数量很大 |
| 物理安全 | 门禁、监控、访问记录 |
| 消防 | 适合电子设备的灭火系统 |
| 环境监控 | 温度、湿度、漏水检测(液冷机房尤其重要) |
| 运输与安装 | 货梯、门洞能不能过整柜设备 |
这些条件大多不是加钱就能马上解决的:扩容供电、改造水路、加固楼板,都要以月甚至以年计。很多企业因此选择托管机房(colocation)或者直接上云。
能效:同样的电干更多活
电力是 AI 数据中心最硬的约束之一,所以"每瓦性能"越来越重要:
- 加速计算本身更省电:同样的并行计算任务,GPU 完成单位工作量的能耗比 CPU 低得多;
- 新一代硬件:每一代 GPU 的每瓦性能都在提升,同样的训练任务耗电更少;
- 更低的精度:FP8、FP4 计算每次操作的能耗更低(第 1 章);
- 提高利用率:空转的 GPU 也在耗电,调度和监控做好,让 GPU 少闲着(第 6、7 章);
- 功耗上限:可以给 GPU 设功耗上限(
nvidia-smi -pl),牺牲少量性能换更高的能效,或者在电力受限时多放几台; - 液冷:省下风扇的耗电,也让机房 PUE 更低。
本地部署还是上云
| 本地部署(on-prem) | 公有云 | |
|---|---|---|
| 成本结构 | 一次性投入大(CapEx),之后主要是电费和运维 | 按用量付费(OpEx),不用前期投入 |
| 启动速度 | 采购、建设、部署,以月计 | 分钟到天级 |
| 弹性 | 容量固定,高峰不够用、低谷闲置 | 按需扩缩 |
| 长期成本 | GPU 长期高负载运行时更划算 | 长期满载时通常更贵 |
| 数据 | 数据留在自己手里,便于满足合规和数据主权要求 | 大数据集上传下载慢,出云流量要收费 |
| 控制权 | 硬件、网络、软件全部可定制 | 受限于云厂商提供的规格和服务 |
| 运维 | 需要自己的团队管硬件、网络、机房 | 硬件运维由云厂商负责 |
| 获取新硬件 | 看采购周期和供货 | 看云厂商的上新和配额 |
判断时有几个关键问题:
- 利用率:GPU 能不能长期保持高负载?能的话自建更划算,负载忽高忽低就适合上云;
- 数据在哪里:数据量大、合规要求严的,算力最好靠近数据,搬数据比搬算力难(数据引力);
- 时间:急着开始的先上云,机房建设等不起;
- 团队:有没有人能运维 GPU 集群。
混合部署
实际上很多企业两者兼用:日常稳定的负载放在自建集群,高峰或临时的大任务借用云上的算力(cloud bursting);或者在云上做实验和训练,在本地部署推理服务,反过来也有。DGX Cloud 这类服务则提供了另一种选择:用的是 NVIDIA 的整套 DGX 软硬件,但放在云厂商的机房里按需租用。
速查
| 词 | 一句话 |
|---|---|
| 功率密度 | 一柜 DGX H100 就 40 kW 以上,NVL72 约 120 kW,传统机柜只按几 kW 到十几 kW 设计 |
| N+1 / 2N | 多备一套 / 整套复制一份 |
| PUE | 总耗电 ÷ IT 耗电,越接近 1 越好 |
| 冷热通道封闭 | 隔开冷热风,提升风冷效率 |
| 冷板式液冷 | 冷板贴芯片、冷却液带走热,高密度的主流方案 |
| 浸没式液冷 | 服务器泡在不导电液体里 |
| CapEx / OpEx | 一次性投入 / 按用量付费 |
| 数据引力 | 数据量大时,让算力靠近数据 |
| 混合部署 | 本地承担稳定负载,云上承担峰值 |