第 5 章

电力散热与上云选择

·约 11 分钟

第 3 章的 DGX H100 规格表里有两个数字:最大功耗约 10.2 kW,重量约 130 kg。这一章就从这两个数字说起,GPU 服务器对机房提出了哪些普通服务器没有的要求,以及什么时候干脆不自己建、直接上云。

功率密度:AI 机柜为什么难伺候

传统数据中心的机柜,过去普遍按每柜几 kW 到十几 kW 的功率设计,一个机柜里放十几二十台普通服务器。AI 服务器把这个数字推高了一个数量级:

设备功耗
一台 DGX H100最大约 10.2 kW
一台 DGX B200最大约 14.3 kW
一柜放 4 台 DGX H10040 kW 以上
一柜 GB200 NVL72约 120 kW

一台 DGX H100 就吃掉了一个传统机柜的全部电力预算。很多老机房的应对办法是一个机柜只放一两台,其余空着,结果空间用不满,电和冷却先到顶。

功率密度带来两个直接问题:

  1. 供电:机房总容量、每个机柜的配电线路、PDU(机柜配电单元)都要按高功率重新规划,大功率机柜一般用三相电;
  2. 散热:服务器消耗的电几乎全部变成热,40 kW 的机柜就是一台 40 kW 的"电暖器",冷却能力必须跟上,否则 GPU 过热降频(第 7 章)。

供电冗余

AI 训练一次跑几周,断电的代价很大,所以供电层层做冗余:

  • 服务器电源冗余:DGX H100 有 6 个 3.3 kW 电源,4+2 冗余,坏两个照常运行;
  • 双路供电:服务器的电源分别接到 A、B 两路独立的供电线路上,一路断了另一路顶上;
  • UPS 和发电机:市电中断时 UPS(不间断电源)先顶住,柴油发电机随后启动;
  • N+1 与 2N:N+1 是在满足需求的 N 套设备之外多备一套;2N 是整套系统完整复制一份,可靠性更高,成本也翻倍。

PUE

衡量机房能效的常用指标是 PUE(电能使用效率):

PUE = 数据中心总耗电 ÷ IT 设备耗电

IT 设备以外的耗电主要是冷却、供配电损耗和照明。PUE 越接近 1 越好,1.0 意味着所有电都用在了计算上。行业平均大约在 1.5 左右,新建的高效机房能做到 1.2 甚至更低。功率密度越高,冷却的耗电占比越容易失控,这是 AI 机房普遍转向液冷的一个原因。

散热:从风冷到液冷

方式原理适合的密度代价
风冷机房空调把冷风送进机柜,服务器风扇把热风排出常规密度;一般认为到每柜三四十 kW 就很吃力最成熟、最便宜
冷热通道封闭把冷风和热风隔开,不让它们混提升风冷效率改造成本低
背板换热器(RDHx)机柜后门装水冷盘管,热风出机柜前先被冷却比纯风冷高需要把水引到机柜
冷板式液冷(DLC)冷板直接贴在 GPU、CPU 上,冷却液流过带走热量高密度,NVL72 这类机柜的标配需要冷却液分配单元(CDU)和机房水路
浸没式液冷整台服务器泡在不导电的冷却液里最高改造大,维护方式完全不同

液冷能带走更多热量的原因很直接:按体积算,水能吸收的热量是空气的三千多倍。风冷只能靠加大风量,风扇本身也耗电,到一定密度就走不下去了。

几个具体的例子:DGX H100 和 DGX B200 还是风冷;GB200 NVL72 必须用冷板式液冷,没有液冷条件的机房装不了。

设施还要考虑什么

除了电和冷,建一个 AI 机房还要检查这些条件:

项目要考虑什么
空间机柜数量、机柜的高度和深度(DGX H100 占 8U),维护通道
承重单台 DGX H100 约 130 kg,一整柜 NVL72 有一吨多,楼板承重要核算
电力容量园区和楼层的总供电能否支撑,扩容周期多长
冷却容量空调或液冷系统的总冷量;液冷还需要机房水路
网络与布线大量光纤和线缆的走线槽、配线架;轨道优化拓扑的线缆数量很大
物理安全门禁、监控、访问记录
消防适合电子设备的灭火系统
环境监控温度、湿度、漏水检测(液冷机房尤其重要)
运输与安装货梯、门洞能不能过整柜设备

这些条件大多不是加钱就能马上解决的:扩容供电、改造水路、加固楼板,都要以月甚至以年计。很多企业因此选择托管机房(colocation)或者直接上云。

能效:同样的电干更多活

电力是 AI 数据中心最硬的约束之一,所以"每瓦性能"越来越重要:

  • 加速计算本身更省电:同样的并行计算任务,GPU 完成单位工作量的能耗比 CPU 低得多;
  • 新一代硬件:每一代 GPU 的每瓦性能都在提升,同样的训练任务耗电更少;
  • 更低的精度:FP8、FP4 计算每次操作的能耗更低(第 1 章);
  • 提高利用率:空转的 GPU 也在耗电,调度和监控做好,让 GPU 少闲着(第 6、7 章);
  • 功耗上限:可以给 GPU 设功耗上限(nvidia-smi -pl),牺牲少量性能换更高的能效,或者在电力受限时多放几台;
  • 液冷:省下风扇的耗电,也让机房 PUE 更低。

本地部署还是上云

本地部署(on-prem)公有云
成本结构一次性投入大(CapEx),之后主要是电费和运维按用量付费(OpEx),不用前期投入
启动速度采购、建设、部署,以月计分钟到天级
弹性容量固定,高峰不够用、低谷闲置按需扩缩
长期成本GPU 长期高负载运行时更划算长期满载时通常更贵
数据数据留在自己手里,便于满足合规和数据主权要求大数据集上传下载慢,出云流量要收费
控制权硬件、网络、软件全部可定制受限于云厂商提供的规格和服务
运维需要自己的团队管硬件、网络、机房硬件运维由云厂商负责
获取新硬件看采购周期和供货看云厂商的上新和配额

判断时有几个关键问题:

  • 利用率:GPU 能不能长期保持高负载?能的话自建更划算,负载忽高忽低就适合上云;
  • 数据在哪里:数据量大、合规要求严的,算力最好靠近数据,搬数据比搬算力难(数据引力);
  • 时间:急着开始的先上云,机房建设等不起;
  • 团队:有没有人能运维 GPU 集群。

混合部署

实际上很多企业两者兼用:日常稳定的负载放在自建集群,高峰或临时的大任务借用云上的算力(cloud bursting);或者在云上做实验和训练,在本地部署推理服务,反过来也有。DGX Cloud 这类服务则提供了另一种选择:用的是 NVIDIA 的整套 DGX 软硬件,但放在云厂商的机房里按需租用。

速查

词一句话
功率密度一柜 DGX H100 就 40 kW 以上,NVL72 约 120 kW,传统机柜只按几 kW 到十几 kW 设计
N+1 / 2N多备一套 / 整套复制一份
PUE总耗电 ÷ IT 耗电,越接近 1 越好
冷热通道封闭隔开冷热风,提升风冷效率
冷板式液冷冷板贴芯片、冷却液带走热,高密度的主流方案
浸没式液冷服务器泡在不导电液体里
CapEx / OpEx一次性投入 / 按用量付费
数据引力数据量大时,让算力靠近数据
混合部署本地承担稳定负载,云上承担峰值