选数据中心时,PUE 常被当成一张成绩单:1.1 很漂亮,1.5 一般,2.0 就得整改。这套读法没有错,但它只答了半个问题。PUE 全称 Power Usage Effectiveness,定义是数据中心总设施能耗除以 IT 设备能耗,最低为 1.0。它告诉你每 1 度电用在服务器、存储和网络上,机房还要额外为制冷、配电、照明多花多少电。它不告诉你这些电是烧煤发的还是风电、水电,也不告诉你那批服务器是不是在空转。九游会在整理数据中心相关指标时,反复强调的正是这一点:PUE 是设施效率,不是碳排指标。
PUE 回答了什么,又没回答什么
先把口径写清楚。PUE = 总设施能耗 ÷ IT 设备能耗。IT 设备能耗越大、非 IT 开销越小,比值就越接近 1。这个指标之所以流行,是因为容易测、容易比较,也和运营成本直接相关。近年的行业调查显示,全球平均 PUE 在 1.5 多一点的位置停留了好几年:Uptime Institute 2024 年的调查给出的平均值约为 1.56,2025 年的调查约为 1.54,规模较大、建成时间较短的设施明显更低,而炎热地区的老设施则更高。这些数字说明设施层面的改进已经进入缓慢阶段,但它们同样不包含任何电力来源的信息。
要看碳,至少还需要两个量:一是这些电力的排放因子,单位常写作 gCO2/kWh,随地区、季节、时段变化;二是 IT 负载本身的效率,也就是同样的玩家服务到底用了多少 IT 电量。PUE 对这两者都是沉默的。Uptime 调查里有一个耐人寻味的对比:能耗与 PUE 是最常被追踪的指标,而追踪可再生能源使用量的受访者只占四成多,说明行业里“看得见的指标”和“真正影响碳排的指标”并不完全重合。
模拟示例:PUE 1.15 的机房,为什么反而排得更多
假设两个机房承载相同的 IT 负载,一个月的 IT 设备用电都是 1000kWh。
| 机房 | PUE | 设施总电量 | 电网排放因子 | 碳排 |
|---|---|---|---|---|
| X:新建、风冷优化,所在电网煤电占比高 | 1.15 | 1150 kWh | 700 gCO2/kWh | 805 kg |
| Y:较老、PUE 一般,所在电网水电占比高 | 1.50 | 1500 kWh | 100 gCO2/kWh | 150 kg |
在这组假设下,X 的 PUE 比 Y 好得多,总电量少了三百多度,碳排却是 Y 的五倍以上。这不是说低 PUE 没价值,而是说单看 PUE 得不出低碳的结论。反过来,如果把 X 的排放因子换成和 Y 一样,X 就会明显领先。所以真正有用的做法是把 PUE、排放因子和 IT 负载放在同一个乘法里:碳排 ≈ IT 电量 × PUE × 排放因子。三项里任何一项都可能成为主要矛盾。
行业里也有专门把碳放进指标的做法,例如碳使用效率 CUE(Carbon Usage Effectiveness),概念上是数据中心总碳排除以 IT 设备能耗。它有用,但同样依赖排放因子怎么选,这一点下面会讲。
排放因子怎么选,会让同一座机房的碳排差出一大截
PUE 只需要一个电表比值,碳排却需要在核算口径上做选择,常见的分歧有三处。
- 位置法与市场法:位置法用机房所在电网的平均排放因子;市场法则反映企业采购的电力合同,例如购买绿电或签订长期购电协议。两种口径下同一机房的 Scope 2 数字可能相差很大,谁更“真实”取决于是否真的有对应的可再生电力被使用。
- 平均值与时段值:年平均排放因子适合做年度报告,但可延迟的任务想选择低碳时段,就需要按小时的数据。平均排放因子与边际排放因子也不同,前者是整体电网每度电的平均排放,后者是多用一度电时实际增加的那部分发电排放。
- 是否包含上游与制造:用电只是运营排放。服务器与设施的制造属于隐含碳,通常算在 Scope 3,PUE 与 CUE 都不覆盖。
这些差别的一般讨论,可以参考《九游会官网为什么不把“节能”和“低碳”画等号?同样少用1度电,减排效果可能完全不同》。在游戏运营里,重点不在于选哪种口径最好看,而在于一份报告里始终用同一种,并把选择写出来。
IT 侧的效率同样被 PUE 遮住
PUE 的分母是 IT 设备能耗,所以有一个反直觉的现象:IT 负载越低效、耗电越多,PUE 反而可能更漂亮,因为固定的制冷和配电开销被摊薄了。一台大部分时间空转的服务器,对 PUE 是“友好”的,对碳排却是浪费。空闲功率的问题在《服务器利用率只有20%,电费会不会只剩20%?九游会为什么开始关注“空闲算力”的隐藏能耗》里用模拟示例讲过。GPU 也是同一个道理:利用率数字好看,并不保证每个任务花的电少,相关观察见《GPU利用率高就一定节能吗?九游会为什么要同时观察吞吐量和每任务能耗》。
另一个测量上的细节是,采用液冷、机柜内风扇归属不同、或者部分设备的用电被算进 IT 还是算进设施,都会让 PUE 出现难以横向比较的偏差。比较两个机房的 PUE 之前,先问清楚测量边界、测量周期是全年还是某个季节,以及是不是仅针对部分楼层。
放到游戏运营里:延迟先说话,碳排再排序
游戏数据中心的选择,和普通企业机房不同的地方在于,实时对战服务器必须靠近玩家。这意味着“把所有负载搬到 PUE 最低、电网最绿的那个机房”这个念头,对实时游戏基本行不通:玩家距离过远,延迟上升,网络传输的能耗也会增加,体验先就出了问题。所以顺序应该是:先用延迟和服务等级划出可选区域,再在可选区域内比较 PUE、排放因子、容量和成本。
可以移动的是另一类负载:日志分析、资产处理、补丁构建、内容生成、离线模型训练等非实时任务。这类任务可以在排放因子较低的时段、较绿的区域运行,此时机房的 PUE 只是评估里的一个因子,而不是唯一的判据。这条思路与多目标优化框架一致,可参考《游戏数据中心为什么不能只追求最低PUE?九游会AI开始把玩家延迟、算力和碳排放一起优化》。近期行业里关注电网碳强度的做法也在增多,相关讨论见《数据中心开始从“节能”走向“看电网碳强度”:九游会观察Carbon-Aware Computing》。
九游会数据中心AI目前怎么读这些数字
九游会数据中心AI的设计取向,是把 PUE 当作一个必填但不充分的输入。它会同时读取:机房或云区域的 PUE(并注明测量边界)、各区域的排放因子与其时间粒度、IT 负载的功率与利用率、延迟约束,以及任务是否可延迟。输出的不是一个“最优机房”,而是按负载类型给出的候选区域与时段,并显示每个候选方案在电量和碳排上的估算区间。
需要说清楚的限制:
- 很多云服务商不公开分区域的实时 PUE,只公布年度均值或整体数字,估算里会带入较大误差。
- 排放因子的时间粒度和数据来源不统一,可能出现同一个地区两个来源不同数值的情况。
- 租用云主机时,隐含碳和设施共享部分的分摊没有统一方法。
- 目前不能给出任何具体机房“低碳”或“高碳”的结论,只有在填入真实数据、明确口径之后,模型输出才有意义。
读到一个漂亮的 PUE 时,可以追问的几件事
- 这个 PUE 是全年平均、峰值时段还是设计值?
- 它是整座设施,还是其中某个机房?
- 所在电网的排放因子是多少,是年均值还是按小时?有没有可信的可再生电力采购?
- IT 负载的利用率与每任务能耗如何,是不是有大量空转?
- 把负载放在这里,玩家延迟和网络传输会怎样变化?
这五个问题问完,PUE 才算被放回它该在的位置:一个重要的设施效率指标,但不是碳排的答案。