同一局游戏放在两个地区运行,碳排放为什么可能完全不同?九游会AI开始理解电网碳强度
用两个虚构地区把同一批对局完整算一遍:先看IT耗电,再乘PUE,再乘电网碳强度,最后加上延迟约束和数据传输成本。结论是实时对战基本留在玩家附近,真正能挪动的是日志分析、资产处理、补丁构建和批量推理这类后台任务。
游戏数据中心的优化,最常见的误区是只盯着一个指标:PUE 低就是好,GPU 利用率高就是好,电价便宜就是好。但对一个要服务全球玩家的游戏来说,每一项决定都要同时面对电力、GPU、网络、负载、区域和延迟这六件事,只优化其中一项,往往会让另一项变差。九游会数据中心AI这个栏目,围绕的就是这种多目标的取舍。
本栏目里带数字的示例,均标注为模拟示例,只用于说明计算方式,不代表任何真实数据中心或九游会的实际数据。
同样的 10kWh,在煤电占比高的地区和水电、风电占比高的地区,碳排放可以差别很大;即使在同一个地区,白天光伏充足的时段与傍晚用电高峰的时段,电网碳强度也不一样。所以,“少用电”和“少排碳”是两件事,需要分别衡量:前者是能效(Energy Efficiency),后者是碳效率(Carbon Efficiency)。
碳感知计算的核心想法,就是让可以移动的任务去到碳强度更低的时间和地点。同一局游戏放在两个地区运行,碳排放为什么可能完全不同用一个模拟示例演示了这种差异。要注意的是,碳强度还有平均值与边际值之分,两者对同一个决策可能给出不同的结论,这也是这类估算最大的不确定来源之一。
平均碳强度描述的是某一时段电网整体的平均排放,适合做年度或月度核算;边际碳强度描述的是多用一度电时,实际被调用的那台机组的排放,更接近调度决策的真实影响,但估算难度更大,数据也更不透明。两者混着用,结论就会摇摆。九游会数据中心AI的做法,是在结果里标明用的是哪一种,并在可能时同时给出两种口径下的比较,让使用者自己判断结论是否稳健。
GPU 的利用率是一个容易被误读的指标。利用率高,意味着这块卡没有闲着,但如果它在做重复或低效的工作,或者被调到了性能功耗曲线上不划算的区间,则单个任务消耗的能量反而可能更高。真正有意义的问题是:在同样的吞吐量下,每个任务消耗多少能量;也就是每瓦性能(Performance per Watt)。
GPU利用率高就一定节能吗更详细地讨论了这一点,包括批处理规模、显存带宽、功耗上限对吞吐量的影响。这里也要坦白一件事:不同型号和工作负载的功耗曲线差别很大,没有一个通用的“最佳利用率”数字,只能针对具体硬件和任务实测。
游戏场景里的 GPU 任务大致有三类:云渲染或云游戏的实时渲染、AI 推理(比如内容生成、客服与反作弊模型)、以及离线的训练与资产处理。第一类受延迟约束,GPU 需要为峰值预留余量,利用率天然不高;后两类则可以排队、合并、错峰。把它们放在同一个指标下比较“利用率”,得出的结论多半没有意义,需要按负载类型分别看。
玩家距离服务器越远,网络路径越长,延迟通常会越高,途经的路由与传输设备也越多,能耗随之增加。对实时游戏来说,延迟是硬约束:把服务器搬到很远的低碳地区,可能省了发电侧的碳,却让玩家的对局体验变差,网络传输的能耗也不一定更低。所以九游会数据中心AI的调度模型里,延迟与网络路径是与电力并列的输入,而不是事后检查项。
网络能耗的估算同样有争议:用“每 GB 耗多少度电”这样的系数,简单,但不同研究的边界差异很大。我们更倾向于给出区间,并标注假设,而不是单点。
另一个容易被忽视的地方,是视频编码与传输:云渲染要把画面持续编码后送给玩家,这一段的能耗与码率、分辨率、帧率都有关系,而且发生在数据中心和网络两侧。想判断云渲染是否划算,必须把数据中心 GPU、制冷、编码、网络路径和玩家终端一起放进系统边界,单看其中一段,容易得出片面的结论。
数据中心里的负载并不都一样。实时对战服务器需要低延迟与稳定,位置基本由玩家所在地决定,能移动的空间很小;而日志分析、资产处理、AI 推理批处理、补丁构建、内容生成、模型训练等非实时任务,往往可以延后,也可以在不同区域之间调整。绿色算力的空间主要在后者,前者则应优先保证延迟与 SLA。
游戏服务器能不能跟着可再生能源“迁移”专门区分了这两类负载的答案:能迁的,要看数据位置、迁移成本和截止时间;不能迁的,就只能通过更高效的资源利用和更低碳的本地供电来改善。
后台任务的迁移也不是没有代价:数据要跨区域搬运,搬运本身有网络能耗;结果要回传,回传要花时间;任务失败后重试,又会额外耗电。所以是否值得迁移,要把搬运数据量、任务时长、两地碳强度差和截止时间放在一起估算。数据量大而计算量小的任务,往往不值得迁;计算量大而数据量小的任务,才更适合“计算去找低碳电力”。
风电与光伏的出力随天气、时间波动,同一地区不同时段的碳强度也在变化。可延迟的任务可以在可再生能源富余的时段运行,可迁移的任务可以去可再生能源充足的区域。但这依赖对未来几小时的碳强度预测,预测本身也会出错,尤其是在天气变化快的时候。
此外,迁移到新区域还要考虑合规、数据主权、成本和容量。这些因素常常让“理论上最低碳”的区域并不可用,调度模型应当把它们作为约束,而不是忽略。
可再生能源合同本身也有口径问题:购买绿电证书、签订购电协议与实际用电时刻的电网碳强度,并不是一回事。按“年度匹配”核算和按“小时匹配”核算,结论可能相差很大。我们在报告里会写明所采用的核算方式,避免把不同口径的“绿电占比”直接拿来对比。
PUE 等于数据中心总设施能耗除以 IT 设备能耗,最小值是 1.0,用来衡量设施相对 IT 设备的额外开销,比如制冷与配电。它是有用的指标,但它不反映电力是否来自低碳来源,也不反映 IT 负载本身是否高效。一个 PUE 很好的数据中心,如果用的是高碳电力,或者服务器大量空转,整体碳排仍可能很高。
数据中心PUE很好看,为什么整体碳排还是可能很高用模拟示例说明了这一点。所以我们不会把“迁到 PUE 最低的数据中心”当作通用答案,尤其是对延迟敏感的实时游戏。
用一个模拟示例来说明:数据中心甲的 PUE 为 1.2,所在电网碳强度较高;数据中心乙的 PUE 为 1.4,电网碳强度较低。同样一个 IT 负载放到两边,甲的总设施电量更少,乙的碳排放却可能更低,取决于两地碳强度差与 PUE 差哪个更大。这只是示意数据,并不对应任何真实数据中心,目的是说明为什么设施效率与碳效率要分开看。
把电力、GPU、网络、负载、区域和延迟放到一起,就成了一个多目标优化问题:成本、碳排放、能耗、延迟和服务器容量互相牵制。一种常见做法是把实时约束(延迟、SLA、容量)作为硬约束,把能耗、碳排放和成本作为目标,再通过权重或帕累托前沿来选择方案。游戏数据中心为什么不能只追求最低PUE正是从这个角度展开的。
近期研究里也出现了类似的方向。2026年5月,arXiv 上有一篇作者来自多家机构的论文,把训练任务调度、可弹性路由的推理负载、本地发电与电池储能,以及碳排放放在同一个混合整数线性规划中联合优化。需要强调的是,那是合成实例上的实验结果,不能当作真实数据中心的实测节能比例。
目前的设计取向是:读取服务器负载、GPU 利用率、区域延迟、电价与碳强度数据,为非实时任务给出候选的运行时间与区域,并提示实时游戏的容量与延迟风险;建议先在模拟环境中评估,再由运营人员确认执行。你可以在九游会绿色运营里看到它与在线人数预测的衔接。
它不能保证在所有情况下都降低碳排放,也不能替代对具体数据中心和电网的实测。对没有历史数据的新区域,模型给出的区间会很宽。我们更希望把这些边界讲清楚,而不是给出一个好看的节能百分比。
用两个虚构地区把同一批对局完整算一遍:先看IT耗电,再乘PUE,再乘电网碳强度,最后加上延迟约束和数据传输成本。结论是实时对战基本留在玩家附近,真正能挪动的是日志分析、资产处理、补丁构建和批量推理这类后台任务。
最低PUE的机房不一定是游戏该去的机房。设施效率、GPU利用率、玩家到机房的延迟、电网碳强度和成本各自指向不同方向,本文拆开这些目标,讲多目标调度里哪些是硬约束、哪些可以权衡,以及什么情况下结论会失效。
“跟着可再生能源迁移”听起来很顺,落到游戏上却要先问一句:这是实时对战,还是可以晚几小时的后台任务?文章从延迟预算、数据搬运和电网信号出发,说明哪些负载能挪、能挪多远,哪些一步也不能动,以及“搬到绿电多的地方”为什么不等于真正减碳。
监控面板上GPU利用率95%,并不等于这块卡在高效工作,也不等于电用得值。本文拆解利用率的几个盲区,用模拟示例比较不同配置下的每任务能耗,并说明云渲染、推理和离线任务分别该看哪些指标、哪些结论不能轻易下,以及九游会目前做不到的部分。
PUE 1.1听起来很漂亮,但它只说明制冷和配电开销小,不说明用的是煤电还是水电。本文用模拟示例比较不同电网下的碳排,讲清PUE、CUE与IT利用率各自回答什么问题,以及游戏运营在实时延迟约束下,到底该怎么读这些数字、怎么选机房和区域。
请留下您的联系方式,我们会尽快与您联系。