算力、网络和电力开始一起优化:九游会观察下一代数据中心调度模型 示意图
原创示意图,用于说明分析思路,非实拍画面

数据中心的日常运转,通常是三套系统各自做决定:调度器决定任务放在哪些机器上,网络决定流量走哪条路径,能源侧决定用电网、本地发电还是储能。每一套都在自己的目标上做得不错,可一旦要同时满足延迟、成本和碳排放,就会出现互相拆台的情形——比如算力调度器把推理请求集中到一个低碳地区,却让网络延迟超出了SLA。九游会把这类问题称为“算力、网络与电力的联合优化”,近期有一篇论文正好把它写成了一个可以求解的模型。

这篇论文做了什么:把三件事放进同一个约束集里

2026年5月,arXiv上出现一篇题为《Carbon-Aware Compute–Power Scheduling for AI Data Centers with Microgrid Prosumer Operations》的论文,作者来自独立研究者、企业与高校等多个背景。它面向地理上分布的多个AI数据中心,并假设每个站点都是能源的“产消者”——既从电网买电,也可能有本地发电和电池,还可以向电网反向送电。

模型的思路可以概括成四点:

  • 区分负载的灵活性。训练任务被当作刚性任务,必须连续完成;推理负载则是弹性的,可以在站点之间路由;
  • 同时调度能量。本地发电、电池充放电、与电网的双向交易,与算力调度一起求解;
  • 用约束表达服务要求。延迟、任务连续性、功率平衡与碳预算都写成约束,而不是事后检查;
  • 用混合整数线性规划求解。这是一类成熟的优化方法,好处是结果可以解释,坏处是问题规模变大时求解会变慢。

论文在合成实例上做了评估,默认设置为3个站点、24个小时段、6个刚性训练任务和3类弹性推理负载。作者报告:相比只优化算力或只优化能源的基线,联合优化的总体运营收益更高,同时排放更低;推理路由的灵活性和电池储能带来的时间转移价值是主要来源,在本地发电充足的场景里效果尤其明显。

为什么“联合”比“分开各自最优”更有意义

直观地想,如果只优化算力,调度器会把负载压到最便宜或最空闲的机器上,而不管那时那地的电是不是低碳;如果只优化能源,它会挑最便宜或最低碳的电,却可能让任务落到延迟不达标的站点。两个单独的局部最优放在一起,往往并不是整体的最优,甚至是不可行的。

储能是一个很好的例子。电池本质上是把“电”在时间上挪动的工具:电网低碳、便宜时充电,高碳时放电,让同一份算力需求在不同时段有不同的碳强度。但电池充放有损耗,循环寿命也有成本,这些只有放在同一个模型里,才能与“任务能不能延迟”一起权衡。这里也再次提醒了一个区分:节能与减碳不是同一个目标。电池会造成损耗,总用电量因此略增,但碳排却可能下降。

类似的思路并不孤立。较早的公开研究中,也有工作讨论在日前规划与实时任务放置之间做两阶段优化,以在电网条件波动下降低数据中心的碳成本;企业侧也有把可延迟的媒体处理任务,按电网预测挪到更低碳的时段和地区的公开实践,同时说明隐私法规等条件会限制跨区搬运。这些资料共同指向一点:可移动的负载才有联合优化的空间

先别急着下结论:这项研究没有回答的问题

作为观察者,我们更在意论文的边界,因为这些边界决定了它离游戏运营还有多远。

  1. 合成实例。结论来自“实际动机下的合成数据”,不是真实数据中心的实测运营数据,因此不能把它说成某个具体的节能比例,更不能说游戏服务器可以据此省下多少电。
  2. 参数被当作已知。论文把电价、碳强度、制冷系数等作为外部给定值,属于确定性的有限时域问题,而现实里碳强度预测有误差,负载也有突发。作者自己也提到,规模变大时需要分解或近似,并需要扩展到含不确定性的场景。
  3. 不是实时在线调度。它是一个在规划窗口内求全局解的模型,不等于毫秒级的请求路由。
  4. 负载类型偏AI数据中心。训练与推理的特征,与实时对战的延迟敏感、玩家分布高度相关的特征,并不一致。

对游戏基础设施意味着什么:把SLA当作硬约束

游戏服务器最重要的服务质量指标是延迟与稳定性,玩家不会为一个绿色目标原谅卡顿。这篇论文里“延迟”作为约束而不是目标的写法,恰好是游戏场景值得借用的地方:调度不能靠牺牲体验换低碳,而要在满足SLA的候选集合里再去找更低碳的选项。

落到游戏上,大致可以分成三层:

  • 实时对战服务器:玩家位置与延迟预算决定了候选机房,区域调度的空间很有限,重点在低峰时合并实例、避免长期空闲;
  • 准实时服务:如匹配、排行榜、商城接口,有一定的延迟余量,可以在同一区域的不同机房间调度;
  • 后台与批处理:日志分析、资产处理、补丁构建、AI推理批处理等,才是真正“弹性路由”的对象,这一部分与游戏服务器能不能跟着可再生能源“迁移”一文的讨论对应。

换句话说,论文中“可弹性路由的推理”在游戏里的对应物,不是对局服务器,而是后台的可延迟任务。这类任务占多大比例,取决于每家公司的负载结构,这里不给出通用数字。

联合优化落到执行:需要模拟,也需要人来兜底

把多个目标放进同一个优化器,还会产生另一种风险:优化器给出的方案在数学上可行,在现实里却可能违反没被写进模型的约束——某条专线的维护窗口、某个机房的合规限制、某次赛事的保障需求。九游会数据中心AI的设计取向,是不让模型的输出直接改动真实基础设施,而是走“建议、模拟、执行”的流程,在模拟环节检查延迟、容量与能源影响,再由调度策略或运营人员确认。这一流程在AI能不能自动管理游戏数据中心?中有更具体的说明。

与此同时,联合优化并不否定单指标的价值,例如PUE、GPU利用率仍然是有用的诊断量,只是不能单独当结论。多目标权衡的思路,可以进一步参考游戏数据中心为什么不能只追求最低PUE?

九游会接下来关注的几件事

  • 把碳强度预测的不确定性纳入调度,而不是只用一个点预测;
  • 区分平均碳强度与边际碳强度,避免把“搬到平均更低碳的地区”误认为一定减排;
  • 把网络能耗与延迟作为显式项,而不只是把算力与电力放在一起;
  • 在真实的运营数据上,重新评估每一类负载的“可移动比例”,并诚实标明哪些还只是模拟结论。

我们的判断是:联合优化是值得追踪的方向,但当前的公开证据主要来自模拟与合成实例。它带来的更像是一套提问方式——哪些负载能动,动了会不会违反SLA,动完以后碳排到底变没变——而不是一个可以直接写进承诺的节能数字。关于碳感知调度在时间维度上的进展,可以参见数据中心开始从“节能”走向“看电网碳强度”