AI能不能自动管理游戏数据中心?九游会为什么需要“建议—模拟—执行”三层架构 示意图
原创示意图,用于说明分析思路,非实拍画面

假设凌晨的负载曲线很平,AI给出一条建议:把某区域三分之一的实例下线,并把两批后台构建任务推迟到低碳时段。单看这句话没有问题,历史数据也支持。但真实机房里还有很多这句话没有覆盖的东西:那个区域的热备是不是刚好在这三分之一里;下线之后,另一个区域会不会因为玩家自动重连而被打满;凌晨是否安排了补丁分发或一场小型赛事。

这就是为什么九游会AI大模型不把“AI提出方案”和“系统真的去执行”连成一条线。中间需要一道能回答“如果这样做,会发生什么”的环节,以及一组无论AI多有把握都不能突破的规则。本文按三层来讲:建议层产出什么,模拟层能模拟什么、不能模拟什么,执行层如何分级放权,最后谈安全边界。

第一层:建议只是一份带假设的提案

建议层由预测模型、优化模型和语言模型协同产生,分工见大模型负责“看懂运营问题”,优化器负责“真正调服务器”。它的输出不应该是一句“建议缩容”,而是一份结构化提案:涉及哪些实例或任务,动作是什么(缩容、合并、迁移、延迟),预期收益(估算的kWh与gCO2变化区间),依赖的假设(预测区间、热备是否可用、电网碳强度数据的时间),以及一条“最坏情形”的说明。

提案要带假设,是因为后面的模拟需要用这些假设做对照。如果一个提案只说“省电”,模拟环节无从检验;如果它写明“假设未来两小时并发不超过预测区间的上沿”,模拟就可以专门去跑上沿情形和超出上沿的情形。

第二层:数字孪生能试什么

数字孪生(Digital Twin)在这里指的是对游戏运营基础设施的一个可运行的数学副本:包含各区域的服务器容量、实例启动时间、玩家到区域的延迟分布、网络出口带宽、服务器功率随利用率变化的曲线、冷却与PUE的近似关系,以及电价和电网碳强度的时间序列。提案在孪生里被“回放”,看几类指标。

检查项 孪生里看什么 典型的失真来源
延迟与容量 动作后各区域利用率、排队、玩家延迟分布是否越过上限 玩家迁移行为、重连风暴、区域间路由变化
体验与SLA匹配等待时间、掉线率是否在约束内 历史样本里没有出现过的组合
能耗 动作前后的功率(kW)积分得到的电量(kWh) 功率曲线是建模值,不是实测值
碳排 电量乘以对应时段与区域的排放因子 平均因子与边际因子的选择;数据延迟
连带影响 其他任务是否被挤压,如补丁构建、日志分析 任务依赖关系没有完整建模

公开资料显示,数据中心领域近期对数字孪生用于AI控制可靠部署的讨论明显增多,其中一个常见思路是在孪生里做安全验证,再把动作放到真实系统。九游会的设计取向与此一致,但需要强调:孪生只是模型,它的价值来自定期与真实观测对照校准,而不是它看起来很精细。

孪生失真时:几种典型的“模拟通过、现实翻车”

  • 玩家行为不是常数。孪生里假设某区域下线一批实例后,玩家会均匀分流;现实里可能因为登录失败集中重试,形成瞬时峰值。
  • 冷启动时间被低估。孪生用平均启动时间,而真实的镜像拉取、资源初始化在网络拥塞时可能长得多,缓冲就不够了。
  • 功率曲线是简化的。把服务器功率当成利用率的线性函数,会高估或低估合并任务后的节电量,这些功率、利用率和电价数据从哪里来,可以对照绿色游戏大模型到底需要读什么检查。
  • 数据是旧的。模拟用的碳强度或电价延迟了几个小时,得出的“低碳窗口”可能已经错过。
  • 没有建模的依赖。某个看似可延迟的任务,实际上被上游的赛事数据结算依赖。

因此模拟层的输出不应该只有“通过/不通过”,而应该给出通过的余量,以及哪些假设对结果最敏感。余量很薄的提案,即使模拟通过,也应该降级为人工审批。

模拟示例说明:假设孪生模拟得到某提案的延迟余量只有很小的一点,且对“重连比例”这个参数极其敏感。此时系统不应输出“可以执行”,而应输出“对重连比例敏感,需人工确认”。这里没有使用任何真实数据,仅用于说明结果的呈现方式。

第三层:执行也要分级放权

即使模拟通过,九游会的设计取向也不是一律自动执行,而是按动作的风险和可逆性分级。下面是一个示意性的分级思路,具体阈值要由各运营团队按自己的SLA和风险承受度来定。

  1. 只读与报告类:生成日报、异常提示、碳排估算,自动执行,无需审批。
  2. 可撤销、非实时的动作:把日志分析、资产处理、补丁构建、AI推理批处理这类可延迟任务移到低碳窗口,可以在规则范围内自动执行,并保留撤销。
  3. 影响实时服务的动作:缩容、合并实例、区域迁移,需要模拟通过并获得人工确认;确认后也应分批灰度,每批之后重新观测。
  4. 高风险动作:关闭热备、修改网络路由、变更冷却系统设定,默认不由AI自动执行,只给出建议。

灰度的意义在于让现实去检验孪生。先动5%或一个小区域,观察延迟、错误率、功率是否与孪生预测一致;偏差超过阈值就停下,并把这次偏差作为孪生的校准数据。这里的“5%”只是举例,不是推荐值。

安全边界:AI再聪明也不能越过的东西

基础设施AI的核心问题不是能不能做出优化,而是它出错时能造成多大的伤害。有一个较早公开的数据中心制冷AI案例,其思路可供参考:AI给出的动作先在云端对照运营人员定义的安全约束,下发到现场后,本地控制系统再用自己的约束校验一次,运营人员可以随时退出AI控制。两层校验、人能随时接管,是这类系统能上生产的前提。

结合游戏运营的场景,九游会的设计里至少要有这些边界:

  • 硬约束:延迟上限、最低热备数量、单区域最大缩容比例,写成规则,AI不能修改,优化器只能在其内求解。
  • 动作白名单:AI可调用的操作是有限集合,不能拼接出任意命令。
  • 速率限制:单位时间内允许的动作数量和幅度有上限,防止一个错误被快速放大。
  • 一键回退:每次动作记录变更前的状态,出现异常可以整体撤销。
  • 审计与复盘:提案、模拟结果、审批人、执行结果全部留存,出问题时能还原当时为什么这样决定。
  • 退出开关:运营团队可以随时关闭自动执行,回到纯建议模式。

这条路径对节能与减碳意味着什么

三层架构会让某些看上去“更省”的动作被否掉,这是有意的。节省的电量如果换来了玩家延迟上升,得不偿失;把任务挪到低碳时段如果压垮了另一个区域,同样得不偿失。模拟层也要区分节能与减碳:一个动作少用了电,但用电时段电网碳强度更高,孪生要能同时给出kWh和gCO2两个结果,而不是只报省了多少度电。这一点与游戏数据中心为什么不能只追求最低PUE里的多目标权衡是同一条思路。

近期也有研究把算力调度、电力调度和碳排放放在同一个优化模型里联合求解,例如2026年5月 arXiv 上一篇作者来自多家机构的论文,就把训练任务、可弹性路由的推理负载、本地发电与电池储能和碳预算一起建模。需要注意它使用的是合成实例,不能当作真实数据中心的实测节能结论;对九游会来说,它的参考意义是“联合考虑”的方向,而具体数字必须在自己的孪生和灰度里验证,相关观察见算力、网络和电力开始一起优化

目前做不到的事

数字孪生不能预测从未出现过的事件,比如某个上游服务的突发故障;不能替代运营人员对赛事期间“宁可多耗电也要稳”的判断;也不能保证长期不漂移,服务器换代、游戏版本变化之后,孪生必须重新校准。九游会大模型在这件事上的定位,是把“AI能不能自动管理”换成更实际的问法:哪些动作可以自动、在什么条件下自动、出错时怎么收场。把这三个问题的答案写成规则并持续修订,比追求一个全自动的数据中心更可靠。