bupt.ai

AI for Energy

AI 驱动的数据中心能效管理

AI 可以用于负载预测、设定值优化、异常检测和设备健康评估,但生产系统的核心不是模型精度排行榜,而是能否在明确边界内稳定节能、解释变化并在异常时安全回退。

1. 先做可观测性,再做智能控制

模型无法修复缺失的测点、漂移的传感器和不一致的时间戳。项目应先完成测点字典、单位、采样频率、校准记录、缺失值规则和数据责任人。IT 负载、机柜功率、供回风与供回水、流量、压差、设备功率、阀位、告警和天气数据需要在统一时间轴上对齐。

如果系统无法回答“控制动作发生后,哪些变量改变了”,就不具备闭环优化条件。此时更适合先做监测、诊断和建议模式。

2. 四级成熟度路线

阶段输出风险进入下一阶段的门槛
监测趋势、能效分解、数据质量告警测点闭合、时间同步、指标可复算
预测负载、温度、能耗和故障风险预测中低跨季节验证、置信区间和漂移监测
建议设定值或调度建议,由人工确认反事实基线、收益稳定、操作员可解释
闭环控制在约束内自动调整设备和负载安全护栏、回退、联锁、演练和持续审计

3. 目标函数必须包含可靠性

只最小化能耗会诱导系统贴近温度、压差或容量边界运行。生产目标函数至少需要包括能源成本、设备效率、温度与湿度约束、冗余、SLA、动作频率和设备寿命影响。硬约束应由确定性的安全层执行,不应完全交给学习模型。

优化目标 = 能源/成本收益 − 风险罚项 − 频繁动作与设备损耗温度、压差、联锁和冗余等安全边界应独立于模型保留。

4. 如何证明节能来自模型

需要建立反事实:如果没有模型,同一负载和天气下系统会消耗多少能源。可采用规则基线、物理模型、匹配日、分区 A/B、交叉时段或受控回退。报告结果时同时给出节能量、置信区间、舒适/热安全约束、告警变化和人工干预次数。

短期试验还需防止“季节红利”和“负载红利”。模型上线恰逢气温下降或业务负载降低,可能看似节能;归一化和对照组用于分离这些影响。

5. 持续验证与治理

  • 上线前做离线回放、极端工况、传感器故障和通信中断测试。
  • 上线初期使用建议模式或受限动作范围,逐步扩大权限。
  • 跟踪输入漂移、预测残差、节能收益、约束触发和回退次数。
  • 模型、特征、控制参数和审批记录都需要版本化,可重放。
  • 保留人工接管、固定规则和安全联锁,定期演练失效场景。

NIST AI RMF 将治理、映射、测量和管理作为持续过程,并强调部署前与运行中的测试、验证和监测。用于关键基础设施时,这种闭环治理比单次模型验收更重要。

参考与延伸阅读