1. 先做可观测性,再做智能控制
模型无法修复缺失的测点、漂移的传感器和不一致的时间戳。项目应先完成测点字典、单位、采样频率、校准记录、缺失值规则和数据责任人。IT 负载、机柜功率、供回风与供回水、流量、压差、设备功率、阀位、告警和天气数据需要在统一时间轴上对齐。
如果系统无法回答“控制动作发生后,哪些变量改变了”,就不具备闭环优化条件。此时更适合先做监测、诊断和建议模式。
2. 四级成熟度路线
| 阶段 | 输出 | 风险 | 进入下一阶段的门槛 |
|---|---|---|---|
| 监测 | 趋势、能效分解、数据质量告警 | 低 | 测点闭合、时间同步、指标可复算 |
| 预测 | 负载、温度、能耗和故障风险预测 | 中低 | 跨季节验证、置信区间和漂移监测 |
| 建议 | 设定值或调度建议,由人工确认 | 中 | 反事实基线、收益稳定、操作员可解释 |
| 闭环控制 | 在约束内自动调整设备和负载 | 高 | 安全护栏、回退、联锁、演练和持续审计 |
3. 目标函数必须包含可靠性
只最小化能耗会诱导系统贴近温度、压差或容量边界运行。生产目标函数至少需要包括能源成本、设备效率、温度与湿度约束、冗余、SLA、动作频率和设备寿命影响。硬约束应由确定性的安全层执行,不应完全交给学习模型。
优化目标 = 能源/成本收益 − 风险罚项 − 频繁动作与设备损耗温度、压差、联锁和冗余等安全边界应独立于模型保留。
4. 如何证明节能来自模型
需要建立反事实:如果没有模型,同一负载和天气下系统会消耗多少能源。可采用规则基线、物理模型、匹配日、分区 A/B、交叉时段或受控回退。报告结果时同时给出节能量、置信区间、舒适/热安全约束、告警变化和人工干预次数。
短期试验还需防止“季节红利”和“负载红利”。模型上线恰逢气温下降或业务负载降低,可能看似节能;归一化和对照组用于分离这些影响。
5. 持续验证与治理
- 上线前做离线回放、极端工况、传感器故障和通信中断测试。
- 上线初期使用建议模式或受限动作范围,逐步扩大权限。
- 跟踪输入漂移、预测残差、节能收益、约束触发和回退次数。
- 模型、特征、控制参数和审批记录都需要版本化,可重放。
- 保留人工接管、固定规则和安全联锁,定期演练失效场景。
NIST AI RMF 将治理、映射、测量和管理作为持续过程,并强调部署前与运行中的测试、验证和监测。用于关键基础设施时,这种闭环治理比单次模型验收更重要。