1. 分母必须是“有效产出”
同一套硬件在不同模型、精度、并行策略、数据管道和网络拓扑下,实际完成任务的速度可能不同。因此评估不能只用标称 FLOPS 或 GPU 数量。更可靠的分母可以是完成的训练步数、合格推理请求、达到目标质量的模型版本、单位时间交付的作业,或者符合 SLA 的有效 token。
单位有效算力成本 = 期间总成本 ÷ 满足质量与 SLA 的实际计算产出“有效”意味着结果、时延、可靠性和质量门槛同时满足。
2. TCO 至少拆成六层
| 成本层 | 需要计入 | 容易遗漏 |
|---|---|---|
| 计算设备 | 加速器、CPU、内存、存储、网络 | 备件、故障替换和技术代际贬值 |
| 设施与冷却 | 配电、机柜、液冷、制冷、水系统 | 改造停机、调试、冗余和水质维护 |
| 能源 | 电量、电价、需量、损耗和时段差异 | 并网等待、容量费和局部电力约束 |
| 软件与平台 | 调度、编译、监控、许可证和数据管道 | 性能移植、模型重构和工具锁定 |
| 运营 | 人员、备件、现场服务和安全合规 | 跨团队协调、培训和事故恢复 |
| 资本与风险 | 资金成本、残值、建设周期和利用率风险 | 提前采购后的闲置与延迟上线的机会成本 |
3. 利用率是成本放大器
固定资产在低利用率下会把折旧和资本成本摊到更少的有效任务上;但追求表面满载也可能增加排队、尾延迟和故障传播。需要区分设备利用率、集群可调度率、作业有效运行率和业务交付率。被通信、数据等待或检查点占用的设备时间,不应与完成有效计算等价。
容量规划应同时看平均负载、峰值、任务可延迟性和服务等级。可中断训练、实时推理和关键科研作业对冗余与排队的容忍度不同,不能用同一个目标利用率管理。
4. 能源和冷却会改变计算边际成本
当项目受变电容量、制冷能力、机柜功率或水资源约束时,新增一台服务器的成本不只是设备价格,还包括释放或扩建基础设施容量的成本。液冷可能提高可部署密度并降低部分风机或机械制冷负担,但也会增加 CDU、管路、调试和运维体系投入。正确比较需要把“可交付容量”纳入,而不是只比较设备能效比。
IEA 对 AI 与能源的分析强调,数据中心电力需求的局部集中会放大并网和供给约束。对项目而言,交付时间可能与单位电价同样重要:更便宜但迟迟无法获得容量的地点,可能产生更高机会成本。
5. 一个可执行的评估顺序
- 定义工作负载、质量门槛、SLA 和有效产出单位。
- 建立设备、设施、能源、软件、运营和资本成本表。
- 用真实或保守的利用率、故障率和交付周期构造基准情景。
- 对电价、利用率、建设延期、设备降价和残值做敏感性分析。
- 单独列出不可量化但可能改变结论的约束与锁定风险。
- 上线后用实际任务和账单回填,持续校准模型。