宝马集团如何在14,000个云账户中检测成本异常
问题
宝马集团运营超过 14,000 个云账户,成本异常难以发现。原有仪表盘只能被动展示已发生费用,且需要用户主动打开查看,无法及时预警异常支出。
解决方案
宝马集团与 Data Reply 合作构建了内部 FinOps 系统 CLEA,基于 AWS 无服务器架构和 Prophet 预测模型。系统每日摄取 AWS Cost and Usage Reports 及其他云厂商账单数据,聚合成每账户每服务的每日成本时间序列,使用 Prophet 基于 365 天历史进行预测。通过 AWS Step Functions 分布式编排,并发最高 500 个 Lambda 函数,对全部账户进行预测和异常检测。检测结果经过分层过滤(低支出排除、偏差阈值、账户集群最低影响金额、服务特定阈值、账户特定覆盖)后,向账户所有者发送告警邮件,并提供 Amazon QuickSight 自助根因分析仪表盘。
结果
CLEA 已在生产环境每日运行,监控超过 14,000 个云账户。全量预测和检测流程约 20 分钟完成,月计算成本约 50 美元,折合每账户每月不到 0.5 美分。异常告警自动触达账户所有者,无需人工主动查看仪表盘。通过分层过滤,大幅减少误报,将原始检测结果收敛为值得关注的异常。
成本
成本信息待确认。
案例分析
使用场景:云成本管理与 FinOps 成本异常检测
实施证据:材料显示宝马集团运营的 CLEA 系统已在生产环境每日运行,监控超过 14,000 个云账户,全流程约 20 分钟完成,月计算成本约 50 美元,并自动发送告警邮件给账户所有者。博客中给出了具体架构图、运行时间、成本和告警邮件示例,证明系统已实际部署。
指标:监控超过 14,000 个云账户;每月处理约 30 亿行、500 列账单数据;预测基于 365 天历史数据,使用 Prophet 加性季节性模型;全流程运行时间约 20 分钟;月计算成本约 50 美元;每账户每月成本不到 0.5 美分;最大并发 Lambda 函数 500 个;低支出服务排除标准:过去 3 天平均低于 $0.10;排除历史不足 10 天的服务;标准偏差阈值为 40%,高波动服务(AWS Glue、Amazon Athena、Amazon EC2)阈值提升至 60%;账户集群最低影响金额:$300、$500、$750、$1000,分别对应不同月均支出集群;降敏账户需超过标准阈值三倍才触发告警
经验:分层过滤是减少误报的关键:先通过置信区间和偏差阈值过滤,再结合账户集群最低影响金额、服务特定阈值和账户特定覆盖,将原始检测大幅收敛。;预测模型会逐渐吸收持续性的成本阶跃,因此检测对尖峰最有效,对渐进式增长不敏感。;系统无法判断成本增加是否为计划内行为,仍需账户所有者反馈来人工校准阈值,自动化与人工判断的边界必须保留。;将预测模块设计为可插拔,便于未来替换新模型而不影响下游检测和告警层。;用户反馈驱动阈值持续调优,例如高风险误报服务提高偏差阈值,高波动账户设置降敏列表。
