英文原标题:How BMW Group detects cost anomalies across 14,000 cloud accounts

本文为英文原文的机器翻译摘要,原文见:AWS Machine Learning Blog ↗

  • BMW Group 与 Data Reply 合作构建了内部 FinOps 系统 CLEA,基于 AWS 监控超过 14,000 个云账户,最初以 Amazon Quick Sight 仪表板形式提供云支出可见性。
  • CLEA 现在每天运行异常检测,当支出偏离预期模式时向账户所有者发送邮件告警,弥补了仪表板只能被动查看历史数据的不足。
  • CLEA 使用 Meta 的开源预测库 Prophet 为每个账户-服务对构建成本基线,基于 365 天历史数据训练,采用加法季节性模型。
  • 每日运行由 AWS Step Functions 编排,通过 Distributed Map 并发调用最多 500 个 Lambda 函数,完整处理 14,000 个账户约需 20 分钟,每月计算成本约 50 美元。
  • 告警需通过多层过滤:通用阈值(偏差至少 40% 且满足账户集群最低美元影响)、服务特定阈值(如 AWS Glue、Athena、EC2 采用 60% 偏差阈值)以及账户特定覆盖(降低敏感度列表需超过标准阈值三倍)。

关键数据

  • 监控超过 14,000 个云账户
  • 每月原始数据约 30 亿行、500 列
  • 数据存在一天延迟(T-1)
  • 完整运行约 20 分钟
  • 每月计算成本约 50 美元
  • 偏差阈值至少 40%
  • 账户集群最低影响:集群1(<10万美元)>300美元;集群2(10万-25万美元)>500美元;集群3(25万-50万美元)>750美元;集群4(>50万美元)>1,000美元
  • 服务特定阈值:AWS Glue、Athena、EC2 采用 60% 偏差阈值
  • 账户特定覆盖:降低敏感度列表需超过标准阈值三倍
  • 低支出服务排除:过去3天平均低于0.10美元
  • 历史不足排除:少于10天历史

为什么值得看:该案例展示了大规模云成本异常检测的工程实践,包括预测基线、多层过滤和成本效益,为 FinOps 自动化提供了可参考的架构。

站内导航