未分类

AWS 团队使用 Amazon Bedrock 构建仪表板内容故障自动检测系统

收录时间:2026年9月4日查看来源

问题

业务智能仪表板的内容故障(空白图表、陈旧数据、错误数值)具有静默性,基础设施监控无法发现,用户报告率不足 1%,且错误数值可能传播到基于数据的 AI 叙事系统,影响决策。

解决方案

构建了五阶段无服务器验证架构,结合两种并行 AI 验证机制:视觉完整性验证使用 Amazon Bedrock 上的 Claude 模型分析截图,识别空白瓦片、错误状态和缺失可视化,并进行上下文推理区分合法空态与故障;数值一致性验证使用 LLM 提取指标值,由确定性代码进行单位归一化和精度比较,确保数值判断精确。截图先通过 Amazon Rekognition 进行脱敏,警报通过 Slack 和工单路由到负责人。

结果

在生产环境运行 30 天,执行 153,000 次自动化内容检查,检测到 802 个内容故障(0.52%),系统内容可用性达 99.48%;平均故障发现时间从最多 72 小时缩短至不到 1 小时。数值验证机制已运行超过 6 个月,每周验证 50-70 个数据点,未发生绕过人工审查的错误批准。

成本

成本信息待确认。

案例分析

使用场景:通过 Amazon Bedrock 驱动的自动化内容验证系统,监控数百个 BI 仪表板,检测空白、错误状态和跨仪表板数值不一致的内容故障。

实施证据:原文中明确说明该解决方案已在 AWS Insights 应用的生产环境中运行:‘With this solution, the BI and analytics team can fix issues before users see them’,并提供了 30 天生产运行数据(153,000 次检查、802 个故障、MTTD 从 72 小时降至 1 小时以下),数值验证机制已运行超过 6 个月。

指标:30 天内执行 153,000 次自动化内容检查;检测到 802 个内容故障,占检查总数 0.52%;系统内容可用性 99.48%;平均故障发现时间从最多 72 小时缩短至不到 1 小时;数值验证机制已运行超过 6 个月,每周验证 50-70 个数据点

经验:设计防误报优先:优先考虑上下文推理而非原始速度,准确性比实时性更重要。;让 LLM 远离算术:数值比较应由确定性代码处理,以保证精度和一致性。;混合验证模式:AI 负责语义理解(查看、阅读、导航),确定性代码负责精确判断。;内容层监控需要全面覆盖,而不是抽查,因为故障分布广泛。;截图脱敏处理可降低敏感数据保留风险,并约束模型输出为结构化判定。