医疗健康研究(脑健康研究)

TReNDS 中心借助 Amazon Bedrock 自动化生产环境错误根因分析

收录时间:2026年8月15日查看来源

问题

TReNDS 中心在 AWS 上运行多项应用,随着应用增长,需要调查的错误量激增。工程师需要手动打开 CloudWatch Logs、阅读堆栈跟踪、查找源文件并追踪执行路径;简单错误通常需要 15-30 分钟,复杂跨服务问题耗时更长。团队希望自动化事件响应中最耗时的部分:根因调查本身。

解决方案

TReNDS 构建了一套生产系统,结合 Amazon CloudWatch 订阅过滤器、AWS Lambda、Strands Agents SDK 和 Amazon Bedrock。CloudWatch 订阅过滤器实时检测 ERROR、Exception 等错误级别模式并触发 Lambda,Lambda 运行由 Amazon Bedrock 驱动的 Strands Agent,自动从同一日志流获取上下文、从 GitHub 获取源代码,通过工具调用推理根因,生成包含严重级别、根因解释、相关代码上下文、建议修复和受影响区域的结构化分析,并通过 Amazon SNS 发送给团队。系统使用 Anthropic Claude Sonnet 作为主要模型,并利用 DynamoDB 对重复错误去重。

结果

部署该系统后,错误调查时间从 15-30 分钟降至 60 秒以下。分析结果包含建议修复,工程师可直接实施修复而无需先诊断。运行成本可忽略不计,每次分析仅产生少量 Amazon Bedrock 推理费用(典型为 2-3 轮工具调用)。开发人员反馈积极,分析为不熟悉的错误提供了清晰的解决起点。

成本

成本信息待确认。

案例分析

使用场景:使用 Amazon Bedrock 和 Strands Agents SDK 自动化生产环境错误的根因分析

实施证据:原文明确说明该系统已在 TReNDS 生产环境使用('we built and use in production at TReNDS'),并描述了部署后的实际效果:调查时间从 15-30 分钟降至 60 秒以下,分析结果通过 SNS 发送至团队邮箱和 Slack。

指标:调查时间从 15-30 分钟降至 60 秒以下;每次分析成本可忽略不计,典型涉及 2-3 轮工具调用;使用 DynamoDB 去重,仅首次出现触发分析

经验:基于代理的 AI 可以自动化事件响应中最耗时的根因调查环节,模型不只是总结错误,而是通过工具主动调查。;工具定义(Python @tool 装饰器)和系统提示词决定了代理的能力与输出格式,docstring 和类型提示对模型调用工具至关重要。;模型选择需要评估推理质量、工具使用可靠性、延迟和成本;Claude Sonnet 在多文件推理和细微代码问题处理上表现最佳。;通过单行代码更改即可切换 Amazon Bedrock 模型,方便根据成本或延迟要求进行多模型策略优化。;使用 DynamoDB 去重可避免同一代码路径重复错误触发多余分析和成本。