Evidence library

AI案例

从真实场景中观察AI如何解决问题、投入多少、产生什么结果,并提炼可复用的商业判断。

API 已连接

37 条记录

出行与本地生活服务

DiDi 基于 Amazon Bedrock 构建智能客服质检系统

问题

原有第三方质检解决方案不透明,QA判定缺乏可追溯性,服务场景组合复杂导致规则维护成本高,响应质检标准变更缓慢,且缺乏主动趋势发现能力,无法及时识别高频问题。

方案

与 AWS 合作,基于 Amazon Bedrock 构建自有的智能质检系统,包含意图验证、合规评估和客户之声(VOC)分析三条核心流水线。系统通过精确上下文管理,采用信息隔离、动态提示组装和多阶段处理等方式,提升质检准确性和效率,并利用 Amazon Bedrock Guardrails 实现负责任 AI 控制。

结果

系统在生产验证中实现意图验证准确率从38%提升至86%,合规评分准确率超过90%,VOC分析将数小时的人工总结工作压缩至几分钟,实现了质检判定全透明。

灾难恢复与数据保护

HPE Zerto 基于 Amazon Bedrock 构建智能体故障排除系统

问题

数据保护和灾难恢复团队面临环境规模扩大、信息碎片化、手动收集上下文耗时、经验不足管理员难以解读症状、缺乏快速风险摘要等问题,导致故障解决延迟。

方案

HPE Zerto 使用 Amazon Bedrock 构建了一个多智能体故障排除系统,嵌入现有 Zerto UI,本地部署,通过 Strands Agents 框架和 MCP 服务器访问实时环境数据,结合 Amazon Bedrock Guardrails 和 Knowledge Bases,提供自然语言交互和可操作的上下文答案。

结果

自2026年Q2发布以来,超过20%的HPE Zerto客户采用该系统;在生产使用中,支持案例减少10%;帮助用户更快排查问题、识别根因、提高运营效率。

金融科技

Heurist Finance 基于 Amazon Bedrock AgentCore 构建 AI 原生投资工作台

问题

散户投资者需要基于付费市场、宏观经济、基本面和另类数据的研究,但这些数据分散在付费墙和定制 API 后,企业合同在用户规模不足时难以合理化。按查询购买数据虽经济,但需要代用户进行支付并满足保管、限额、审计要求,涉及身份持久化、跨会话状态、隔离代码执行、支付编排和端到端追踪,自建基础设施需数月。

方案

Heurist 在 Amazon Bedrock AgentCore 上部署代理,使用 Strands 编排和 Anthropic Claude,利用 AgentCore Identity、Memory、Code Interpreter、Observability 和 payments 等服务。通过 x402 协议和 USDC 在 Base 区块链上进行按查询付费,支付凭据保存在 AWS Secrets Manager;AgentCore Code Interpreter 提供无网络出口的隔离沙箱;AgentCore Memory 存储用户偏好和对话历史;Amazon Bedrock Guardrails 过滤输入输出;分析产物存储于 Amazon S3,追踪发送至 CloudWatch。

结果

Heurist 估计相比自建 LLM 编排栈减少了约 80% 的代理系统工程,获得可预测的每用户边际成本以支持零售定价。AgentCore Observability 使代理决策可重现,提高合规准备度并减少故障排除时间。创始人 JW Wang 表示:“AgentCore 负责平台工作,让我们能加倍投入产品工作。托管基础设施节省了我们数月时间。”

受监管行业(银行、航空、保险、制造、政府机构)

DXC Technology将Anthropic Claude集成至受监管行业系统:从内部验证到规模化部署

问题

银行、航空、保险、制造和政府机构等受监管行业依赖的核心系统具有严格的安全和合规要求,需要可信赖的AI能力来提升运营效率并加速现代化,同时不能违反合规约束。

方案

DXC与Anthropic建立多年全球联盟,将Claude集成到DXC运营的系统和客户环境中。DXC首先在内部使用Claude构建OASIS平台,验证其能力;随后培训数千名Claude认证的前向部署工程师,并基于Anthropic Academy增加针对任务关键型系统的自有课程,从保险、现代化即服务、网络安全和应用服务四个领域开始向客户推广。

结果

DXC使用Claude构建OASIS平台,超过95%的代码由Claude生成并经过工程师审查;Claude成为OASIS平台代理工作流的默认基础模型;DXC估计Claude将软件开发速度提高了10倍;OASIS平台目前服务超过50家DXC客户。

政府/公共部门

马里兰州与Anthropic合作部署Claude改善政府服务

问题

马里兰州需要提高政府运营效率,帮助居民更便捷地申请福利,并减轻案件工作人员每月人工处理超过150,000份文件的工作负担。

方案

马里兰州与Anthropic合作,在多个州机构部署Claude,包括开发Claude驱动的虚拟助手帮助居民申请SNAP、Medicaid、临时现金援助和WIC等福利,并识别其他可能符合资格的项目;案件工作人员使用Claude验证文件、资格和复杂政策指导;探索面向早期职业专业人士的AI技能提升试点;与州长创新团队合作开发工具识别社区未满足需求。此前,马里兰州已于2025年6月推出双语Claude聊天机器人,服务超过600,000名SUN Bucks福利领取者。

结果

2025年6月上线的双语Claude聊天机器人已服务超过600,000名SUN Bucks福利领取者,并减少呼叫中心话务量。新合作中的各项举措已宣布但尚未提供具体实施结果。

金融科技/商业软件

Intuit 基于 Amazon Bedrock 构建代理式容灾助手 EWOK Agent

问题

大规模容灾中,选择恢复工作流、确认资产就绪以及处理恢复中的异常(如变更冻结窗口)依赖经验丰富的值班工程师的隐性知识;现有集中式系统 EWOK 解决了执行问题,但未解决决策问题。

方案

构建 EWOK Agent:将故障转移知识编码为类型化技能(YAML 模式 + 提示词体),通过 Amazon Bedrock 的 Converse API 和工具调用机制,让基础模型选择技能并生成结构化工具调用,然后由确定性执行层 EWOK 的 API 执行实际故障转移;模型不直接持有凭证,所有状态变更均通过受审计的代码完成。

结果

该模式已在 Intuit 内部使用约八个月;工程师角色从手动编排者转变为人机协同监督者;故障转移决策一致化,策略合规(如变更冻结窗口)自动执行;具体量化收益(如成功率或额外节省时间)未在原文提供。

未分类

t54 基于 Amazon Bedrock AgentCore payments 构建信任层治理代理自主支付

问题

代理系统需要自主支付第三方服务,但直接给代理钱包存在风险:缺乏消费限制、凭据暴露、无法审计,以及可能支付给不可信端点。人工审批无法跟上机器速度。

方案

t54 构建了 x402-secure 信任层,与 Amazon Bedrock AgentCore payments 集成。x402-secure 提供实时端点评分(Trustline),在支付前进行确定性信任门控。Amazon Bedrock AgentCore payments 提供会话级消费限额、凭据隔离和支付执行。通过 IAM 角色分离确保代理不能修改自身限额或访问凭据。

结果

自发布以来,x402-secure 已处理超过 2000 万笔 AI 代理发起的交易,无需任何人工审批。每笔为 0.001 至 0.01 美元的微支付。系统成功阻止了高风险端点的支付。

IT 服务与管理软件

Jamf 实战:Amazon Bedrock 实时支出强制与 AI 成本治理

问题

生成式 AI 支出与行为挂钩,缺乏按用户可见性和成本问责;在扩大 AI 访问前,领导层需要知道每人花费、能否限制以及 ROI。

方案

Jamf 构建了基于 Amazon Bedrock 调用日志、Amazon Athena 成本视图、AWS Lambda 定时执行和 IAM 客户托管策略的系统,按工程师每日预算实施分层模型限制,并在接近预算时通过 Slack 通知。

结果

实现按用户成本可见性,限制在几分钟内生效且无需重新认证,每日自动重置;保持低成本模型可用,避免中断工作;治理反而加速了 AI 采用。

教育 / 特殊教育

Trinity:基于智能体 AI 的残障学生过渡规划

问题

在规模化过程中,单一模型难以承载完整工作流,通用推荐不满足残障学生需求,合规与数据保护要求严格。

方案

在 AWS 上构建分层六智能体架构,采用 Amazon Bedrock、Lambda、DynamoDB 等服务,实现对话式个性化过渡规划和合规控制。

结果

Trinity 已覆盖美国十余个州,提升了学生自主性和教育者效率,并将 IEP 规划过程缩短到 10 分钟以内。

未分类

AWS 团队使用 Amazon Bedrock 构建仪表板内容故障自动检测系统

问题

业务智能仪表板的内容故障(空白图表、陈旧数据、错误数值)具有静默性,基础设施监控无法发现,用户报告率不足 1%,且错误数值可能传播到基于数据的 AI 叙事系统,影响决策。

方案

构建了五阶段无服务器验证架构,结合两种并行 AI 验证机制:视觉完整性验证使用 Amazon Bedrock 上的 Claude 模型分析截图,识别空白瓦片、错误状态和缺失可视化,并进行上下文推理区分合法空态与故障;数值一致性验证使用 LLM 提取指标值,由确定性代码进行单位归一化和精度比较,确保数值判断精确。截图先通过 Amazon Rekognition 进行脱敏,警报通过 Slack 和工单路由到负责人。

结果

在生产环境运行 30 天,执行 153,000 次自动化内容检查,检测到 802 个内容故障(0.52%),系统内容可用性达 99.48%;平均故障发现时间从最多 72 小时缩短至不到 1 小时。数值验证机制已运行超过 6 个月,每周验证 50-70 个数据点,未发生绕过人工审查的错误批准。

医疗健康与诊断

Natera 基于 Amazon Bedrock AgentCore 的智能语音预约调度案例

问题

Natera 希望改变患者体验,替代人工预约电话;原有系统使用第三方 AI 提供商进行语音交互和编排,存在准确性、可扩展性和对话参与度方面的改进空间。移动采血预约流程要求患者致电、完成身份验证、提供三个偏好日期和服务地点,再由人工团队协调确认,涉及复杂认证和多供应商系统集成。

方案

Natera 基于 Amazon Bedrock AgentCore 构建了自动化语音代理,允许患者通过对话预约移动采血服务。架构采用三大核心原则:双 WebSocket 桥接模式(分离电话流与模型推理)、事件驱动延迟掩蔽(并行生成上下文填充响应以掩盖后端延迟)、渐进信任模型(中期对话认证与内存会话转移)。团队将工作负载从 Amazon ECS 迁移到 AgentCore 完全托管的 serverless 运行时,集成 Twilio 进行电话连接、Amazon Bedrock 进行模型推理与知识库 RAG、AgentCore memory 进行跨会话持久化,并使用 Amazon Bedrock Guardrails 实现合规与安全控制。

结果

验证阶段在 500 次端到端呼叫模拟中实现 100% 工具调用准确率,感知延迟中位数 6.8 秒,每次完成通话成本低于 0.01 美元。系统已投入生产用于入站移动采血预约调度,生产四周期内共处理 4,744 通电话,比之前系统增加 5.5%;短呼叫率从 22% 降至 12%;NPS 反馈响应率从 1.09% 提升至 1.60%,上升 47%;验证完成率从 64% 略升至 66%,平均通话时长从 79 秒增至 101 秒。

域名注册与网络托管

GoDaddy如何借助Amazon Quick实现分析转型

问题

遗留BI工具下,GoDaddy面临仪表板数量庞大(5,000多个)、渲染时间超过15分钟、基础设施成本上升、集中式BI团队需求超载,难以实现大规模自助分析。

方案

GoDaddy于2023年决定迁移到Amazon Quick(原Quick Sight)。采用Amazon Redshift作为主要数据连接层,通过Okta单点登录,实施嵌入式分析,部署七个自定义聊天代理,并利用Quick Flows自动化每周业务回顾等工作流。同时建立治理框架,减少仪表板冗余。

结果

迁移后,仪表板数量从5,000多个减少到不到2,500个,渲染时间从15分钟以上降至5秒以内,每年节省超过15,000小时。截至2025年底,有4,298个活跃用户,包括828个作者和3,128个读者。数据驱动决策从分析师专属转变为组织常态。

医疗健康

在 Amazon EC2 上使用 NVIDIA MPS 将 ASR 推理基础设施成本降低 75%

问题

单个 ASR 推理请求仅使用 GPU 15-20% 计算容量,默认 CUDA 时间切片导致约 80% 硬件空闲;Heidi Health 为维持亚秒级转录延迟在高峰流量下需要运行 16 个 GPU 实例。

方案

使用 NVIDIA CUDA Multi-Process Service(MPS)实现 GPU 并发执行,结合 NVIDIA Triton Inference Server 动态批处理和 ONNX Runtime/TensorRT 模型优化,在 Amazon EC2 g6e.4xlarge/g7e.4xlarge 实例上部署 FastAPI 网关 + Triton + MPS daemon 三层推理管道,通过并发分区提高 GPU 利用率。

结果

基础设施需求降低 75%(从 16 个 GPU 实例降至 4 个),在 g7e.4xlarge 上每 GPU 达到 92.1 RPS,平均延迟 352ms,p99 769ms;采用 TensorRT+ONNX+MPS 进一步降低 88%(至 2 个 GPU)。

生命科学研究

科学家利用 Claude 构建通用生物医学代理 Biomni 加速科研发现

问题

生物研究中的工具碎片化:存在数百种数据库、软件包和协议,研究人员需花费大量时间选择与掌握不同平台,导致实验和分析效率低下。

方案

斯坦福大学开发基于 Claude 的 Biomni 平台,将数百种工具、软件包和数据集集成到单一系统中,使研究人员能用自然语言交互,自动执行复杂的生物信息学分析任务。

结果

Biomni 在多个案例研究中验证有效:基因组范围关联分析(GWAS)从通常数月缩短至20分钟;盲评显示其设计的分子克隆实验与五年以上经验博士后水平相当;分析450+可穿戴设备数据文件仅35分钟(人类专家预计3周);分析336,000+单细胞数据发现新转录因子;通过编码专家知识提升罕见病诊断性能。

体育用品零售

迪卡侬使用Chronos-2在AWS上实现大规模需求预测

问题

迪卡侬需要为全球数万种产品进行周度销售预测,涵盖12周补货和52周战略规划。原有方法(DeepAR、Holt-Winters、TFT)需要每周重新训练,扩展新区域需约6个月且工程复杂度高,运营开销大,且预测精度有待提升。

方案

迪卡侬评估多个时间序列基础模型后选择Chronos-2,利用AutoGluon集成进行LoRA微调,在AWS EC2上部署每周批量推理,每6个月微调一次模型。架构包括PySpark数据准备、MLflow模型注册、Airflow编排和Databricks任务触发。

结果

在东南亚和拉丁美洲供应区投入生产后,12周预测WAPE分别降低11和15个百分点,52周WAPE分别降低6和9个百分点。新区域部署时间从约6个月缩短至2-3个月,推理时间从10-15分钟降低至40-75秒,微调频率从每周降至每6个月,单次推理成本约0.03美元。

航空运输与机上娱乐通信

Panasonic Avionics 利用 AWS 上的 Agentic AI 加速飞机 IFEC 诊断

问题

在数百家航空公司、数十亿乘客规模下,工程师需手动关联日志、指标和票据数据,诊断时间长达数小时,且依赖深厚的机构知识,难以规模化。

方案

与 AWS 及 AWS Generative AI Innovation Center 合作,利用 Amazon Bedrock、Amazon SageMaker、AWS Glue 等构建多智能体工作流,包括趋势分析、并行诊断代理和 LLM 总结,实现五阶段处理:摄取标准化、检测、诊断、情境化和建议行动。

结果

系统已投入生产,每日生成覆盖现役机队的诊断报告。手动分析工作量显著减少,MTTD 和 MTTR 改善,目标用例实现 20–40% 运营效率提升,重复调查负担显著降低,工程师独立诊断能力增强。

体育博彩

Fanatics Betting and Gaming 在 AWS 上构建多智能体客户支持系统

问题

FBG 在美国多州运营,各州法规不同,客户期望即时准确回复,尤其在赛事高峰时段咨询量巨大。传统决策树聊天机器人无法处理复杂性,导致客户不满和人工成本上升。

方案

采用多智能体架构,基于 Amazon EKS、Amazon Bedrock,使用编排模式,包含监督代理、RAG、MCP 工具和负责任博彩分类器,并通过 Amazon Bedrock Guardrails 保障安全。

结果

部署两个月后,包含率提升约 56%,解决率提升约 53%,已自主解决数千个案例,成本显著降低,客户满意度上升。

未分类

利用 Amazon Bedrock AgentCore 上的代理式 AI 扩展云迁移

问题

大型企业云迁移面临手动发现耗时数周、基础设施代码开发周期长(3-4周/应用)、迁移后运维被动救火等瓶颈,300多个应用组合难以按期完成。

方案

AWS Professional Services 构建了包含四个专门代理(Intake Agent、IaC Agent、Migration Intelligence and Governance Agent、SRE Agent)的多智能体编排框架,运行在 Amazon Bedrock AgentCore 上,使用 Strands Agents SDK 和 MCP 工具,覆盖迁移全生命周期,并嵌入安全控制和人工审批门。

结果

该框架将 IaC 开发时间从每个应用3-4周缩短至分钟,在300多个应用组合中保持模式一致性、自动验证安全合规、提供按需组合报告,并实现零手动聚合。

SaaS(交互式演示工具)

Slides With Friends:AI 搜索冲击下,用 AI 线索评分转向高价值销售

问题

AI 搜索变化导致依赖底部漏斗内容营销的流量和收入下降;同时产品存在年度订阅到期后的流失问题。

方案

转向更高终身价值(LTV)的销售,专注入站合格 ICP;使用 AI 对线索进行排序以确定潜在价值;并将产品定位从“玩具”转向“工具”,扩展更多商业用例。

结果

已实现月经常性收入超过 4 万美元(2024 年);在 AI 搜索影响下收入下滑后,正通过高价值销售和 AI 线索评分恢复增长。

网络安全 / SaaS

Axonius 基于 Amazon Bedrock AgentCore 构建安全多租户 AI 智能体

问题

Axonius 需要在现有 silo 模式下为大量客户添加 AI 智能体,同时满足租户隔离、身份集成、成本跟踪、服务集成、生命周期管理和可观测性等关键要求,并避免长时间定制基础设施开发。

方案

采用 Amazon Bedrock AgentCore runtime 为每个客户部署专用智能体,每个用户会话运行在独立 microVM 中;通过 ENI 连接客户 VPC、短时 JWT 与 IAM 角色标记实现身份与成本治理;结合 Bedrock Knowledge Bases、Guardrails 和 CloudWatch 等 AWS 服务;使用 VPC Lattice 实现私有网络连接,并以 CloudFormation 自动化部署。

结果

将多租户 AI 智能体的开发周期从预计 8 周缩短至 10 天,上市时间减少 75%。

身份验证与欺诈检测

Jumio 在 AWS 上构建实时特征存储:实现亚100毫秒欺诈检测延迟并节省12万美元

问题

原有特征工程分散,导致数据重复、手动生产部署风险、高延迟以及延迟事件处理困难,无法满足实时欺诈检测需求。

方案

采用流式优先架构,使用 Amazon Kinesis Data Streams 进行实时事件摄取,通过 Amazon Managed Service for Apache Flink 进行特征处理与丰富,并写入 Amazon SageMaker Feature Store。离线数据通过 Amazon Data Firehose 和 Amazon S3 以 Iceberg 格式存储,用于模型训练。架构部署在三个 AWS 区域。

结果

实现了95百分位读取延迟16.9毫秒,满足亚100毫秒的SLA要求;相比此前分散的特征存储,年运营成本节省约12万美元。

未分类

小团队如何用Agent-first工作流消耗超1000亿Claude tokens

问题

小团队没有传统部门结构,需手动协调代码、营销和分发任务,效率低且难以全天候运行。

方案

构建自动化代理系统,利用Claude API运行代码、营销和分发工作流,人类负责设定方向、提供上下文、审查输出和纠正错误。

结果

工作负载全天候运行,人类角色从执行转向审查与决策,带来灵活性,但难以完全关机,且早晨可能面临需撤销的错误实现。

医疗、法律等受监管行业的企业 SaaS

OneAdvanced 在英国主权 AWS 上部署 50 多个 AI 代理,满足数据驻留要求

问题

OneAdvanced 服务于医疗、法律等受监管行业,客户要求严格的数据驻留、安全和隐私标准。所需模型(Llama 4 Maverick 和 Llama Guard 4)当时尚无法通过英国区域的托管服务获得,因此必须自托管以保持对模型基础设施的完全控制,确保数据不离开英国。

方案

OneAdvanced 在伦敦区域(eu-west-2)使用 vLLM 在 Amazon SageMaker AI 的 p5.48xlarge 实例上自托管 Llama 4 Maverick (FP8) 和 Llama Guard 4,通过 Strands Agents SDK 构建 50 多个专用代理并部署在 Amazon ECS,配置存于 DynamoDB;RAG 管道基于 Amazon Aurora PostgreSQL 和 pgvector,文档上传至 S3 后转换为 markdown、分块(2048 token)并嵌入 intfloat/multilingual-e5-large-instruct 模型;Llama Guard 4 在主模型前串行过滤有害输入;另有无代码代理构建器供非技术用户使用。

结果

OneAdvanced 从原型到生产,三周内构建并部署了 50 多个代理,自 2025 年 7 月投入生产运行超过一年,达到目标性能指标,客户满意度 5/5,并作为英国首个面向企业的私有主权 AI 公开发布。

SEO软件 / 自动化营销工具

Distribb 借助 Google Search Console + Claude Code 发现关键词差距,48小时获得202次AI展示

问题

Distribb 的网站有一些查询获得了 Google Search Console 展示,但现有页面覆盖的主题过宽,没有针对精确搜索意图的专门内容,导致潜在 AI 展示机会未被利用。

方案

实施六步工作流:1) 将 Google Search Console 连接至 Claude Code,拉取近三个月查询、展示、点击和排名页面;2) 运行提示找出排名但无专门内容的词;3) 打开当前展示页面与查询对比,识别查询差距;4) 用 Ahrefs/DataForSEO 验证搜索量和难度,并检查是否与现有页面冲突;5) 为精确查询发布单独页面;6) 检查新 URL 表现并重复迭代。

结果

Distribb 发布的一个页面在 48 小时内于 Google 生成式 AI 功能中获得 202 次展示;'Best Automated SEO Monitoring Tools' 发布3天后开始排名;'Best AI Tools for Backlink Outreach' 9天后达到第3位并累计106次 Search Console 展示。该工作流是三个月内获得 44,000 次 AI 功能展示背后的流程之一。

自动驾驶/汽车

Mobileye 使用 Amazon Bedrock AgentCore 改造支持运营:响应时间缩短 90%

问题

随着数据采集流水线扩展,66%的支持工单成为常规状态查询。工程师处理每个查询需手动跨多个系统操作约15次点击,耗时且分散高级工程师精力;传统自动化方法(脚本、静态工作流、规则决策树)无法理解上下文和适应多样化查询模式。

方案

Mobileye 使用 Amazon Bedrock AgentCore 的 serverless 运行时部署 AI 支持代理,通过内部 LLM 网关调用 Anthropic Claude 模型,并利用 Model Context Protocol (MCP) 实时访问生产数据。架构采用混合设计:本地编排器处理内部工单系统,AgentCore 负责代理运行和内置可观测性,AWS Secrets Manager 保障无密钥安全认证。

结果

AI 支持代理在 2 分钟内无人工干预完成响应,整体成功率达 98%(超过 95% 目标),响应时间从数小时降至约 1 分钟(改进 90%),自动化处理了 66% 的工单量,每月处理超过 100 个工单,释放工程师聚焦复杂工作。Mobileye 还将其转化为内部自助式 AI 代理部署平台,使团队无需 AWS 凭证即可快速部署代理。

抵押贷款行业

LendingTree基于Amazon Bedrock构建多智能体抵押贷款助手

问题

购房者面对复杂的抵押贷款选择(如贷款类型、期限、利率)和大量专业术语,感到迷茫;监管要求严格,需要准确信息、透明指导和PII保护;传统聊天机器人仅能处理基础问题,无法回答复杂问题并提供个性化匹配。

方案

LendingTree部署了三个独立AI智能体(主管、教育、匹配),使用LangGraph进行编排,通过MCP进行智能体间通信,并由Amazon Bedrock提供Amazon Nova Pro和Nova Lite基础模型。所有智能体运行在Amazon ECS with AWS Fargate上,使用Amazon Bedrock Guardrails进行内容过滤和PII编辑,教育智能体基于Amazon Bedrock Knowledge Bases进行RAG,匹配智能体调用内部API提供个性化选项。会话状态通过LangGraph PostgreSQL检查点存储在Amazon RDS上。

结果

该助手自2025年底起在生产环境中处理真实抵押贷款对话,截至2026年Q1统计约1,960次对话和12,100条消息。用户参与度高,活跃用户平均对话持续9分钟、超过10条消息。早期75%对话为教育性质,近期超过50%涉及利率比较、贷款匹配或预审。超过97%的对话无需人工升级端到端处理,仅约3%用户明确请求人工代理。

便利零售与石油批发行业

PDI Brew:用Amazon Bedrock和Lambda将自然语言变成企业应用

问题

企业存在大量长期积压的内部工具需求(如运费计算器、简单表单、基于电子表格的仪表盘),传统交付流程需要开发者、积压排期和部署流水线,导致小工具永远被优先级低于创收功能。PDI Technologies希望能实现“意图输入,应用输出”,且默认安全合规、无服务器化、AI能力可控。

方案

PDI Technologies构建了PDI Brew平台,采用双代理架构:规划代理(可运行于AI助手中的Vibe Skill路径,或AWS边界内的Amazon Bedrock路径)捕获用户意图并生成结构化部署manifest;预置代理(基于AWS Lambda)接收manifest,确定性分类工作负载,编排AWS及Microsoft Graph资源创建。全栈应用会获得独立DynamoDB表和API Gateway;特权能力需管理员审批。内置AI通过Amazon Bedrock提供,强制Guardrail、12计数器预算及双层终止开关。安全上使用Entra ID SSO、IAM最小权限、S3公共访问阻止等。

结果

PDI Brew已扩展至服务组织内数百个应用,非开发人员可独立编写和部署应用;部署时间从过去的数周缩短至分钟级(以deploy Lambda时间戳衡量);闲置时每应用成本显著低于传统订阅工具;平台运行在自有边界内,可处理受监管和敏感数据负载,AI作为内置平台能力交付,避免了逐项目模型采购开销。

体育分析

使用约束编程自动确定NHL季后赛资格场景:AWS生成式AI创新中心案例

问题

NHL常规赛进入尾声时,确定球队是否已锁定季后赛资格非常困难。由于涉及32支球队、复杂的平局规则和数百场剩余比赛,手动生成资格场景既耗时又容易出错。

方案

AWS生成式AI创新中心构建了一个自动化系统,结合约束编程(CP)和自定义树搜索。系统包含0-day求解器和n-day前瞻求解器:0-day求解器使用Google OR-Tools CP-SAT将问题建模为可行性问题,判断球队是否已锁定季后赛;n-day前瞻求解器通过树搜索评估未来n天比赛结果对锁定资格的影响,并利用预处理、剪枝和节点排序启发式提高效率。

结果

该系统在2021-22至2024-25四个NHL常规赛季中进行了验证,生成的所有场景均与NHL官方发布完全匹配。1-day资格场景的中位运行时间约为分钟级,显著快于手动方法,剪枝效率接近100%。

医疗健康研究(脑健康研究)

TReNDS 中心借助 Amazon Bedrock 自动化生产环境错误根因分析

问题

TReNDS 中心在 AWS 上运行多项应用,随着应用增长,需要调查的错误量激增。工程师需要手动打开 CloudWatch Logs、阅读堆栈跟踪、查找源文件并追踪执行路径;简单错误通常需要 15-30 分钟,复杂跨服务问题耗时更长。团队希望自动化事件响应中最耗时的部分:根因调查本身。

方案

TReNDS 构建了一套生产系统,结合 Amazon CloudWatch 订阅过滤器、AWS Lambda、Strands Agents SDK 和 Amazon Bedrock。CloudWatch 订阅过滤器实时检测 ERROR、Exception 等错误级别模式并触发 Lambda,Lambda 运行由 Amazon Bedrock 驱动的 Strands Agent,自动从同一日志流获取上下文、从 GitHub 获取源代码,通过工具调用推理根因,生成包含严重级别、根因解释、相关代码上下文、建议修复和受影响区域的结构化分析,并通过 Amazon SNS 发送给团队。系统使用 Anthropic Claude Sonnet 作为主要模型,并利用 DynamoDB 对重复错误去重。

结果

部署该系统后,错误调查时间从 15-30 分钟降至 60 秒以下。分析结果包含建议修复,工程师可直接实施修复而无需先诊断。运行成本可忽略不计,每次分析仅产生少量 Amazon Bedrock 推理费用(典型为 2-3 轮工具调用)。开发人员反馈积极,分析为不熟悉的错误提供了清晰的解决起点。

医疗保健

Cohere Health 利用 Amazon Bedrock AgentCore 将临床政策数字化

问题

事前授权政策被困在静态、非结构化的文档(如 PDF)中,难以自动化。健康计划缺乏系统化的方式来管理、分析和优化这些政策,导致运营瓶颈。Cohere Health 面临三重挑战:CMS 要求 2027 年前支持基于 API 的电子事前授权、AHIP 要求 80% 实时审批、以及不同业务线的独特需求。

方案

Cohere Health 使用 Amazon Bedrock AgentCore 构建了 Cohere Policy Studio,采用多租户代理架构,包括可复用的 ECR 基础镜像模式、AgentCore Gateway 统一工具访问、AgentCore Memory 会话记忆,以及基于 Agent Skills 开放标准的模块化技能框架,实现政策数字化并保留人工审核。

结果

政策数字化时间减少 30%(从每项 2 小时 15 分钟降至 1 小时 35 分钟);完整代理部署时间从 3-4 个月缩短至 2-6 周;通过结构化、版本化的政策输出使临床决策可追溯、可审查。

摄影业务服务(SaaS)

Pixieset 借助 Amazon Bedrock 实现 35% AI 功能采用率:解决正确的问题

问题

摄影师和艺术家是生成式 AI 最持怀疑态度的群体,他们担心 AI 威胁其技艺并充斥行业。Pixieset 发现其网站构建器中大多数摄影师网站几乎没有替代文本。摄影师的作品集包含数百到数千张图片,为每张图片编写独特且描述性的替代文本非常繁琐且耗时,导致这项任务被不断推迟。

方案

Pixieset 使用 Amazon Bedrock 上的多模态大语言模型(Anthropic Claude 3.5 Sonnet)构建了 AI 图像替代文本生成功能。该功能集成到现有的事件驱动架构(Amazon EC2、AWS Lambda、Amazon SQS)中,通过单一 API 调用将图片发送到 Bedrock 进行推理,生成的标题与照片一起存储,并在网站构建器中供用户审核。设计上采用单张图片逐步审核,用户可接受、编辑或拒绝,然后可选择自动应用,且始终可编辑。使用跨区域推理和备用模型重试确保零停机。

结果

Pixieset 在 4 个月内从概念到生产,向数百万用户推出该功能。上线首周即为超过 75 万张照片生成了替代文本,16 个月后仍有 35% 的适用用户使用该功能,并推动了显著的订阅升级。用户反馈积极,有用户表示因该功能更新了订阅。

建筑行业 / BIM

ONESTRUCTION 携手 AWS GenAIIC 构建 Ishigaki-IDS:面向建筑 BIM 的专用基础模型

问题

日本建筑业面临劳动力短缺,BIM推广需要专业知识,而IDS作为BIM验证的XML标准,其编写要求熟悉IDS语法和IFC规则。三个主要挑战:IDS标准新(2024年发布)导致公开数据稀缺;需要注入数千个IFC术语的映射关系;IDS专用XML语法复杂,通用模型难以准确生成。

方案

基于开源Qwen3(8B/14B/32B)构建Ishigaki-IDS。采用三阶段训练流程:CPT(持续预训练)注入IDS和IFC领域知识,利用内部专家合成数据;SFT(监督微调)训练指令到IDS输出的映射;RLVR(可验证奖励强化学习)使用buildingSMART的IDS-Audit-Tool作为自动奖励函数,确保XML结构、IDS结构语义一致。训练基础设施使用Amazon EC2 P5en(H200 GPU)实例、AWS ParallelCluster和Amazon FSx for Lustre。AWS GenAIIC提供双周技术咨询。

结果

在IDS-Bench评估中,Ishigaki-IDS的XML结构合规性和IDS结构合规性接近100%,内容一致性超过80%;而通用前沿模型IDS结构合规性低于25%,内容一致性接近0%。模型通过YaRN支持约120k token的上下文。与buildingSMART的联合概念验证中,IDS专家和非专家对模型在实际工作中的表现给予积极反馈。

未分类

AI 客服从“回答问题”到“直接执行”:Velor 重构后创始人终于不用再亲手处理退款

问题

创始人用户虽然认可 AI 能准确回答文档问题,但真正消耗其精力的并非知识型问题,而是“可执行”类请求。客户说“能不能你直接帮我操作”,而产品只会粘贴文档链接,导致创始人仍需登录 Stripe 等系统手动处理退款、改地址、逆向收款等任务,严重拖慢产品开发节奏。

方案

作者重构了 Velor:不再只是把答案基于文档,而是接入 Stripe、Shopify、Zendesk 等系统。当客户要求退款时,AI 会查验订单、与客户确认并直接处理,同时生成带签名的审计日志记录每个动作及原因。系统还根据操作可逆性设置自动执行阈值——可逆的低额退款可自动执行,不可逆或高成本操作则进入确认状态,并利用幂等键和终态状态处理 webhook 延迟或部分失败问题。

结果

重构后工单拦截率提升,升级到创始人的工单类型发生了根本变化:从过去大量“你帮我做一下”的机械性操作,转变为真正需要判断力的复杂决策。创始人介入的工单数量下降,且剩余工单是需要代入业务语境做判断的高价值问题,使创始人注意力重新聚焦在关键决策上。

未分类

nOps 借助 Amazon Bedrock AgentCore 将 FinOps 代理交付速度提升 75%

问题

nOps 原有基于 API 的架构存在响应延迟高、系统复杂性大、创新拖累等问题。自管理的 Amazon EKS 堆栈导致工程维护负担重,开发迭代慢,且代理回答依赖 API 响应而非专用语义分析层,难以扩展。

方案

nOps 将其 Clara 代理重构为基于 Amazon Bedrock AgentCore 的单代理架构,结合 Databricks Lakehouse Metric Views 提供治理的语义分析层、Databricks Lakebase 存储持久状态,并通过异步工作流(Amazon DynamoDB、SNS、SQS、API Gateway WebSocket)实现实时更新。移除了 LangGraph/LangChain 编排层,由 AgentCore 运行时和内存替代,并使用 Amazon Bedrock Guardrails 进行租户隔离和提示攻击检测。

结果

nOps 将生产交付时间缩短 75%(从 10-12 个月降至 4 个月),工具故障率从 7.49% 降至 0.92%,客户成功经理和解决方案架构师的手动分析时间从 2 小时减少至 30 分钟(降低 75%)。响应质量显著提升:正确性评分达 81.7%(较上期提升 145%),有用性评分达 79.4%(较上期提升 138%)。

未分类

Solv Labs 构建基于 Amazon Bedrock AgentCore payments 的可验证、可审计代理支付工作流

问题

当自主系统移动资金时,运营方需要向审计师、对手方和法律证明每笔支付经过授权、按风险定价并记录在案,但缺少将具体支付与授权策略、约束条件和风险绑定在一起的持久记录。企业需要每笔代理支付在交易层面可验证、风险定价且可审计,同时不拖慢代理速度或引入额外基础设施。

方案

该工作流由 ORACLE 策略引擎进行预授权,ICME PreFlight 提供可独立验证的策略检查,AWS Nitro Enclave 进行硬件完整性认证,风险引擎进行每笔交易定价,最后通过 Amazon Bedrock AgentCore payments 处理支付并由 Coinbase 进行链上结算。每笔交易产生一个签名证据记录,绑定策略、检查结果、硬件认证执行记录、风险价格和结算工件,并通过‘无决策、无结算’的门控确保治理先行。

结果

每笔支付交易都生成硬件认证、可独立验证的治理记录,支持 ALLOW 和 REVIEW 决策路径,DENY 路径已实现并产生签名拒绝记录。治理决策锚定在 Base 区块链上,第三方可验证。端到端交易在四秒内完成,治理开销不到一秒。企业可获得按异常规模扩展的审查工作、融入现有预算线的控制成本,以及风险、合规和审计团队可各自验证的审计线索。

品牌通信

First Orion 借助 Amazon Nova Act 加速 QA 自动化

问题

First Orion工程团队交付速度超过QA测试能力,传统基于脚本的Selenium和Playwright测试脆弱且编写耗时,导致发布延迟、新功能质量下降,工程时间被回归测试大量消耗。

方案

采用Amazon Nova Act,从基于选择器的脚本测试转向自然语言驱动的AI代理测试。构建包含React测试用例编写UI、Amazon S3存储、Amazon ECS/Fargate运行器、Amazon Bedrock AgentCore Browser的端到端系统,QA分析师可直接用英语编写测试用例,由Nova Act理解界面并自动执行浏览器操作,无需维护元素选择器。

结果

QA周期减少20-25%,工程时间节省25-30%,测试覆盖率提升15%以上,回归检测提前到开发周期早期,工程资源转向功能开发。

企业 IT 服务 / 软件工程

NTT DATA 用 Codex 将事件分析缩短至 30 分钟

问题

大型企业的事件分析和日常知识工作涉及大量人工检索、归纳与重复操作,需要在安全治理框架下提高处理效率。

方案

NTT DATA Group 将 ChatGPT Enterprise 与 Codex 用于受控的企业工作流程,帮助员工自动化工作,并推动安全的 AI 采用。

结果

OpenAI 官方案例摘要称,该实践覆盖约 9,000 名员工,并将事件分析时间缩短至 30 分钟。公开摘要未提供完整基线、成本、样本分布和长期效果,因此这些结果不应直接外推到其他企业。