Google 开源 AQuA:自动诊断生产 Agent 的隐性故障

Google Developers Blog 于 2026 年 10 月 8 日发文,介绍开源环境质量智能体 AQuA,可在不进入请求路径的前提下,自动扫描生产环境中的 Agent 轨迹并定位故障根因,填补了离线评测与线上监控之间的诊断空白。

一句话看懂:Google Developers Blog 于 2026 年 10 月 8 日发文,介绍开源环境质量智能体 AQuA,可在不进入请求路径的前提下,自动扫描生产环境中的 Agent 轨迹并定位故障根因,填补了离线评测与线上监控之间的诊断空白。

事件核心:发生了什么

Google 在官方开发者博客上开源了 AQuA(Ambient Quality Agent)。它运行在用户的 Google Cloud 项目内,按计划、部署后或按需拉取 Cloud Trace、Cloud Logging 或 BigQuery 中的生产会话轨迹,经过五阶段流水线做过滤、聚类和洞察提炼。AQuA 不会介入请求链路,也不会向 Agent 写回数据,原始会话、源码快照和 BigQuery 表都保持在项目边界内。

开发者可以通过自然语言的 goal.md 和确定性的 Python 自定义指标(eval_config.yaml)来引导评审方向,也可以选用 Gemini 平台的托管轨迹 AutoRaters。当发现值得调查的洞察时,可从仪表盘或 agents-cli 触发根因分析。若缺陷在仓库内,AQuA 会引用 <path>:<start>-<end> 并给出锚定快照行的编辑建议;若故障来自上游依赖或交接环节,则只做归因,不提议代码差异。它不会自动应用修改或发起 Pull Request。

为什么重要

当前 Agent 上生产后的质量曲线很容易变平甚至下滑。模型升级、Harness 调整、工具或技能变更后,健康检查依旧全绿,但对话质量和任务成功率可能已偏离原评测集。传统离线评测只覆盖已知用例,在线评测只告诉团队“分数动了”,却很难说清是模型、代码、数据还是交接环节导致的失败。AQuA 的价值在于把原始生产流量转成带代码锚点的诊断结论,并归档失败轨迹,为已有的内环评测和编码 Agent 提供可复用的输入。它位于离线评测、在线评测和编码 Agent 之间,而不是替代其中任何一层。

对用户/开发者/创作者的影响

对运行 Agent 的开发者来说,AQuA 提供了一套可组合的开源构建块,可以适配自己的技术栈,降低人工逐条阅读生产会话的成本。它把“评分动了”和“为什么动”之间的诊断环节自动化,适合排班轮值团队先做第一轮筛查。需要留意的是,目前公开信息显示,AQuA 依赖 Google Cloud 的 Trace、Logging 和 BigQuery,并默认使用 Gemini 模型做评审,因此对云环境和模型选型有一定绑定。对于企业采购和平台团队,这意味着 Agent 可观测性可能从零散仪表盘,转向更接近“初级质量工程师”的自动化诊断层。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 AQuA 的开源组件是否会被其他云厂商或可观测性平台集成,形成跨云方案;二是根因分析的准确率与误报率,是否能在不同业务域和复杂交接链路中稳定复现;三是 Gemini 托管 AutoRaters 与自定义指标之间的成本、延迟和可解释性如何权衡。这些将决定 AQuA 是成为生产 Agent 的标配诊断层,还是仅停留在 Google Cloud 生态内的辅助工具。

来源:Google Developers Blog(RSS)

celebrityanime
celebrityanime
文章: 28372

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注