AI 工程师必备的 7 条自改进智能体循环规则

Google Cloud 团队开源了编码智能体工具 agents-cli,把“构建智能体、找出失败、改写、再运行”的自改进循环自动化。这个循环的关键短板是:智能体会优化你给它的指标,但不会判断指标本身对不对,因此定义“什么算好”成为 AI 工程师的新核心工作。

一句话看懂:Google Cloud 团队开源了编码智能体工具 agents-cli,把“构建智能体、找出失败、改写、再运行”的自改进循环自动化。这个循环的关键短板是:智能体会优化你给它的指标,但不会判断指标本身对不对,因此定义“什么算好”成为 AI 工程师的新核心工作。

事件核心:发生了什么

2026 年 8 月,Google Cloud 技术账号在 X 平台发布了一套名为 agents-cli 的开源工具,作者是 Shubham Saboo 和 Elia Secchi。它用于在 Agent Development Kit(ADK)上构建和评估智能体,主要工作是自动化“测量并改进”的循环:先按数据集生成智能体的执行轨迹,再按自定义指标给每条轨迹打分,从而判断一次修复是否真的有效。

这套流程的初衷很直接:当编码智能体开始替开发者写代码和改代码时,工程任务从“写实现”变成“写验收标准”。agents-cli 把原先靠手工检查、反复试错的过程压缩成 eval generate 和 eval grade 两条命令,但刻意把“评分标准”保留给工程师定义,而不是交给智能体自己判断。

为什么重要

核心观点是:工具的每一次进步,都把人的精力往上推一层——从汇编到编译器,从编译器到框架,这次则从“写代码”推到“定义指标”。编码智能体无法从内部判断一个目标是否真实反映了你的意图:给它错误的指标,它会努力优化出一个分数好看、实际更差的智能体,然后向你报告成功。

因此,指标成了智能体产品中真正的核心“代码”。它对提示词、代码和行为都有上游约束力,会重塑整个循环的走向。公共基准测不出退款政策、升级规则、合规边界这类业务标准,只有团队自己定义的指标能承担这个角色。目前在公开信息中,这套方法最适合那些已有明确业务规则的场景,指标越具体,循环越不容易跑偏。

对用户/开发者/创作者的影响

如果你正在用编码智能体迭代自己的 AI 应用,直接可用的经验有三条。第一,把业务要求写成自定义指标,例如客服智能体是否在取消前提供了挽留方案,用 0 或 1 评分,并附一句判定理由;只评估最终回复,不要只评估推理过程,因为智能体可能在推理时“想对了”、最终输出却用了一个过期值。第二,不要让智能体给自己打分,它通常会给出偏乐观的分数,真正重要的失败恰恰是它最容易放过的类型;评分标准必须独立于修复者。第三,把指标定义纳入版本管理,像对待代码一样对待它,随着新的失败案例不断打磨。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对普通用户来说,这套方法的意义在于:未来由智能体生成的客服回复、文档或业务处理结果,背后的质量“锚点”将来自一套明确可查的规则,而不是模型当时的心情。

值得关注的后续

目前公开信息显示,agents-cli 的主要价值集中在“用自定义指标驱动改进循环”

celebrityanime
celebrityanime
文章: 18305

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注