How to build great evals – part 10 Measure the steps, not just the result. Much like high school math, it isn’t sufficient just to get the right answer, the steps to get there are critical. Two agent trajectories migh…

Madhu Guru 在“如何构建优秀 evals”系列第 10 篇中提出,评估 AI Agent 不能只看最终答案对不对,还要看它走完任务的每一步,因为两条轨迹可能给出同样结果,质量却相差悬殊。

一句话看懂:Madhu Guru 在“如何构建优秀 evals”系列第 10 篇中提出,评估 AI Agent 不能只看最终答案对不对,还要看它走完任务的每一步,因为两条轨迹可能给出同样结果,质量却相差悬殊。

事件核心:发生了什么

2026 年 9 月 10 日,Madhu Guru 在 X 上发布该系列第 10 篇,主题是“衡量步骤,而不只是结果”。他用高中数学作比:只答对答案不够,解题过程同样关键。放到 AI Agent 上,两条轨迹可能都返回 42,但一条是检索正确来源、取到正确文档、4 次干净的工具调用后算出结果;另一条是 17 次调用、同一内容重复搜索 3 次、经历 2 次报错才勉强得到答案。他给出的操作建议是:先定义完整工作流,再定义每一步的任务,然后想清楚每步如何评估(单独 eval 还是大 eval 的一个切片),最后定义中位数任务和困难任务并反映到评估集里。看结果时,先研究步骤,再看最终答案。

为什么重要

随着 Agent 产品从演示走向生产,评估方式正在成为工程瓶颈。只看最终结果的 eval 会把“侥幸答对”和“稳定高效”混为一谈,掩盖重复调用、错误恢复、上下文浪费等问题,而这些问题直接对应 API 成本、延迟和推理算力消耗。把评估粒度下沉到步骤,意味着团队能定位失败发生在检索、工具调用还是计算环节,也让不同模型、不同 Agent 框架之间的比较更有意义。目前公开信息显示,这是方法论层面的提醒,尚未绑定具体产品或基准测试。

对用户/开发者/创作者的影响

对开发者,这意味着 eval 需要和 Agent 的工具调用链、状态管理一起设计,而非上线后补一份答案准确率报告;重复搜索、无效工具调用这类“过程指标”值得进入监控。对企业采购方,同一任务下不同 Agent 的调用次数和错误恢复能力,可能比最终准确率更影响长期成本。对普通用户,更细的评估有望转化为更少卡顿、更少重复确认、更稳定的任务完成体验。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是主流 eval 框架和 Agent 平台是否会内置步骤级指标;二是行业是否形成可复用的“中位数任务/困难任务”分层标准;三是这套方法在开源与闭源模型对比中会不会被采用,从而影响选型判断。

来源:Follow Builders · X · Madhu Guru

celebrityanime
celebrityanime
文章: 22892

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注