一句话看懂:Madhu Guru 在“如何构建优秀 evals”系列第 10 篇中提出,评估 AI Agent 不能只看最终答案对不对,还要看它走完任务的每一步,因为两条轨迹可能给出同样结果,质量却相差悬殊。
事件核心:发生了什么
2026 年 9 月 10 日,Madhu Guru 在 X 上发布该系列第 10 篇,主题是“衡量步骤,而不只是结果”。他用高中数学作比:只答对答案不够,解题过程同样关键。放到 AI Agent 上,两条轨迹可能都返回 42,但一条是检索正确来源、取到正确文档、4 次干净的工具调用后算出结果;另一条是 17 次调用、同一内容重复搜索 3 次、经历 2 次报错才勉强得到答案。他给出的操作建议是:先定义完整工作流,再定义每一步的任务,然后想清楚每步如何评估(单独 eval 还是大 eval 的一个切片),最后定义中位数任务和困难任务并反映到评估集里。看结果时,先研究步骤,再看最终答案。
为什么重要
随着 Agent 产品从演示走向生产,评估方式正在成为工程瓶颈。只看最终结果的 eval 会把“侥幸答对”和“稳定高效”混为一谈,掩盖重复调用、错误恢复、上下文浪费等问题,而这些问题直接对应 API 成本、延迟和推理算力消耗。把评估粒度下沉到步骤,意味着团队能定位失败发生在检索、工具调用还是计算环节,也让不同模型、不同 Agent 框架之间的比较更有意义。目前公开信息显示,这是方法论层面的提醒,尚未绑定具体产品或基准测试。
对用户/开发者/创作者的影响
对开发者,这意味着 eval 需要和 Agent 的工具调用链、状态管理一起设计,而非上线后补一份答案准确率报告;重复搜索、无效工具调用这类“过程指标”值得进入监控。对企业采购方,同一任务下不同 Agent 的调用次数和错误恢复能力,可能比最终准确率更影响长期成本。对普通用户,更细的评估有望转化为更少卡顿、更少重复确认、更稳定的任务完成体验。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是主流 eval 框架和 Agent 平台是否会内置步骤级指标;二是行业是否形成可复用的“中位数任务/困难任务”分层标准;三是这套方法在开源与闭源模型对比中会不会被采用,从而影响选型判断。


