一句话看懂:AI 评估(Evals)正在成为大模型应用开发的核心环节,但 Anthropic 的 Claude 在这类任务中的能力有明显短板。两位资深从业者指出,Claude 擅长自上而下的评估设计,却几乎无法独立完成自下而上的评估,这部分仍需人工主导。
事件核心:发生了什么
在 Peter Yang 主持的一档播客节目中,AI 评估专家 Shreya 和 Hamel Husain 分享了他们在教学 4500 余名工程师和产品经理过程中总结的评估方法论。两人将 AI 评估分为两种类型:自上而下(top-down)和自下而上(bottom-up)。自上而下的评估指仅根据任务描述,在“真空”状态下设计测试用例,Claude 在这一环节表现出色,能帮助开发者快速生成评估框架。而自下而上的评估则需要开发者大量查看模型输出样本,凭直觉提炼出需要固化的反馈标准——Shreya 直言“Claude 非常不擅长做这类评估,这部分工作只能靠你自己”。这段观点发布于 2026 年 8 月 23 日,源自 X 平台 Follow Builders 账号,原视频在 YouTube 可观看。
为什么重要
这一观点揭示了当前大模型应用开发中的一个现实矛盾:模型能力越强,评估体系越成为瓶颈。Claude 在生成式任务上的表现有目共睹,但在“理解人类直觉、将模糊感受转化为可执行测试用例”这一环节上,目前的大模型仍无法替代人工判断。对于依赖 Claude API 或 Anthropic 闭源模型的开发团队而言,这意味着评估流程不能完全自动化,人类专家在中间扮演的角色短期内不会被大模型取代。同时也说明,评估工具链和评估方法论本身正在成为大模型生态中一个被低估的竞争赛道。
对用户/开发者/创作者的影响
对开发者而言,最直接的启示是:不要指望用 Claude 或类似大模型一键生成完整的评估体系。正确做法是让 Claude 承担自上而下的部分——快速产出覆盖不同场景的测试框架,然后在自下而上的环节中,开发者需要亲自检查大量模型输出,把那些“看起来不对但说不清哪里不对”的直觉反馈沉淀为可重复执行的评测标准。对于使用 AI 辅助创作的内容团队,这两类评估的思路同样适用:AI 能帮你搭建内容质量的检查清单,但对品牌调性、语气节奏这类高度主观的判断,依然需要人来定标。对于采购或评估 AI 产品的企业用户,这一观点也提供了一个审视供应商的视角:评估能力是否完善,往往决定了模型在真实业务场景中的最终可用性。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
后续可以关注三个方向:第一,Anthropic 或其他闭源模型厂商是否会针对评估场景推出专门的工具或 API,帮助开发者更高效地完成自下而上的评估;第二,Hamel Husain 和 Shreya 这两位从业者是否会推出更系统的评估方法论课程或开源工具,目前他们已具备 4500 余人的教学规模;第三,随着更多团队开始认真对待 AI 评估这个环节,市场上是否会出现独立的评估服务商或标准化评估框架,从而改变目前各家各自为战的局面。


