一句话看懂:Anthropic 产品负责人 Dianne Penn 在近期访谈中提出,AI 产品经理的核心能力不再是写 PRD,而是建立评测体系。Anthropic 早期用户抱怨“不听话”的 80% 问题,最终被定位为“不会输出 JSON”,这一案例直接定义了评测驱动的开发流程。
事件核心:发生了什么
在 Lenny’s Podcast 访谈中,Anthropic AI Research 与 Labs 团队产品负责人 Dianne Penn 回顾了公司从 5 名产品工程师发展到年化收入约 500 亿美元规模的过程。她于 2023 年加入,是 Anthropic 首位技术产品经理,参与从 Claude 2 到 Fable 的模型发布,并孵化 Claude Code、MCP、Skills 等产品。访谈核心观点是:评测已取代 PRD 成为 AI 产品经理的主要工具。她透露,早期用户反馈 Claude“不擅长遵循指令”,深入分析后发现约 80% 的问题集中在模型无法正确输出 JSON 格式,而非真正的“不听话”。这一案例促使团队将抽象用户抱怨拆解为可复现、可衡量的测试任务,直接指导模型训练方向。
为什么重要
这一观点折射出前沿 AI 公司产品方法论的结构性变化。传统 PRD 描述“想要什么”,评测则定义“如何验证”。当模型能力呈非线性跃迁,开发者和产品经理往往意识不到模型已具备新能力。Anthropic 的做法是让评测承担双重角色:既是能力检测器,也是产品机会探测器——Opus 4.5 的突破被归结为“模型能力 + Claude Code 产品载体”共同作用,而非单纯参数提升。对于整个行业,这意味着:决定 AI 产品上限的不再只是训练算力,还包括团队将模糊反馈转化为精确测试用例的组织效率。Anthropic 自下而上、低自我的协作文化,被视为支撑高频发布的关键变量。
对用户/开发者/创作者的影响
对开发者,启示是应建立自己的评测集,而不是依赖主观体验判断模型优劣。Anthropic 靠“识别出 JSON 输出问题”完成了关键迭代,说明一个具体的错误模式修复,可能比十次表面调优更有效。对使用 Claude Code、API 或 MCP 的团队,这意味着:当任务失败时,应先区分是模型能力问题,还是产品未提供合适载体的交互问题。对普通用户而言,访谈中一个值得记住的细节是:Anthropic 在 24 小时内上线了 Golden Gate Claude 实验体验,这种快速将研究成果转化为产品的能力,最终会转化为用户能感知到的差异化功能,例如更“有个性”的模型行为。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
目前公开信息显示,Dianne 在访谈中提到了为未来更强模型预留设计空间的问题(如“如果 Claude 8.0 出现,今天的产品是否兼容”),可关注三个观察点:其一,Claude Code 是否会继续作为 Opus 系列新能力的首发载体,而不是仅仅作为独立编码工具;其二,她提到的“用 Claude 准备困难对话”的 Skill 方法是否会被产品化,成为情商辅助类功能;其三,Anthropic 评测方法论是否会对外开放——如果其评测集或工具链标准化,可能影响开发者评估模型的效率。


