一句话看懂:Anthropic 公布数据称,Claude 已“主导”其 26% 的 AI 研发工作,而今年 3 月这一比例还不到 1%。这意味着大模型开始深度参与下一代模型的研发流程,也让“递归自我改进”这个长期停留在讨论层面的问题,第一次有了可量化的公开指标。
事件核心:发生了什么
Anthropic 在 9 月 18 日发布的博客中披露,Claude 目前在自家 AI 研究与开发工作中“主导”26% 的任务。按公司的定义,这指的是人类给出高层提示、模型完成大部分工作,由人负责监督。作为对比,3 月时这一比例还低于 1%。
Anthropic 同时给出了更宽的口径:超过 90% 的研发工作已达到“AI 协作”及以上水平。不过公司明确表示,没有任何被测量的研发环节是模型完全自主完成的。此外,Anthropic 称 8 月分析了超过 10 亿次 AI 操作决策,其中 0.002%(约每 4.7 万次中有一次)被自动监控拦截,每周约有 50 个高优先级案例升级给人工审查。
为什么重要
这组数字之所以敏感,是因为它触及“递归自我改进”——即模型完全自主地构建自己的下一代。Anthropic 自己也在文中指出,如果模型能加速自身开发,人类理解和控制系统会变得更困难,因此有必要公开这类指标。
围绕 AI 安全的争论正在升温。一名 Anthropic 研究员上周辞职,指责头部公司是在“拿我们的生命赌博”;CEO Dario Amodei 则呼吁前沿实验室协调放慢开发节奏,让安全措施跟上。在这种背景下,把研发自动化率做成公开指标,既是透明度尝试,也是一种竞争叙事:谁能更清楚地量化 AI 参与研发的程度,谁就更容易在监管和公众信任上占位。
对用户/开发者/创作者的影响
目前公开信息显示,这些数字描述的是 Anthropic 内部研发流程,并不直接等同于 API 能力或产品功能的变化。对开发者和企业采购方来说,更现实的参考是模型在长链条任务中的监督成本和可靠性——自动化率上升,意味着提示设计和结果校验的方式需要同步调整,人在回路中的角色会从“执行”转向“审核”。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对内容创作者和普通用户,短期内不必期待工具出现跳跃式变化;真正值得留意的是这类指标是否会被写进企业合规和采购标准,成为评估模型可控性的一个维度。
值得关注的后续
一是 Anthropic 是否会持续按月或按季度更新这些数字,以及第三方能否验证。二是其他前沿实验室会不会跟进发布同类指标,形成可比口径。三是 0.002% 的拦截率和每周 50 起人工升级案例,实际处理了哪些风险类别,Anthropic 尚未展开,后续披露值得跟踪。


