Anthropic 首次量化公开 AI 研发自动化进度:Claude 主导 26% 研发,压力甩给 OpenAI 等竞品

Anthropic 首次公开内部研发自动化数据,称截至今年 8 月,Claude 已主导其 26% 的 AI 研发工作,而这一比例在 2 月还不足 1%。这意味着 AI 参与自身迭代不再只是概念讨论,而开始有可量化的工程指标。

一句话看懂:Anthropic 首次公开内部研发自动化数据,称截至今年 8 月,Claude 已主导其 26% 的 AI 研发工作,而这一比例在 2 月还不足 1%。这意味着 AI 参与自身迭代不再只是概念讨论,而开始有可量化的工程指标。

事件核心:发生了什么

当地时间 9 月 17 日,Anthropic 发布文章,首次以量化方式披露内部 AI 研发自动化进展。关键数据是:Claude 主导了公司 26% 的 AI 研发工作,超过 90% 的研发任务至少达到“AI 协作”水平。内部代理平台上任意时刻约有 3 万个 AI agent 在运行,8 月共做出超过 10 亿次决策。

Anthropic 采用了独立研究机构 Epoch AI 提出的 AL0 至 AL5 六级框架:AL0 为无 AI 参与,AL3 为 AI 协作,AL4 为 AI 驱动,AL5 为完全自主。目前 26% 的研发工作达到 AL4,即人类只给高层目标,Claude 端到端完成大部分工作,人负责监督和最终批准;尚未有任务达到 AL5。安全方面,所有 agent 行动执行前需经过在线监控,8 月约 0.002% 的决策被拦截。

为什么重要

这组数字把“递归自我改进”(RSI)从讨论推向了工程现实。RSI 正成为 AI 资本开支的核心投资逻辑,Google DeepMind 首席战略官 Jagjeet Saini 曾表示,当前 AI 收入无法支撑投入的资本开支,但不押注 RSI 是不明智的。Anthropic 公开比例、agent 规模、算力投入和安全监控覆盖率,等于给行业立了一个参照标准——不跟进披露,可能被视作刻意隐瞒。

竞争压力已经显现。OpenAI 在 9 月初宣布自动化 AI 研究实习生达成里程碑,目标 2028 年 3 月实现自动化 AI 研究员,但承认超过四小时的任务仍需频繁人工介入;智谱创始人唐杰透露 GLM-5.3-Flash 两周内在国产加速器完成全量部署,大部分工作由 Infra Agent 完成。各家路线不同,但“模型优化系统、系统服务模型”的循环已经开始。

对用户/开发者/创作者的影响

对开发者而言,Anthropic 描述的场景值得注意:夜间数据管道故障后,工程师只需把报告交给 Claude 并说“修好它”,它就能自主查日志、定位原因、写修复代码、测试、处理新问题、重跑管道并写说明。这类端到端闭环如果继续成熟,会先影响内部工具链和运维类 API 工作流。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对企业采购和投资判断来说,研发自动化比例可能成为评估 AI 公司效率的新指标。目前公开信息显示,跨实验室比较仍缺乏统一方法和第三方验证,Anthropic 也承认“AI 协作”与“AI 驱动”的边界存在主观性,因此不宜直接把各家数字简单对比。

值得关注的后续

1. OpenAI、Google DeepMind 等是否跟进披露类似研发自动化比例,以及是否采用统一评估框架。2. Anthropic 的 agent 规模和安全拦截率是否随模型升级持续变化,AL4 占比会否继续上升。3. 当研发自动化比例成为竞争指标,监管和第三方审计是否会介入,要求更统一的披露标准。

来源:AIbase

celebrityanime
celebrityanime
文章: 24194

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注