Anthropic 称 Claude 现已主导其超过四分之一的人工智能研究

Anthropic 公布数据称,Claude 已“主导”其 26% 的 AI 研发工作,而今年 3 月这一比例还不到 1%。这意味着大模型开始深度参与下一代模型的研发流程,也让“递归自我改进”这个长期停留在讨论层面的问题,第一次有了可量化的公开指标。

一句话看懂:Anthropic 公布数据称,Claude 已“主导”其 26% 的 AI 研发工作,而今年 3 月这一比例还不到 1%。这意味着大模型开始深度参与下一代模型的研发流程,也让“递归自我改进”这个长期停留在讨论层面的问题,第一次有了可量化的公开指标。

事件核心:发生了什么

Anthropic 在 9 月 18 日发布的博客中披露,Claude 目前在自家 AI 研究与开发工作中“主导”26% 的任务。按公司的定义,这指的是人类给出高层提示、模型完成大部分工作,由人负责监督。作为对比,3 月时这一比例还低于 1%。

Anthropic 同时给出了更宽的口径:超过 90% 的研发工作已达到“AI 协作”及以上水平。不过公司明确表示,没有任何被测量的研发环节是模型完全自主完成的。此外,Anthropic 称 8 月分析了超过 10 亿次 AI 操作决策,其中 0.002%(约每 4.7 万次中有一次)被自动监控拦截,每周约有 50 个高优先级案例升级给人工审查。

为什么重要

这组数字之所以敏感,是因为它触及“递归自我改进”——即模型完全自主地构建自己的下一代。Anthropic 自己也在文中指出,如果模型能加速自身开发,人类理解和控制系统会变得更困难,因此有必要公开这类指标。

围绕 AI 安全的争论正在升温。一名 Anthropic 研究员上周辞职,指责头部公司是在“拿我们的生命赌博”;CEO Dario Amodei 则呼吁前沿实验室协调放慢开发节奏,让安全措施跟上。在这种背景下,把研发自动化率做成公开指标,既是透明度尝试,也是一种竞争叙事:谁能更清楚地量化 AI 参与研发的程度,谁就更容易在监管和公众信任上占位。

对用户/开发者/创作者的影响

目前公开信息显示,这些数字描述的是 Anthropic 内部研发流程,并不直接等同于 API 能力或产品功能的变化。对开发者和企业采购方来说,更现实的参考是模型在长链条任务中的监督成本和可靠性——自动化率上升,意味着提示设计和结果校验的方式需要同步调整,人在回路中的角色会从“执行”转向“审核”。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对内容创作者和普通用户,短期内不必期待工具出现跳跃式变化;真正值得留意的是这类指标是否会被写进企业合规和采购标准,成为评估模型可控性的一个维度。

值得关注的后续

一是 Anthropic 是否会持续按月或按季度更新这些数字,以及第三方能否验证。二是其他前沿实验室会不会跟进发布同类指标,形成可比口径。三是 0.002% 的拦截率和每周 50 起人工升级案例,实际处理了哪些风险类别,Anthropic 尚未展开,后续披露值得跟踪。

来源:Business Insider

celebrityanime
celebrityanime
文章: 24171

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注