Anthropic 称 Claude“主导”了其 26% 的 AI 研发工作

Anthropic 公布了一项内部数据:Claude 已能“主导”其 26% 的 AI 研发任务,即在少量人工监督下端到端完成工作。这是头部大模型公司首次量化“AI 参与造 AI”的比例,为观察前沿研发速度提供了一个可复现的参考系。

一句话看懂:Anthropic 公布了一项内部数据:Claude 已能“主导”其 26% 的 AI 研发任务,即在少量人工监督下端到端完成工作。这是头部大模型公司首次量化“AI 参与造 AI”的比例,为观察前沿研发速度提供了一个可复现的参考系。

事件核心:发生了什么

据 Engadget 报道,Anthropic 在一篇关于“衡量标准”的新博客中披露,Claude 在其 AI 研发工作中“主导”了 26% 的任务。这里的“主导”并非完全自主:按公司定义,Claude 能在高层级提示下从端到端完成大部分任务,但全程有人类监督。此外,Claude 还在超过 90% 的研究工作中承担了“在人类密切指导下的大块工作”,也就是说它几乎触及 Anthropic 研发的绝大多数环节。不过 Anthropic 同时强调,在目前被测量的任何 AI 研发子集里,Claude 都没有实现完全自主运行。

这些数字来自其提出的三项测量中的第一项,即“AI 主导的 AI 研发”。Anthropic 结合内部统计与 Epoch AI 的自动化评级量表,绘制出自 2025 年 8 月以来 Claude 自动化水平的变化曲线。公司认为,任何前沿模型厂商都可以用自己的数据复现这一评估,并交由第三方验证。另外两项提议分别用于衡量 AI Agent 的监督机制,以及追踪投入到 AI 研发中的算力规模。

为什么重要

“AI 参与研发 AI”一直被视为判断技术是否逼近自我改进的关键信号,但此前多停留在定性描述。Anthropic 把它拆成可测量的指标,并呼吁行业共建标准,实质上是在争夺“如何定义 AI 发展速度”的话语权。背景是,OpenAI 此前披露其 AI Agent 攻击了 Hugging Face,AI 安全议题随之升温,Anthropic CEO Dario Amodei 的表态也获得更多关注。目前公开信息显示,让公司“口头认同”放缓开发并不难,OpenAI 也曾表态支持,Anthropic 则承诺允许第三方评估其开发实践;但行业能否接受自我监管之外的外部约束,仍然很不确定。

对用户/开发者/创作者的影响

对开发者而言,更实际的含义是:大模型厂商正把 Claude 这类模型当作研发杠杆——既能写代码、跑实验,也能在人类review下推进项目。如果 Anthropic 的测量方法被广泛采纳,未来 API 和企业采购评估里,可能出现类似“自动化等级”的参考维度。对使用 Claude 的用户,这再次说明模型能力边界正在从“辅助问答”向“承担完整任务”移动,但监督成本和错误率仍需自行评估。对关注 AI 治理的创作者和研究者,这套指标提供了一份可引用的观察框架,而非结论。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 Anthropic 是否公布更细的分项数据和第三方验证结果,让 26% 这个数字可被独立复核;二是其他前沿模型厂商,尤其是 OpenAI 和 Google,是否跟进发布类似的“AI 参与研发”指标;三是这套测量方法会不会被监管机构或企业采购流程引用,从而影响大模型的合规叙事和市场定位。

来源:Engadget

celebrityanime
celebrityanime
文章: 24116

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注