AI Agent 在模型开发中承担的工作越来越多,但最终决策仍由人类做出

一支包含复旦大学研究者的团队复盘了自家 7440 亿参数大模型 Atria Dawn Preview 的开发过程,发现 AI 承担了 96.5% 任务中的执行工作,但目标与方法的最终决定权仍有 85% 以上握在人类手里。

一句话看懂:一支包含复旦大学研究者的团队复盘了自家 7440 亿参数大模型 Atria Dawn Preview 的开发过程,发现 AI 承担了 96.5% 任务中的执行工作,但目标与方法的最终决定权仍有 85% 以上握在人类手里。

事件核心:发生了什么

该团队分析了 56 名参与者留下的 700 多条任务日志,以及他们所用 AI Agent 的日志。整个项目围绕 Atria Dawn Preview 展开,这是一款基于混合专家(MoE)架构、7440 亿参数的智能体语言模型,面向研究与工程任务,训练流程把每项任务接到真实执行环境中,调用工具、生成中间结果,并用测试、指标或外部证据来校验。团队称其在 16 项基准中领先 5 项(含网络搜索、网络安全方向),但整体并未领先对手——在 AutomationBench、CyberGym、MLE-Bench Lite 上占优,在 GDPval 和 SWE-Bench Pro 上落后。

几个关键数字:AI 参与了 96.5% 的任务;四周内,人类每次输入对应的 Agent 动作中位数从 11 升到 28.5;455 项 AI 辅助完成的任务中,有 151 项被参与者判定为没有 AI 就做不到,占比约三分之一,且分布在 56 人中的 27 人,并非少数重度用户撑起来的。决策层面,方法类选择最典型的模式是”AI 提议、人来选”(55.4%),人类拿下 85.5% 的方法与参数最终决定权,AI 仅 9.2%;目标与范围上,人类最终拍板比例达 93.4%。

为什么重要

这组数据对”Agent 马上会自主开发模型”的叙事是一记降温。Agent 动作数暴增,表面上像自主性上升,但团队提醒这更像是”一个人类决策触发了更多机器步骤”,而非 Agent 自己做了更多决策。出问题时的分工也能说明问题:588 项记录到困难的任务中,76% 靠人类介入推进,其中 35.2% 是补充上下文或澄清需求,34.7% 是诊断问题并换方法,人类亲自上手只占 3.2%、完全接管仅 0.7%。真正的瓶颈是判断力,不是执行力。这对评估 AI 研发管线的真实自动化程度、以及 Agent 产品的定位,都有直接参考价值。

对用户/开发者/创作者的影响

对开发者,这意味着把 Agent 当”执行放大器”比当”决策替代品”更现实:值得投入的是任务环境搭建、外部校验信号(测试、指标、证据链)和人类复核节点,而不是过早砍掉人工评审。对企业采购,衡量 Agent 价值的指标应从”替代了多少人”转向”让多少原本做不了的任务变得可行”。对创作者和研究者,AI 提案能力强、拍板能力弱的格局短期内不会变,人仍需负责目标设定、方案筛选和结果验收。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 Atria Dawn Preview 是否公开权重或开放 API,决定这套协作方法论能否被外部复现;二是”Agent 动作/人类输入”比值继续上升后,会不会出现决策权同步转移的拐点;三是团队提到的第四阶段——递归自我改进,目前公开信息显示仍是开放问题,一个模型能训好自己的任务,未必能设计出更强的继任者。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 25901

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注