一句话看懂:Berkeley RDI 提出软件自主开发三级框架,将 AI 在软件工程中的责任从代码编写逐步扩大到需求定义,并指出当前 AI 代理虽能独立完成复杂任务(如 16 个 Claude 代理用不到 $20K 构建 C 编译器),但在连续演化中可靠性不足,需要类似自动驾驶的等级化安全保障。
事件核心:发生了什么
2026 年 7 月 26 日,UC Berkeley 的 RDI(研究和开发创新中心)联合 MIT、Cursor、UT Austin、Microsoft 等机构发布了一篇立场论文《Towards Autonomous Software Development》,提出软件自主开发的三级框架。该框架受 SAE 汽车自动化等级启发,定义了 AI 在软件开发生命周期中承担责任的三个层次:Level I(代码自主)——AI 完成系统设计与实现,人类负责需求确定和 PR 级审查;Level II(管道自主)——AI 从设计到部署全流程自动化,人类仅定义高层次需求并验收结果;Level III(需求自主)——AI 自行从遥测、用户行为、安全公告等数据中识别需求并构建系统,人类仅设定初始使命。论文还引用了一个实际案例:16 个并行的 Claude 代理仅用不到 $20K 就构建了一个可运行的 C 编译器,但在需要连续演进的基准测试中,AI 代理在添加新功能时难以保持正确性和架构一致性。
为什么重要
这项框架的提出,意味着 AI 对软件工程的影响已从“辅助编码”进入“任务所有权”的讨论阶段。此前,“自主编码代理”概念模糊,不同产品差距巨大——从补全几行代码到自动提 PR 甚至决定功能。RDI 的分级框架为行业提供了一套公共语言,用以评估 AI 系统的能力边界、部署风险和责任归属。对 AI 公司而言,它明确了目前主流产品(如 GitHub Copilot、Cursor)大多处于 Level I 的前期;对安全敏感领域(如金融、自动驾驶软件),Level II 和 Level III 的落地需要根本性的验证技术突破。这一框架也首次系统性地将“需求生成”纳入 AI 自主范围,挑战了传统软件工程中“人类定义需求”的不可替代假设。
对用户/开发者/创作者的影响
开发者:需要重新理解“自主”的含义——不同级别的工具对应不同的审查义务。使用 Level I 工具(如自动生成完整 PR)仍需要人工审查设计逻辑和测试结果;盲目信任 Level II 以上系统可能导致架构退化。建议开发者关注框架中的“责任转移”原则,选择与自身场景匹配的工具。企业 CTO/技术采购:可将该框架作为选型参考,评估 AI 编码工具的安全和可控性。例如,内部门槛较低的工具可以探索 Level II,但客户界面核心系统应长期锁定 Level I。AI 产品经理与创作者:需求自主(Level III)设想了一种由 AI 自行决定“做什么”的循环,这对现有产品功能定义方式构成潜在颠覆。但论文也强调,“自发生成的需求”可能偏离原始使命,需要提前设计约束机制。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
第一,该框架能否获得行业共识,成为类似 SAE 级别的标准?微软、Cursor 等参与单位是否会将其纳入产品路线图?第二,Level II 的关键前提——“人类意图可以被充分规格化”——目前在安全与验证领域仍无成熟方案,后续是否有技术突破(如形式化验证与 AI 的结合)值得跟踪。第三,响应性监管:不同地区对 AI 生成代码的责任归属尚未明确,该框架可能为政策制定提供参考。最后,竞品(如 Anthropic、OpenAI)是否会有类似的分级提议,值得对比观察。


