AI能够独立完成的最大软件项目是什么?

Epoch AI 联合 METR 发布了一个名为 MirrorCode 的新基准,专门测试 AI 模型在无源代码、无联网、长时间无人干预的条件下,从头重写整个软件项目的能力。Claude Opus 4.7 已在该基准上接近完整重写一个约 1.6 万行代码的生物信息学工具。

一句话看懂:Epoch AI 联合 METR 发布了一个名为 MirrorCode 的新基准,专门测试 AI 模型在无源代码、无联网、长时间无人干预的条件下,从头重写整个软件项目的能力。Claude Opus 4.7 已在该基准上接近完整重写一个约 1.6 万行代码的生物信息学工具。

事件核心:发生了什么

MirrorCode 是 Epoch AI 与 METR 联合开发的软件工程基准测试。与常见的“修 Bug”“实现单个功能”类基准不同,MirrorCode 要求 AI 模型在无法访问原始源代码和互联网的沙盒环境中,端到端地重新实现完整程序,并通过包含未见测试在内的严格输出比对。基准共包含 25 个目标程序,覆盖 Unix 工具、数据序列化、生物信息学、解释器、静态分析、密码学和压缩等方向。

MirrorCode 的关键设计是不限制推理预算。官方给出一个极端案例:某项大型任务单次运行耗资 2600 美元,AI 连续工作 19 天。另一个更具代表性的结果是,Claude Opus 4.7 用 14 小时重写了 gotree——一个约 1.6 万行 Go 代码、包含 40 多个命令的生物信息学工具包,成本 251 美元,通过了 2000/2001 项测试;Epoch 估计同样的任务由人类工程师完成需要 2 到 17 周。

目前当前排行榜采用 15 个 Medium 和 Large 类目标程序、每个程序用 Go 和 Ada 两种语言实现,共 30 项任务,每次尝试给 10 亿 token 和 7 天时间。基准的 25 个目标程序中,22 个已开源,剩余 3 个留作私有测试集。

为什么重要

MirrorCode 回答了一个此前缺乏可量化答案的问题:AI 能独立承担多大规模的软件项目?过去大多数基准把任务切碎,衡量的是“补全代码”的能力;MirrorCode 衡量的是“把整个项目从头到尾交出去”的连续工作能力。这在时间

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

celebrityanime
celebrityanime
文章: 16729

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注