AI能够独立完成的最大软件项目是什么?

Epoch AI 联合 METR 发布了一个名为 MirrorCode 的新基准,专门测试 AI 模型在无源代码、无联网、长时间无人干预的条件下,从头重写整个软件项目的能力。Claude Opus 4.7 已在该基准上接近完整重写一个约 1.6 万行代码的生物信息学工具。

Epoch AI 联合 METR 发布了一个名为 MirrorCode 的新基准,专门测试 AI 模型在无源代码、无联网、长时间无人干预的条件下,从头重写整个软件项目的能力。Claude Opus 4.7 已在该基准上接近完整重写一个约 1.6 万行代码的生物信息学工具。

TechRadar 实测了号称全球首款 AI 观鸟单筒望远镜 GoBirding Vision Master(型号 APL-ETF-M1)——它把 4K 相机、端侧 AI 鸟类识别和手机联动塞进一台 30 倍光学变焦镜体内,识别准确率在良好光照下表现不错,但自动对焦、防抖和配套 App 的完成度明显拖了后腿。

WAIC 2026 释放的核心信号是:AI 竞赛的主战场已从参数规模转向工程化落地。算力利用率、具身智能量产、Agent 进业务流,成为决定下一阶段胜负的关键议题。

浙江大学软件学院教授周经森博士将出席AICon深圳站并发表主题演讲,聚焦“AI与性能工程”的双向赋能。值得关注的原因是:大模型竞赛的焦点正在从“模型能力”转向“系统效率”,性能优化已经成为AI规模化落地绕不开的环节。

京东外卖发布了一款集成AI语音助手、路线规划和订单备注提醒的智能头盔,首批免费发放给全职骑手。这件事值得关注的原因在于:AI大模型能力开始以可穿戴硬件形式进入即时配送这一高频线下场景,而不再只停留在手机App或云端。

Palantir 联合基础设施公司 Armada,把搭载 Nvidia B300 AI 加速器的数据中心装进标准集装箱,部署到战场边缘。这套系统不依赖稳定云连接即可处理情报,意味着 AI 算力正在从集中式云端走向真正的前线场景。

本周值得关注的 AI 论文集中在智能体开发效率上:NVIDIA 提出把智能体写成 Python 对象,微软联合阿姆斯特丹大学提出用离线轨迹复用替代高成本的在线采样,另有研究揭示了思维链监控的假设存在失效案例。三篇论文分别指向智能体的编程范式、训练成本和推理可观察性三个现实问题。

埃默里大学和佐治亚理工学院的研究团队开发出一套名为“CapuchinAI”的野外灵长类认知测试系统,把面部识别、触屏交互和自动喂食奖励整合进一套低功耗设备,首次实现了对野生卷尾猴的大规模、自动化认知评估。这套方法为“AI + 动物行为学”提供了一个可复制的开源范式。

Wafer.ai 把 2.8T 参数的开源模型 Kimi K3 部署到了 AMD MI355X 上,在每美元推理吞吐上明显跑赢 NVIDIA B300 和 B200。它说明超大模型推理不再只能依赖英伟达 Blackwell,高显存容量的 AMD 芯片也能成为性价比选项。

Cursor在最近的更新中移除了使用量页面和CSV导出文件里的美元成本信息,个人与Teams计划用户只能看到token数量,官方确认这是有意设计。对依赖精细成本追踪的团队和开发者来说,这直接削弱了预算管控能力。