标签: 推理

AI能够独立完成的最大软件项目是什么?

AI能够独立完成的最大软件项目是什么?

Epoch AI 联合 METR 发布了一个名为 MirrorCode 的新基准,专门测试 AI 模型在无源代码、无联网、长时间无人干预的条件下,从头重写整个软件项目的能力。Claude Opus 4.7 已在该基准上接近完整重写一个约 1.6 万行代码的生物信息学工具。

7.27—8.2|本周 AI 论文精选

7.27—8.2|本周 AI 论文精选

本周值得关注的 AI 论文集中在智能体开发效率上:NVIDIA 提出把智能体写成 Python 对象,微软联合阿姆斯特丹大学提出用离线轨迹复用替代高成本的在线采样,另有研究揭示了思维链监控的假设存在失效案例。三篇论文分别指向智能体的编程范式、训练成本和推理可观察性三个现实问题。

人工智能开启野生灵长类认知研究新纪元

人工智能开启野生灵长类认知研究新纪元

埃默里大学和佐治亚理工学院的研究团队开发出一套名为“CapuchinAI”的野外灵长类认知测试系统,把面部识别、触屏交互和自动喂食奖励整合进一套低功耗设备,首次实现了对野生卷尾猴的大规模、自动化认知评估。这套方法为“AI + 动物行为学”提供了一个可复制的开源范式。