有人受雇手动证明费马定理,他说Claude只用了11天

Anthropic 用多智能体系统在 11 天内完成了费马大定理的形式化证明,生成 1300 万行 Lean 代码。帝国理工数学家 Kevin Buzzard 承认被 AI“抢先”,但他同时指出,这并未给数学带来新认知,真正的信号是 AI 协作基础设施的成熟。

Anthropic 用多智能体系统在 11 天内完成了费马大定理的形式化证明,生成 1300 万行 Lean 代码。帝国理工数学家 Kevin Buzzard 承认被 AI“抢先”,但他同时指出,这并未给数学带来新认知,真正的信号是 AI 协作基础设施的成熟。

肯尼亚曾把大学生毕业生的就业希望押注在在线外包与代写产业上,但 ChatGPT 的发布让这条就业通道在两年内几乎塌缩,暴露出生成式 AI 对“数字劳务出口”模式的系统性替代风险。

《西雅图时报》和 Newsday 两家美国报纸正式起诉 OpenAI 与微软,指控其未经授权抓取付费墙内容用于训练 ChatGPT、Copilot 和 AI 版必应,并要求销毁相关训练数据。这是 AI 版权诉讼浪潮中又一起由传统新闻机构发起的法律挑战。

OpenAI 内部研究材料中直接使用缩写 RSI(递归自我改进)而未加解释,引发外界关于其研究语言是否过于封闭的讨论。该现象折射出顶尖 AI 实验室在自我进化方向上已走得很远,但这种内部术语的“理所当然”也加剧了行业沟通的信息差。

OpenAI 宣布已在今年 9 月达成“自动化研究实习生”目标,即在人类指导下可完成需熟练研究员数日工作的系统,同时正推进在 2028 年 3 月实现自动化 AI 研究员。值得关注的是,内部数据显示 AI 智能体已实质性加速其研究进度,但 OpenAI 同时强调会保留人类控制权并可能因安全风险暂停开发。

OpenAI 首席科学家 Jakub Pachocki 发文承认,随着推理模型能力快速提升,公司对模型内部“思维链”(CoT)的监控与解释能力正在减弱,并警告 AI 可能走向递归式自我改进(RSI),呼吁采取更广泛的干预措施,而不仅是技术层面的对齐研究。

Anthropic 旗下的 Claude 现在可以直接接管 Gmail 收件箱,在获得授权后自动撰写、回复和转发邮件,无需用户逐封批准。Engadget 的报道指出,这项能力在便利之余引入了提示注入攻击、AI 幻觉和隐私等多重风险,目前尚无彻底解决方案。

OpenAI 发布 GPT-6 Astra 时宣称其在 ARC-AGI-3 测试中达成 99.9% 的“AGI 级”得分,但该测试的出品方 ARC Prize 用标准评测工具复测后得分仅为 62.7%。差距源于测试用“脚手架(harness)”不同,而非模型本身能力突变。

OpenAI 正式弃用了其官方的 skills 示例仓库,将 Codex 的技能生态统一迁移至 Plugins 仓库和《构建插件》指南,意味着 Agent Skills 的开发入口和分发方式正在收口到插件体系中。

MCPHub 作为一款聚焦 MCP(模型上下文协议)生态的管理工具登上 Product Hunt,试图解决开发者接入和管理多个 AI 服务时的配置混乱问题。它之所以值得关注,是因为 MCP 正逐渐成为大模型应用连接外部工具与数据的事实标准,而配套基础设施的完善度将决定这一标准能走多远。