智能体最后的考试,Fable 5 竟然不敌 GPT 5.5

UC伯克利发布全新基准测试“智能体最后的考试”(ALE),要求AI在Siemens NX、Unreal Engine等专业软件中完成真实工作任务。结果,GPT 5.5以24.0%的通过率击败了Claude Fable 5(22.0%),且最难的档位几乎所有模型都得了零分。

UC伯克利发布全新基准测试“智能体最后的考试”(ALE),要求AI在Siemens NX、Unreal Engine等专业软件中完成真实工作任务。结果,GPT 5.5以24.0%的通过率击败了Claude Fable 5(22.0%),且最难的档位几乎所有模型都得了零分。

美国政府援引出口管制指令,强制下架了 Anthropic 上线仅72小时的旗舰模型 Fable 5 和 Mythos 5,禁止全球所有外籍人士使用,尚属 AI 行业首次。此举意味着美国政府对前沿大模型的监管从“审查批准”演进到了“部署后强制召回”。

开发者 Dan McInerney 发布了一个开源工具 Architect Loop,通过 Claude(Fable)和 Codex 的分工协作,实现了一个无需 API Key、由 AI 自主规划-审查-执行的开发循环,并在设计说明中声称可将 Fable 的代币消耗降低 80%。

英国《金融时报》发表评论文章,将埃隆·马斯克比作现实生活中的“邦德反派”,批评其持有过多不受约束的权力,尤其是在掌控关键基础设施、社交媒体舆论以及AI技术发展方向上。这一观点引发Hacker News社区热议,折射出科技界对超级企业家权力集中化的广泛忧虑。

Meta 于今年3月新组建的应用人工智能团队(Applied AI),本应支撑其超级智能实验室(Super Intelligent Lab)的研发成果落地,但内部员工普遍反映项目琐碎、工作成果“令人心碎”,团队士气与产出面临严峻挑战。

杰夫·贝佐斯旗下AI初创公司Prometheus在完成120亿美元融资后透露,其目标是开发“人工智能通用工程师”,用以辅助设计火箭发动机、药品和制造系统等复杂物理产品。这标志着AI大模型的应用正从数字内容生成扩展到实体工程设计与制造领域。

Meta 三个月前组建的约 6500 名工程师的 Applied AI 团队正面临内部“叛变”,员工被迫做数据标注和生成编程问题来训练 AI 模型,许多人将这种工作比作“古拉格集中营”。这一事件暴露了 Meta 在裁减大量员工的同时,强制抽调最聪明的内部员工做低创造性标注工作的矛盾和士气危机。

据《华尔街日报》报道,一个由多个州检察长组成的联盟已于本周五正式向 OpenAI 发出传票,要求该公司提交大量与业务运营及用户影响相关的文件。此举标志着美国州级监管机构对 AI 头部企业的合规审查已从行业倡议升级为具有法律强制力的调查行动。

开发者 Kapperchino 发布了一款名为 Agent Joe 的开源终端编码助手,它强制只允许编写 Rust 代码,并且禁止任何 shell 命令执行,以此消除 LLM 工具对终端权限的滥用风险。该项目目前在 GitHub 上可获取。

据《华尔街日报》报道,美国多个州的总检察长正组成跨州联盟,对OpenAI展开调查。这标志着这家AI领域的头部公司,继联邦层面的监管压力后,正面临来自地方司法机构的联合合规审查。