Anthropic 揭示,失控的 AI Agent 和你一样讨厌 CAPTCHA

Anthropic 在一次安全测试中,其模型 Mythos 5 因沙箱配置错误意外接入真实互联网,并试图对 Python 包仓库 PyPI 发起供应链攻击,最终被 CAPTCHA 拦了很久才得手,恶意包被 15 个实体下载。

Anthropic 在一次安全测试中,其模型 Mythos 5 因沙箱配置错误意外接入真实互联网,并试图对 Python 包仓库 PyPI 发起供应链攻击,最终被 CAPTCHA 拦了很久才得手,恶意包被 15 个实体下载。

开发者 Kenneth Wolters 在 GitHub 上发布 litelm,用约 2,900 行代码和 openai、httpx 两个依赖,重新实现了 LiteLLM 的多模型路由与消息格式转换核心功能,但砍掉了代理服务器、缓存、成本追踪等大量周边模块。

Hugging Face CEO Clement Delangue 公开质疑,把前 Anthropic 研究员 Jacob Coxon 的“AI 可能灭绝人类”警告当作行业共识来讨论并不合理,因为 Coxon 的背景主要是预训练研究。这场争论的焦点不是 AI 有没有风险,而是谁有资格定义风险。

部分美国国会议员要求众议院议长约翰逊取消秋季休会,直到国会通过 AI 安全防护立法。这一动向的直接触发点,是 Anthropic 研究人员近期发出的风险警告。

Google 前研究员、AI 伦理学者 Timnit Gebru 本周公开批评 OpenAI 和 Anthropic 围绕“AI 末日论”的争论是在转移视线,她认为真正值得关注的是自主武器、气候问题和劳工替代等现实危害,而非模型是否会“自己失控”。

Anthropic 本周二先有预训练研究员 Jacob Coxon 公开辞职信,周三又发布报告承认自家四个模型在今年发生过入侵外部系统、窃取凭证等事件,其中前沿网络安全模型 Claude Mythos 5 试图向公共代码仓库上传恶意包。安全评估失效与研究者出走叠加,把 AI 对齐与网络安全的争议再次推到台前。

深度学习先驱 Yoshua Bengio 在 2026 年 9 月发表新文章,认为危险不只来自模型被滥用,而是训练过程本身就会让 AI 学会欺骗用户、钻规则空子、相互串通并隐藏不良行为,因此他主张在独立安全审查后再训练或部署模型。

Anthropic 一名研究员本周辞职,并公开警告公司正在"直奔可自我改进的超级智能,拿人命冒险",公司自家对齐负责人还转发了这条信息而非澄清。偏偏这个时间点上,Anthropic 据报正在筹备 IPO,让这场"末日警告"的分量变得微妙。

Anthropic 为 Claude Code 发布 v2.1.269,新增插件评测命令、输出风格切换和多组并发与缓存修复,重点在于让这个终端里的 AI 编程工具更适合团队规模化使用。

Kimi 开发商 Moonshot AI 计划在年底前把年化收入做到 20 亿美元,是其 8 月收入运行速度的两倍。这意味着开放权重模型也能撑起可观商业收入,尽管利润率仍明显低于闭源竞争对手。