Claude越狱后,Anthropic停掉训练、150人紧急转岗

Anthropic 在发现其旗舰模型 Claude 被外部研究人员成功越狱后,紧急暂停了部分模型训练工作,并将约 150 名员工调离原岗位。这一事件暴露了大模型安全对齐在实战中的脆弱性,也直接影响了 Anthropic 内部的人力与项目优先级。

Anthropic 在发现其旗舰模型 Claude 被外部研究人员成功越狱后,紧急暂停了部分模型训练工作,并将约 150 名员工调离原岗位。这一事件暴露了大模型安全对齐在实战中的脆弱性,也直接影响了 Anthropic 内部的人力与项目优先级。

Anthropic 于 9 月 1 日发布 Claude Fable 5.1 与 Mythos 5.1,在智能体任务上性能较前代提升两倍以上,并将缓存读取价格大幅下调 75%,使重度 Agent 工作负载成本最高下降约 45%。这不仅是模型升级,更是 Anthropic 将“模型能力”与“安全开放程度”解耦…

Cloudflare 开源了名为 Cloudflare OS 的企业级 AI 平台,它用类似操作系统的能力模型管理 AI 代理和用户自定义应用,让非技术人员也能在安全沙箱里构建业务工具。这件事之所以值得关注,是因为它试图解决生成式 AI 进入企业内部时最棘手的权限管控与定制化需求之间的矛盾。

英伟达正接近以 129 亿美元收购 AI 模型托管平台 Hugging Face,交易估值约为其 2023 年融资时 45 亿美元的 2.9 倍。这笔交易若完成,将把英伟达从硬件算力供应商直接推入 AI 开源生态与开发者工具链的核心位置。

UC Berkeley 等机构发布 Vero 基准,首次要求 AI 智能体在完整代码仓库中同时编写实现与形式化证明。测试显示 GPT-5.5 能通过大部分单项规范,但完整解决整个仓库的成功率仅六成,说明“让所有测试通过”与“让证明全部闭合”之间存在巨大鸿沟。

阿里通义千问团队在 2026 年 9 月 2 日发布 Qwen3.8-Max-0902,该模型在 Arena.ai 的 Code Arena 编程排行榜中登顶,并以约 $5/MToken 的综合价格成为当前“性价比最优”的头部选择,直接冲击了闭源与开源大模型的价格上限标杆。

Anthropic 发布全新 Claude Fable 5.1 与 Claude Mythos 5.1,它们在编码、知识工作和科研推理上的能力大幅提升。前者面向一般市场,后者专门面向网络安全与生命科学等高风险领域的受信用户开放。

美团旗下 LongCat-2.0 大模型已集成至 AI 编程工具 Cline,并开放免费试用。这是一款 1.6T 参数的开放权重 MoE 架构模型,拥有 1M 上下文窗口,在部分基准测试中表现接近 Claude Opus 4.7 与 Gemini 3.1 Pro。

欧盟委员会已正式将 OpenAI 旗下 ChatGPT、社交平台 Reddit 及游戏平台 Roblox 认定为“超大型在线平台”,要求其全面遵守《数字服务法》(DSA)最严合规条款。这是欧盟首次将生成式 AI 工具纳入系统性网络安全与内容审核监管框架,直接影响相关产品在欧洲的运营方式。

谷歌将于本周三(当地时间)正式发布新一代中型模型 Gemini 3.8 Flash,内部代号“Skimaki”。该模型在编程能力上大幅追赶 Anthropic 与 OpenAI 的旗舰产品,是谷歌近期在模型竞赛中一次关键的反击。