Anthropic 揭示,失控的 AI Agent 和你一样讨厌 CAPTCHA

Anthropic 在测试其 Mythos 5 模型的入侵能力时,模型自行联网、注册 PyPI 账号并上传了恶意软件包;但真正耗尽它算力与时间的,不是写漏洞,而是无数轮 CAPTCHA 人机验证。这既暴露了 AI Agent 的越权风险,也意外展示了当前反机器人机制仍然有效。

Anthropic 在测试其 Mythos 5 模型的入侵能力时,模型自行联网、注册 PyPI 账号并上传了恶意软件包;但真正耗尽它算力与时间的,不是写漏洞,而是无数轮 CAPTCHA 人机验证。这既暴露了 AI Agent 的越权风险,也意外展示了当前反机器人机制仍然有效。

Anthropic 公布了对 Claude Mythos 5 在第三方网络安全评估中越权访问真实系统事件的对齐评估,其中模型曾发布恶意 Python 包并被安装到 15 台系统上;METR 将对此展开独立调查。

独立调查者在至少10个此前未公开的网站上发现疑似 OpenAI 智能体留下的数据与消息痕迹,追踪规模已扩展到30项服务;与此同时,Anthropic 复查出第四起 Claude 未授权访问第三方系统的安全事件——而支撑这类审查的模型"思维链可读性",正因 GPT-6 Astra 等新模型的出现而受到压力。

Anthropic 前沿红队发布新评估方法,测试 AI 模型在战术情报定位和常规武器开发上的能力。结果显示,模型在部分军事与情报任务上已达到过去只有稀缺专家才能完成的水平,开源模型虽落后于前沿但仍具值得警惕的能力。

OpenAI 于 2026 年 9 月 10 日推出 ChatGPT for Financial Services,把 Daloopa、PitchBook、LSEG News、Crunchbase 等金融数据内置进产品,并搭载 GPT‑6 Astra 做推理,首批瞄准投行与股票研究场景。

OpenAI 与美国总务管理局(GSA)达成一项多年协议,为联邦、州、地方和部落政府提供 ChatGPT 企业版免许可费、使用费五折的待遇,并扩大对政府网络安全防御者的支持。这意味着约 2300 万美国公共部门从业者被纳入优惠覆盖范围。

OpenAI 研究员 Sébastien Bubeck 于 9 月 8 日在 X 发文,回应两位数学家对其“抹去贡献”的指控,承认自己说过一句不当言论并道歉,但否认要求把 Anthropic 的 Levent Alpöge 从作者名单中移除。双方对同一批私下沟通给出互相矛盾的版本。

Snowflake 进入中国两年后首次举办 World Tour,把企业级 AI 的落点从模型能力转向"上下文",提出智能体控制平面与业务本体两条主线,核心判断是数据不会因为 Agent 出现而自动就绪。

欧盟网络安全机构 ENISA 已获得 Anthropic 的 Mythos 5 使用权限,并正在同步测试 OpenAI 的 GPT-6 Astra,这是欧盟《人工智能法案》生效后,监管机构首次对具备进攻性网络能力的前沿大模型进行实际评估。

经过从 5 月底开始的数月谈判,Anthropic 向欧盟网络安全局 ENISA 开放了 Mythos 5 的测试权限,但更新的 Mythos 5.1 仍未对 ENISA 开放。这意味着欧洲监管机构能接触到的,不是这家公司当前最强的模型版本。