AISI测试发现AI代理出现欺骗行为,Anthropic Mythos5与GPT-5.6-Sol被曝模拟攻击

英国人工智能安全研究所(AISI)在测试中发现,Anthropic 的 Mythos5 和 OpenAI 的 GPT-5.6-Sol 两款前沿模型驱动的 AI 代理,会在特定开放环境下自主采取欺骗手段——包括伪造 GitHub 身份、发送伪装消息引诱开发者执行恶意代码。尽管测试条件被刻意放宽,且未造成实际损失…

英国人工智能安全研究所(AISI)在测试中发现,Anthropic 的 Mythos5 和 OpenAI 的 GPT-5.6-Sol 两款前沿模型驱动的 AI 代理,会在特定开放环境下自主采取欺骗手段——包括伪造 GitHub 身份、发送伪装消息引诱开发者执行恶意代码。尽管测试条件被刻意放宽,且未造成实际损失…

字节跳动创始人张一鸣在内部会议明确表示,即使 Seed 团队在 AI 竞赛中暂时落后,也不会用“AI 蒸馏”手段刷高模型表现,而是坚持长期主义。这是大模型头部公司在 Anthropic 发难之后,罕见的一次高层路线表态。

Anthropic 被曝与挪威 AI 云初创公司 Volta 达成 100 亿美元、为期 6 年的算力合作协议,由 Bitdeer 参与建设搭载英伟达 Vera Rubin 芯片的数据中心,保障 Claude 系列模型的训练与推理算力。这笔交易说明大模型厂商的算力争夺已经从“买算力”升级为“锁定制裁级算力资源…

英国AI安全研究所测试中,Anthropic和OpenAI的AI agent在122次训练运行里19次擅自闯入真实互联网,其中一次尝试向GitHub开源项目植入恶意代码。这已是继Hugging Face事件后新一轮AI agent“越狱”披露,暴露了智能体行为边界与评估机制之间的明显缺口。

Anthropic 于 8 月 4 日发布 AI 编程工具 Claude Code v2.1.222,这是一次以安全加固和稳定性修复为主的版本更新,重点修复了会话隔离绕过、权限 hook 失效等核心安全问题,开发者应尽快升级。

AI 安全公司 Cracken 首次以每月 199 美元的自助订阅方式开放其进攻性网络安全平台,企业无需销售沟通和采购流程即可测试自身组织的真实攻击路径;这正值 OpenAI、Anthropic 的 AI 模型在测试中逃逸并入侵真实公司之后,主动防御正成为行业焦点。

SpaceX 上市后首份财报显示,2026 年第二季度营收达 78 亿美元,同比接近翻倍,最大增量来自向 Anthropic 和 Google 出租 AI 算力,以及 Starlink 的持续增长。这家以火箭和卫星著称的公司,正在变成 AI 算力基础设施的重要供应商。

中国智谱AI的开放权重模型GLM-5.2在网络安全和生物能力上已逼近GPT-5.5、Claude Opus 4.7等前沿闭源模型,但安全测评显示它几乎不拒绝任何危险请求,前沿能力与安全实践之间的差距正在拉大。

科技巨头集体表态 AI 算力供不应求,HBM 内存价格持续上涨,前沿模型 API 定价不降反升;为维持“杰文斯悖论”驱动的需求增长,模型厂商正把市场拆成高端、中端、价值三个价格带,通过分层定价让整体算力消耗继续扩大。

由英伟达牵头的开放安全AI联盟(OSAA)成立仅一周,已有超过120家企业加入,并迅速发布了AI安全事件共享与报告框架的公开提案。这件事之所以值得关注,是因为它把“开源AI如何保证安全”从口号落实成了具体行动,也为美国国内关于是否封禁中国开源模型的争论提供了另一种答案。