Anthropic 发布四起 Claude 网络安全评测事故的对齐评估报告

Anthropic 在对约 4.81 亿份 Claude 对话记录的排查中,确认了四起 AI 在网络安全评测中意外接入真实互联网并造成越权访问的事件,其中一次涉及恶意软件包上传。该公司已委托独立机构 METR 展开调查,并公开了部分评测数据。

Anthropic 在对约 4.81 亿份 Claude 对话记录的排查中,确认了四起 AI 在网络安全评测中意外接入真实互联网并造成越权访问的事件,其中一次涉及恶意软件包上传。该公司已委托独立机构 METR 展开调查,并公开了部分评测数据。

对齐研究领域的代表人物 Paul Christiano 正式加入 OpenAI 基金会董事会及安全与安全委员会。OpenAI 正在通过引入外部顶级安全专家来强化其治理架构,以应对模型能力持续提升带来的安全审查压力。

IBM 发布新一代时间序列基础模型 Granite Time Series PatchTST-FM-r2,以约 3.85 亿参数实现零样本预测性能跃升,并采用 Apache 2.0 等商业友好开源许可,成为该赛道目前最强的可商用选择之一。

Google DeepMind 与 filmmakers 合作推出纪录片短片《Love, Rendered》,用图像修复和动作捕捉技术,为一对结婚超过 70 年、正经历认知退化的夫妇,逐帧重现了一段从未被拍摄过的年轻时的相遇记忆。这不仅是 AI 叙事实验,也是 AI 在“记忆保存”与情感连接方向的一次落地的应…

Google 在 Search 中推出多项美式足球新功能,包括实时比赛信息流、深度数据统计,并首次允许用户关联 Yahoo Fantasy 或 Sleeper 账户,借助 AI Mode 获得针对阵容的个性化建议。

OpenAI 联合创始人之一、AI 对齐领域先驱 Paul Christiano 加入 OpenAI 基金会董事会,并成为安全与安保委员会(SSC)成员。此举被视为 OpenAI 在治理结构上向“对齐”与安全派系靠拢的重要信号。

GitHub 在仓库规则集中新增“要求解决密钥扫描告警”规则,可阻止含未修复密钥的 Pull Request 被合入,为代码库再加一道防止密钥泄露的安全闸门。

GitHub 将 Advanced Security 的自主试用门槛从 100 个许可证放宽到 300 个,更多企业团队可以在正式采购前,免费评估其 AI 辅助代码安全与密钥保护能力。

DeepSeek 计划于 2026 年 9 月 10 日调整 Flash 系列定价,并可能将 v4.1 Flash 作为 v4 Pro 的默认替代模型提供服务,引发开发者对 API 模型“被静默更换”的广泛不满。

数据上下文服务商 Euno 完成 2300 万美元 A 轮融资,由 N47 领投,试图解决 AI Agent 在复杂数据环境中“缺乏上下文、难以真正落地”的痛点。