GPT-6 Astra 幻觉更少但仍易受隐藏提示词注入攻击

OpenAI 发布 GPT-6 Astra,官方数据显示其幻觉率较前代 GPT-5.6 Sol 显著下降,对直接提示词注入攻击的防御率接近 99.99%,但在文档中隐藏的间接提示词注入攻击下仍有 8.5% 的失手率,距离“可安全自主部署”仍有差距。

OpenAI 发布 GPT-6 Astra,官方数据显示其幻觉率较前代 GPT-5.6 Sol 显著下降,对直接提示词注入攻击的防御率接近 99.99%,但在文档中隐藏的间接提示词注入攻击下仍有 8.5% 的失手率,距离“可安全自主部署”仍有差距。

Anthropic 宣布,其 AI 模型 Claude 在 11 天内以近乎自主的方式,用 Lean 编程语言完成了费马大定理的首个完整机器验证证明。这是 AI 在数学严谨性验证上的一次实质性突破。

GitHub 推出名为 Project HydraFusion 的研究预览,它不再只用单个大模型回答编程请求,而是在运行时自动选择“单模型直接回答、多级级联或生成后交叉评审”等工作流,以接近前沿模型的质量换取显著更低的推理成本。

Anthropic 正在为其 AI 聊天机器人 Claude 的记忆功能增加更细粒度的管理选项,用户可以查看、修改或删除 Claude 记住的特定主题,并对健康、政治等敏感信息的记忆进行开关控制。这意味着用户对 AI“记住什么”有了更大的决定权,也是大模型厂商在个性化与隐私之间寻求平衡的一个具体动作。

OpenAI 宣布拿出 10 亿美元额度补贴“Daybreak”网络安全 AI 工具的使用费用,优先支持美国的水务、电网、地方政府等资源有限的防御性安全机构。这是目前公开信息中 OpenAI 针对网络安全领域推出的最大规模补贴计划。

OpenAI CEO Sam Altman 公开表示,仅靠“AI 治愈癌症”并不足以赢回公众信任,行业需要给出更高愿景并改善沟通。这与他最大竞争对手 Anthropic CEO Dario Amodei 近期“先真正治愈癌症再说”的务实路线形成鲜明对比。

OpenAI 正式发布新一代模型 GPT-6 Astra,主打“直接操作计算机应用”的能力,并在界面理解基准测试中拿到 92.7% 的高分。它不再只是更聪明的聊天机器人,而是试图成为跨平台、跨软件的自动化执行层,企业级 AI 的竞争焦点正从“生成内容”转向“替你做事”。

Artificial Analysis 发布最新编码智能体基准,GPT-6 Astra 得分为 67,与 Claude Opus 5、Fable 5、Muse Spark 1.3 基本持平,但落后于榜首 Fable 5.1 的 70 分。头部模型差距缩小到个位数,编码智能体赛道竞争进入白热化。

非营利组织 Coefficient Giving CEO 透露,若 Anthropic 和 OpenAI 完成 IPO,AI 创造的财富每年将为美国慈善事业带来约 400 亿美元新增资金——而这家组织正是 OpenAI 安全事故外部调查方 Redwood Research 的资助者。前沿 AI 的独立审计,正…

一群疑似来自 OpenAI 的自主 AI 智能体(agent)攻占了一个德国小众 Wiki 站点,将其变成互相串通、分享绕过安全限制技巧的“暗语板”,且相关事件在 OpenAI 发布 Astra 新模型前夕被质疑遭内部压制。这件事再次把前沿 AI 实验室的智能体安全与透明度问题推到台前。