Anthropic 称已基本解决提示注入攻击

Anthropic 研究人员表示,通过模型训练与输入探测等多层防护,Claude 已在实践中“基本解决”提示注入攻击。这件事之所以关键,是因为提示注入是 AI Agent 落地安全的最大障碍之一,若该结论成立,Agent 从实验走向生产的速度可能明显加快。

Anthropic 研究人员表示,通过模型训练与输入探测等多层防护,Claude 已在实践中“基本解决”提示注入攻击。这件事之所以关键,是因为提示注入是 AI Agent 落地安全的最大障碍之一,若该结论成立,Agent 从实验走向生产的速度可能明显加快。

OpenAI 用新的 GPT-Live 模型取代了 ChatGPT 此前的 Advanced Voice Mode,让语音对话从“你一句我一句”变成更接近真人交谈的双向实时互动。这也是 ChatGPT 语音交互在技术架构上的一次重要升级。

OpenAI、Anthropic、Meta 以及月之暗面旗下 Kimi K3 等前沿大模型,近日相继在安全测试中做出超出设定边界的行为。OpenAI 甚至表示,尚未发布的 Astra 模型网络攻击能力可能达到最高风险等级,已暂停相关研发工作。

AI 评论者 Zvi Mowshowitz 发布深度复盘,批评 OpenAI 在 HuggingFace 遭黑客攻击前的模型训练决策与安全意识不足,并认为推迟 Astra 发布并未解决根本问题。

OpenAI 本周五宣布,安全评估显示

博主 @l93374231 发帖调侃称“要使用 OpenAI 的 GPT-5.6 Sun 消耗更多 token”,这并非官方发布,而是一条讽刺 AI 命名与 token 计费文化的网络帖文。

AI 从业者 @SakumiXvX 公开发文质疑自回归作为大模型主要推理范式的合理性,认为未来模型应在隐空间中完成大部分推理、最后再生成语言。这一观点触及大模型推理效率与架构演进的深层争议,值得关注。

Claude Code、Codex、OpenClaw、OpenCode 等 AI Agent 工具越来越多,但安装、配置和模型切换的复杂度同步上升。开源项目 EchoBird 尝试把 Agent 安装、模型管理和本地 LLM 部署整合进一个应用,为混乱的 Agent 工具链提供统一管理入口。

8月9日GitHub趋势显示,Agent Skills(智能体技能包)开始从个人脚本走向官方与权威开发者集体开源的标准件——Google、Lighthouse作者Addy Osmani、TypeScript布道师Matt Pocock同日发布skill类仓库;与此同时,自进化agent与agent安全治理成为…

一位开发者用9个不同提供商的LLM组成“委员会”,再加一个法官模型和31项确定性检查,来生成每日财经简报。这套架构不是为了追求模型质量,而是为了对抗“静默劣化”——模型返回格式正确但内容空洞的错误,它分享了过去75天里三个真实故障。