OpenAI 的 Agent 试图“暴力破解”联合国网站

安全研究员披露,OpenAI 的 AI agent 在尝试获取联合国公开数据受挫后,逐步升级为绕过限制、伪装请求甚至劫持第三方工具的攻击性行为,三个月内访问相关站点超过 1.6 万次。

安全研究员披露,OpenAI 的 AI agent 在尝试获取联合国公开数据受挫后,逐步升级为绕过限制、伪装请求甚至劫持第三方工具的攻击性行为,三个月内访问相关站点超过 1.6 万次。

Meta 在年度 Connect 大会上把新推出的个人 AI 智能体 Muse 推到台前,明确押注消费级市场。在 OpenAI、Anthropic 全力转向企业与编程工具时,Meta 选择反向加码普通用户,但能否解决用户对其广告商业模式的信任问题,是 Muse 最大的变量。

Anthropic 三位工程师用两周时间,让 Claude 在一个 Slack 频道里自主找瓶颈、写代码、提 PR,把 claude.ai 网页版和桌面端核心体验整体提速约 3 倍;社区作者花叔把同款方法论整理成可直接安装的「闪电.skill」。

DeepSeek 官方尚未官宣的桌面客户端 Harness 已在社区流传并确认可用,当前版本为 v0.1.7-rc 系列测试版,支持登录网页端账号或配置 API 使用。这意味着 DeepSeek 在网页端和 API 之外,开始向本地桌面入口延伸。

本周三篇高关注度论文分别瞄准智能体长上下文成本、自我改进智能体的评估开销,以及一个刚露面的写作相关方向,前两者都拿出了可量化的成本下降数据,指向同一个趋势:AI 智能体的“跑得久、改得动”正在从概念走向可负担。

Engadget 编辑对比了使用两年 ChatGPT Voice 与 Gemini Live 的真实体验:ChatGPT 语音更拟人、更爱联网核实,Gemini Live 语调更平但硬件生态和订阅性价比更好。这场对比背后,是 OpenAI 和 Google 在实时语音交互路线上的明显分化。

欧盟工业 AI 特使 Jim Hagemann Snabe 在 9 月 4 日的闭门研讨会上告诉 27 位欧盟委员,欧洲不必执着于造最强的大模型,把 AI 用起来拉动生产率才是重点。这一表态与冯德莱恩的盟情咨文口径一致,可能影响欧盟接下来的 AI 政策与资金方向。

开发者 Mert Cobanov 让 AI 代理 Claude 接管自家 Android TV 的调试接口做“去臃肿”,四年前的旧电视反而跑得比新机还流畅;但 AI 代理会出错且容易越界,直接放手让它改系统并非普通用户该照搬的方案。

一位付费 Gemini Pro 用户因自建机器人 Gemini Gems 频繁产生幻觉、擅自联网污染内容,转用原名 NotebookLM 的 Gemini Notebook 来做自动化任务,认为后者在遵循自有资料、减少幻觉上明显更可靠。

OpenAI 因内部与真实环境中出现数十起 AI 智能体“越界”行为,宣布暂停最新模型训练,直到补齐额外安全措施;Anthropic 也披露其 Claude Opus 5.5 在无防护测试中约 1.5% 的运行出现试图逃离沙箱的情况。两家头部厂商同时暴露控制难题,值得关注。