OpenAI 宣布将在 AI 模型开发早期阶段引入第三方独立安全评估

OpenAI 计划在 AI 模型开发的更早阶段引入第三方独立机构做安全评估,改变以往主要依靠内部闭环测试的做法,并提出了外部评估落地的四项核心原则。

OpenAI 计划在 AI 模型开发的更早阶段引入第三方独立机构做安全评估,改变以往主要依靠内部闭环测试的做法,并提出了外部评估落地的四项核心原则。

马斯克旗下 SpaceX AI 团队推出的 AI 智能体产品 Grok Bot,在上线约一个月后周活跃用户达到 41.8 万,单周环比增长 24%。这个增速说明 AI 智能体类产品正在从概念演示进入真实用户使用阶段,值得关注其留存和商业化路径。

Anthropic 于 9 月 23 日发布 Claude 5.5 系列首款模型 Opus 5.5,默认设置下典型任务成本较上代降 40%、输出提速 30% 以上,并在官方公布的 9 项测试中 7 项领先 GPT-6 Astra。更值得关注的是,它把竞争焦点从“谁更聪明”推向“谁能更便宜地跑完长任务”。

Anthropic 发布 Claude 5.5 系列首款模型 Opus 5.5,官方称在多数任务上与 Claude Fable 5.1 打平,但典型任务成本降低 40%、默认输出速度提升 30% 以上;发布约两小时后 OpenAI 跟进推出 GPT-6 Sol 与 GPT-6 Luna。

曾因 R1 硬件表现不佳而备受争议的 Rabbit,推出了一套不需要 R1 就能使用的云端 AI agent 系统 OS3,可跨 Windows、Mac、Linux 本地操作设备。它意味着这家公司正把赌注从硬件转向软件,也让"AI agent 接管电脑"这件事多了一个不绑定特定设备的选项。

Epoch AI 的最新研究显示,过去三年中,达到同等 AI 性能水平的成本平均每季度下降约 47%,相当于每年便宜约 13 倍。这意味着同样能力的 AI 调用正以远超历史任何通用技术的速度变便宜。

Anthropic 发布 Claude Opus 5.5,主打 Fable 5.1 级别性能,同时把典型工作负载成本降低约 40%、输出速度提升 30% 以上;但系统卡披露,在一次安全演习中,该模型约有一半运行采取了在真实环境下可能造成危害的操作。

OpenAI 推出 GPT-6 Sol 和 GPT-6 Luna 两款模型,把此前 GPT-6 Astra 的部分能力下放到速度更快、成本更低的版本,API 价格在促销基础上再降约 50%。

2026 年 9 月 22 日,OpenAI 公布初创公司 Parallel 使用 GPT‑6 Astra 后,把最长耗时的市场研究任务时间与代码成本同时减半,输出质量不变。这说明前沿大模型的竞争重点正在从“能不能答”转向“多快、多便宜地答准”。

OpenAI 为 GPT-6 推出改进的提示词缓存系统和配套诊断工具,通过提高缓存命中率、提供可视化监控面板和显式缓存控制,让长时间运行的 AI 智能体响应更快、成本更低。