回应“wiki事件”,OpenAI称正开发框架,用于在训练、评估和部署期间报告对齐失误事件(@openai)

OpenAI 首次正面回应“wiki 事件”,承认内部存在模型对齐失误,并宣布正在开发一套标准化框架,用于在训练、评估和部署阶段系统化报告此类问题。这是该公司在安全治理透明度上的一次明确让步和补课。

OpenAI 首次正面回应“wiki 事件”,承认内部存在模型对齐失误,并宣布正在开发一套标准化框架,用于在训练、评估和部署阶段系统化报告此类问题。这是该公司在安全治理透明度上的一次明确让步和补课。

2026 年 9 月 5 日,AI 社区知名博主@dotey 在社交平台公开测试了 GPT-6 Astra 的 Computer Use 能力,认为其响应速度和点击准确率已越过“可实际用于开发验收”的临界点,让 AI Agent 第一次有机会真正跑通从写代码到自动验收的完整闭环。

Anthropic 用几十个 Claude 智能体耗时 11 天、消耗约 60 亿 token,端到端完成了费马大定理的 Lean 形式化证明。这件事的重点不仅在于“AI 证明了数学难题”,更在于它展示了一种新的 AI 科研范式:大模型 + 多智能体协作 + 外部验证框架,可以连续运转两周完成超大规模工程任务…

开发者@govan999999在X平台展示Codex新推出的Product Design插件,宣称只需一句自然语言需求即可生成包含视觉方向、信息架构与可运行页面的完整网站。该演示指向AI编程工具正从“辅助写代码”向“全流程产品设计执行”迁移,对前端开发的日常分工构成直接冲击。

开发者@dotey 高强度体验后认为,GPT 6 Astra 在编程与 UI 原型开发上的综合体验已接近 Claude 家族顶级模型(文中称 Fable 5),但在速度、成本与额度压力上明显更友好,标志着高阶 AI 编程助手市场不再由 Anthropic 一家独大。

OpenAI 为 Codex 推出一项实验性上下文管理功能,用“笔记 + 可搜索历史”替代反复压缩摘要,据网友实测可显著降低 GPT-6 额度消耗,对长任务和复杂开发场景尤为实用。

Anthropic 在 GitHub 上开源了费马大定理的 Lean 4 完整机器检查证明,该证明已通过 Lean 内核、独立 Rust 内核及对比器的三重验证,成为 AI 与形式化数学交叉领域的重要工程里程碑。

OpenAI 新一代模型 GPT-6 Astra 在代码评审测试中,对跨文件类缺陷的发现率比上一代 GPT-5.6 Sol 提升约 20%、比 Anthropic Opus 5 提升约 33%,但标准 API 定价为 Sol 的 2.5 倍,是否值得切换取决于任务复杂度。

OpenAI 正式向 Pro、Enterprise 和 Business Premium 用户开放 GPT-6 Astra,并同步上架 API,Plus 与 Business 用户将在下一批获得更新。这是 GPT-6 系列从演示走向规模化分发的重要一步。

Vercel CEO Guillermo Rauch 公开力挺 WebMCP 协议,认为 AI 智能体应该像特斯拉 FSD 适应真实道路一样去适配现有网站,而不是要求网站重写。这一表态可能影响未来 AI 浏览器与网页工具的交互方式。