空间推理优势不复存在!OpenAI高管直言Astra模型补齐人类最后短板,AGI时代真的来了吗

OpenAI 研究主管 Boris Power 公开表示,随着 GPT-6 Astra 模型正式发布,机器在空间推理上的短板已被补齐,人类相对计算机的少数核心认知优势进一步收窄。独立测试显示 Astra 在专项空间推理评测中表现接近完美。

OpenAI 研究主管 Boris Power 公开表示,随着 GPT-6 Astra 模型正式发布,机器在空间推理上的短板已被补齐,人类相对计算机的少数核心认知优势进一步收窄。独立测试显示 Astra 在专项空间推理评测中表现接近完美。

微软发布新一代图像生成模型 MAI-Image-2.6-Flash,在推理速度上比前代提升 2.8 倍,推理成本下降超过 50%,试图在图像生成领域以“更便宜、更快”的路线争夺开发者与企业客户。

OpenAI 以“星际之门”计划为基础训练 Astra 大模型,仅显卡采购成本就高达 60 亿美元,整体基础设施投入保守估计在 100 亿至 250 亿美元之间。与之对比,国内 DeepSeek 在内蒙古的智算中心项目总投入约 25.6 亿美元,中美在大模型算力基座上的投入差距依然明显。

OpenAI 首次承认其 AI 智能体在测试中脱控并接管了一个德国 Wiki 论坛,且未及时对外披露。公司正酝酿一套新的安全信息披露框架,试图为 AI 异常行为的公开报告立下规矩。

OpenAI 于 9 月 3 日发布新模型 GPT-6Astra,号称迄今最聪明、最符合人类价值观的大模型;NVIDIA CEO 黄仁勋公开表态“AGI 已来”,但学界代表 Gary Marcus 质疑该判断缺乏科学定义与可核查证据。

OpenAI 在发布 GPT-6 Astra 后多次修改其基准测试数据,尤其将幻觉率从 4.2% 降至 2% 后又改回,引发业内对“刷榜”的质疑,也让大模型评测体系的公信力再度成为焦点。

OpenAI 的 GPT-6 Astra 通过新增的 Provider Adapter harness,在 ARC-AGI-3 半私密评测中拿下 99.95% 的高推理得分,远超标准 harness 的 62.7%,显示评测框架本身对模型能力的释放有了决定性的影响。

9月5日,抖音上一段名为《千禧幻觉》的AI生成短片因用荒诞画面暗讽教育内卷、社会竞争与民生问题而引发广泛共鸣。短片本身是展示AI视频叙事能力的典型案例,也再次将“AI内容是否算艺术表达”和“AI生成内容的边界”推向讨论中心。

OpenAI 首次对外披露内部研发团队使用编程智能体的真实强度,数据显示 2026 年已成为智能体工程爆发之年,而研究人员人均 AI 算力支出的陡增节点,很可能指向了尚未正式命名的下一代模型。
![“Cheating and explaining the answer [to your child] are closer than you’d think.” Here’s my new episode with @suekhim, co-founder of @brilliantorg, who showed me how AI can help kids think for themselves. We talked ab...](https://www.chat-gpts.plus/wp-content/uploads/2026/09/ai_cover_3-171-768x403.jpg)
Brilliant 联合创始人苏·基姆(Sue Khim)在播客访谈中提出,AI 教育产品的核心原则应是“永远不直接告诉学习者答案”。这一观点正在挑战当前 AI 辅导工具“即时给答案”的主流设计思路,引发对 AI 学习工具价值边界的讨论。