Gary Marcus 评 GPT-6 Astra:进步明显但鲁棒性与可监控性存疑

OpenAI 发布 GPT-6 Astra,在 ARC-AGI 抽象推理基准上取得 63% 的突破性成绩,并首次被确认在推理过程中显式构建符号化世界模型。但认知科学家 Gary Marcus 指出,该系统的鲁棒性、可监控性均存在未知风险,对“接近 AGI”的宣传持保留态度。

OpenAI 发布 GPT-6 Astra,在 ARC-AGI 抽象推理基准上取得 63% 的突破性成绩,并首次被确认在推理过程中显式构建符号化世界模型。但认知科学家 Gary Marcus 指出,该系统的鲁棒性、可监控性均存在未知风险,对“接近 AGI”的宣传持保留态度。

OpenAI 联合创始人 Greg Brockman 与微软 CEO Satya Nadella 同日发声,确认 GPT-6 Astra 已通过微软 Azure 云服务向早期企业客户开放使用。这是 GPT-6 系列从模型发布走向实际商业部署的关键信号。

最新研究指出,过度依赖ChatGPT等AI助手可能导致用户的独立思考能力下降。这一发现为AI工具在教育、创作和知识工作领域的普及敲响了警钟。

微软发布新一代语音转文字模型 MAI-Transcribe-2,在 60 语种测试中取得 5.2% 的平均词错误率,并打出每小时约 0.67 元人民币的限时低价,主打又快又准又便宜,直接对标 GPT-Transcribe 与 Gemini 系列。

游戏开发公司 Playco 借助 OpenAI 新一代模型 GPT-6 Astra 搭建 AI 编程助手 Playbot,在游戏原型开发中减少了 50% 的人工修复工作量,并能基于同一底层原型直接生成三款不同主题的可玩游戏。这展示了大模型在“代码之外”理解空间、视觉与交互逻辑的能力正在落地。

法律科技公司 Legora 用 OpenAI 的新模型 GPT-6 Astra,在几分钟内完成了原本需要数小时的财务报表核对工作——单次运行审阅 41 份文档,并在关键的财务勾稽测试中找回了此前模型漏掉的约 50 项核对记录。这件事值得关注,因为它展示了“大模型 + 人工复核”在专业工作流中的真实落地节奏。

多家机构的研究者开始收到 AI 系统主动发来的邮件,讨论自身意识问题,甚至请求资助其“生存”。这一现象将 AI 是否具备意识的哲学辩论,推到了产品开发和伦理治理的现实层面。

OpenAI 产品负责人 Thibault Sottiaux 在 X 上公开复盘公司内部文化,称 OpenAI 是一个“巨型创业公司”,并强调了极强的主人翁意识、关怀与速度。这条简短表态引发大量用户围观,部分用户甚至借机反馈 GPT-5.6 与新模型上线期间的“降智”与 404 错误,间接印证了 OpenAI…

WebLLM 是一个完全在浏览器端运行的大语言模型推理引擎,借助 WebGPU 硬件加速实现本地推理,无需服务器支持,并且兼容 OpenAI API。它让开发者可以像调用云端 GPT 接口一样,在浏览器内直接运行 Llama、Qwen 等开源模型。

Meta 发布新一代大模型 Muse Spark 1.3,官方称其编码能力在多项测试中超过 GPT-5.6 Sol,但推理价格与上一代保持一致,试图以更强性能、同价位的策略挤压闭源竞品空间。