Perplexity 宣布将接入 OpenAI GPT-6 Astra,称其在 WANDR 评测中居首

Perplexity CEO Aravind Srinivas 公开祝贺 OpenAI 发布新一代前沿大模型 GPT-6 Astra,并宣布该模型将很快上线 Perplexity Computer 供 Pro 和 Max 用户使用。Perplexity 的独立评测显示,GPT-6 Astra 在 WANDR…

Perplexity CEO Aravind Srinivas 公开祝贺 OpenAI 发布新一代前沿大模型 GPT-6 Astra,并宣布该模型将很快上线 Perplexity Computer 供 Pro 和 Max 用户使用。Perplexity 的独立评测显示,GPT-6 Astra 在 WANDR…

OpenAI 发布具备 1.05M 超长上下文、可操作计算机的新模型 GPT-6 Astra,但因自主执行能力触及网络安全“Critical”风险阈值,目前访问受到严格限制,暂未全面开放给公众或开发者。

OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 基准测试上取得 63% 的 SOTA 成绩,搭配新评测框架后可达 99%,OpenAI 联合创始人 Greg Brockman 随即宣布该基准已“饱和”。这或意味着智能评测的焦点将被迫从抽象推理转向更复杂的现实任务。

OpenAI 于 9 月 3 日发布新一代大模型 GPT-6 Astra,首次达到其内部“准备框架”中“关键”级网络安全能力门槛,能在无人指导下发现高危系统漏洞。同日,联合创始人布罗克曼声称“AGI 时代已到来”,引发行业对 AI 安全可控性的新一轮讨论。

OpenAI 发布 GPT-6 Astra,在 ARC-AGI 抽象推理基准上取得 63% 的突破性成绩,并首次被确认在推理过程中显式构建符号化世界模型。但认知科学家 Gary Marcus 指出,该系统的鲁棒性、可监控性均存在未知风险,对“接近 AGI”的宣传持保留态度。

OpenAI 发布新一代旗舰模型 GPT-6 Astra,在数学、编程、计算机使用和网络安全等多项基准上创下新高,并在“越权行为”测试中实现零违规,号称迄今最聪明且最安全的大模型。

OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 基准测试中取得 SOTA 成绩,最高配置下以 99.9% 的得分率和 $19K 的推理成本刷新纪录,并在动作效率上超过人类中位数基线——模型开始学会用更少的“操作”解决未知环境问题。

OpenAI 于 9 月 3 日发布新一代模型 GPT-6 Astra,强调电脑操作能力与对齐表现。公司总裁 Greg Brockman 在会前沟通中称其个人认为该模型已触及 AGI 水平,引发行业对“智能体模型商用安全边界”的集中关注。

OpenAI 发布 GPT-6 Astra,重点不是更强的对话能力,而是它能把电脑上的活干完——从真实桌面任务提速到“擅自越权率“归零。这标志着大模型竞争正从聊天窗口转向操作系统级的自动化操作。

OpenAI 发布 GPT-6 Astra,试图把 AI 从“对话答题”推进到“接管电脑操作”,并首次将模型安全分级拉到 Critical 档位。它在数学难题上确有突破,但在通用考试基准上仍落后于 Claude 系模型。