Artificial Analysis 评测 GPT-6 Sol 和 Luna:成本减半但各评测有升有降

Artificial Analysis 评测显示,OpenAI 的 GPT-6 Sol 和 Luna 把每百万 token 价格降到上一代约一半,推理成本明显下降,但知识与编程等评测出现有升有降,能力并非全面进步。

Artificial Analysis 评测显示,OpenAI 的 GPT-6 Sol 和 Luna 把每百万 token 价格降到上一代约一半,推理成本明显下降,但知识与编程等评测出现有升有降,能力并非全面进步。

OpenAI 在 2026 年 9 月 22 日发布文件,系统说明第三方独立评估应重点审查什么、遵循什么原则。这相当于把“让外部人查模型安全”从姿态变成了可操作框架,对前沿大模型的安全论证方式有直接影响。

英国 AI 安全研究院(UK AISI)开始用 EvalEval 联盟的公开基础设施发布评测结果,首批覆盖 5 个基准测试、6 个前沿模型,让原本散落各处的跑分变成可复现、可对照的公共数据。

GitHub Copilot 在已上线的 GPT-6 Astra 之外,新增 GPT-6 Sol 和 GPT-6 Luna 两款模型,一个偏向多步验证的智能体编程,一个主打低成本快速任务。这意味着 Copilot 的模型选择开始按“任务档位”细分,而不只是拼最强能力。

Anthropic 最新的 Claude Opus 5.5 已接入 GitHub Copilot,主打代理式编程和长任务处理,并在早期测试中用更少的步骤和 token 完成与 Opus 5 相当的任务,开发者现在可以在多个 IDE 和 Copilot 入口中直接选用。

OpenAI 推出 GPT-6 Sol 与 GPT-6 Luna 两款新模型,把 GPT-6 Astra 的能力下放到更便宜的价位,API 价格相比 GPT-5.6 同级别产品直接砍半。对高频调用大模型的开发者和团队来说,这是实打实的成本下降。

亚马逊已封禁 Meta 的 Muse AI 购物 Agent,理由是它未经授权访问商店、不主动表明机器人身份,且会接触并存储用户账号凭证。这意味着"AI 替你下单"这件事,正撞上电商平台对流量和广告收入的实际控制权。

美国出现两份讨论草案,一份属联邦层面、一份针对明尼苏达州,试图用立法保障个人和机构获取算力、先进 AI 与开放权重模型的权利,同时禁止政府仅因模型“能力太强”而限制使用。它把监管逻辑从“按能力分类”扭回“按行为追责”。

Hacker News 上一则讨论把当下围绕 AI 提升效率的说法,直接类比为当年美国外包制造业时的自我说服,核心担忧是:短期产出和利润可能好看,但一个组织乃至一个国家的"制度性知识"会被悄悄掏空。这条讨论之所以值得看,是因为它把"AI 会不会让人变笨"这个模糊焦虑,换算成了一个可以被验证的历史模型。

机器视觉厂商 Cognex 同意以约 6 亿美元收购 RealSense,其中 5 亿美元为现金;RealSense 原本是 Intel 旗下深度相机与 3D 视觉业务,2025 年 7 月被分拆独立。这笔交易把"工业视觉"和"机器人感知"两块能力拼到了一起。