Arena 研究:LLM 裁判偏爱自己答案的概率比人类高 70%

Arena 让 12 个大模型在 1460 场真实对战中匿名互评,发现模型选自己答案的概率比人类高约 70%,OpenAI 系模型还额外偏爱自家同门。这意味着用 LLM 当裁判的评测与训练环节,可能系统性偏向某些模型。

Arena 让 12 个大模型在 1460 场真实对战中匿名互评,发现模型选自己答案的概率比人类高约 70%,OpenAI 系模型还额外偏爱自家同门。这意味着用 LLM 当裁判的评测与训练环节,可能系统性偏向某些模型。

OpenAI 在 DevDay 上把 ChatGPT 从聊天工具推向协作与操作系统层:开放插件生态、推出团队共享空间与企业市场,并直接进入 Slack 和 Microsoft Teams。这意味着 ChatGPT 的竞争对象开始从聊天机器人转向办公协作软件。

ChatGPT 上线了面向团队的协作空间 Space 和交互式文档 pages,把 AI 从对话框推进到团队共享的工作台。这意味着 ChatGPT 的定位正从个人助手转向团队协作平台。

ChatGPT 订阅额度现在可以直接在 60 多个合作方产品里消耗,用户用 ChatGPT 账号登录即可,无需额外付费或走单独的计费规则。这意味着订阅价值从 OpenAI 自家产品扩展到了第三方 AI 应用生态。

OpenAI 开发者账号发布 GPT-6.1 Sol,主打更强的智能体编码与 computer use 能力,性能接近 Astra,并对缓存输入给出相对标准输入 95% 的折扣。这次升级直接指向长时间运行的跨应用智能体和大型代码库重构场景。

OpenAI 为 Codex 上线了云端运行环境,代码仓库、依赖、脚本和配置可以预先保存并复用,智能体在用户合上笔记本后仍能继续执行任务。这意味着 AI 编程智能体从“本地会话工具”向“可持续运行的后台服务”迈了一步。

OpenAI 的新模型 GPT-6.1 已上线 Arena 评测平台,进入 Agent Arena 和 Code Arena 等多个测评赛道,用户投票将参与其评分;OpenAI 同时把它定位为接近 Astra 能力、但成本只有约五分之一的高性价比模型。

OpenAI 在 2026 开发者日上披露,ChatGPT 周活跃用户已超过 12 亿,ChatGPT Work 与 Codex 周用户合计超过 3500 万,使用其产品的企业达 250 万家。这组数字说明 ChatGPT 的增量正从个人聊天转向工作场景与企业采购。

OpenAI 于 2026 年 9 月 29 日发布新产品「dots」,一种基于 GPT‑6 Astra、拥有独立云端电脑和浏览器、可 24/7 持续工作的常驻智能体,先在 Pro、Business Premium 和 Enterprise 套餐中陆续开放。

OpenAI 发布 GPT-6.1 Sol,在 agentic coding、computer use 和专业工作任务上接近 GPT-6 Astra 的智能水平,但 token 价格只有后者的五分之一,缓存输入低至每百万 token 0.10 美元。这意味着一线能力开始向更低的成本区间下探。