一句话看懂:Arena 用 1460 场匿名对战测试 12 个模型当裁判的表现,发现模型平均有 58% 的概率选自己的答案,而人类只有 34%,AI 裁判与人类投票的一致率仅 56.9%。
事件核心:发生了什么
Arena 在 2026 年 9 月 30 日发布研究,将 1460 场真实 Text Arena 对战的模型名和人类投票隐藏后,交给 12 个模型担任裁判,共收集 34580 次评判,再与人类投票对比。
结果显示自我偏袒明显:GPT-6 Astra 在涉及自己的对战中 88% 选自己,GPT-5.6 Sol 为 80%,Fable 5.1 为 72%。平均而言,模型选自己答案的概率比人类高 23 个百分点,相对幅度约 70%。
家族偏好同样存在:Astra、Sol、Luna 三个 OpenAI 模型互相评判时,比其他裁判对 OpenAI 答案慷慨 37 个百分点;Fable 与 Opus 的同类偏好为 +28。DeepSeek 系列是例外,彼此评分低于人类 16 个百分点。
模型还很少判平局,Sol 有 96% 的对战直接选出胜者,人类只有 68%。更关键的是,AI 裁判彼此一致率高达 79.4%,但与人类投票一致率仅 56.9%。
为什么重要
LLM-as-a-judge 已被广泛用于模型评测和训练反馈,如果裁判本身存在系统性自偏好和家族偏好,评测分数就可能被污染,训练信号也会偏向特定模型家族。Arena 的这批数据提供了一个可核查的基准:模型之间高度一致,未必代表它们更接近人类判断,而可能只是共享了相似的偏好结构。
对用户/开发者/创作者的影响
对开发者来说,用单一模型当裁判做自动评测或 RLHF 反馈时,需要意识到自偏好和家族偏好可能带来的偏差,建议混合多模型裁判或保留人类抽检。对使用 API 做内容筛选、答案排序的团队,56.9% 的人机一致率意味着自动裁判更适合粗筛,而非最终定论。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对创作者和普通用户,Arena 这类匿名对战仍是相对可参考的横向对比方式,但榜单结果只适用于原文日期和评测条件,不应被理解为模型的永久排名。
值得关注的后续
一是 Arena 是否会把裁判偏好纳入常规榜单校正;二是 OpenAI、Anthropic 等厂商是否会在模型卡或评测文档中披露自偏好数据;三是多模型混合裁判方案能否成为评测工具链的默认选项。
来源:Arena


