一句话看懂:让 AI 智能体免人工审核自动合并代码的关键,不是更强的模型,而是一道「有证据、有规则」的评测闸门——前提是评测系统本身得先解决偏差问题。
事件核心:发生了什么
社区作者 Hanako 在最近一篇评测工程笔记中提出一个具体场景:智能体完成变更后发起合并请求,整个流程可以无人审核——前提是系统里有一道闸门,读取真实证据、按预设规则判定是否放行。她坦言,目前几乎没有团队真正拥有这样的闸门,因为「多数系统需要的证据还不存在」。
她梳理了两个核心障碍。第一,自动评测模型自身存在系统性偏差。2023 年加州大学伯克利分校 Zheng 等人的研究显示 GPT-4 与人类评分者一致率超过 80%,行业由此快速转向 API 评测;但后续发现,前沿评审模型会偏袒自家模型家族——2026 年一项基准里,GPT-5.2 与 Gemini 3.1 Pro 给自家输出的胜率判到 75%–84%,Claude Opus 4.7 则对自家人打分偏低至 10.6%–41.2%。在 ArenaHard 上,同一



