Harvey LAB-AA v1.1 新增幻觉检查,Grok 4.7 与 Muse Spark 1.3 争夺法律 AI 榜首

Artificial Analysis 与 Harvey 在 2026 年 10 月 8 日发布 Harvey LAB-AA v1.1,首次把幻觉检查纳入法律 Agent 评测,新指标 Hallucination-Gated All-Pass Rate 让模型排名明显洗牌,超过六成原本通过的结果含有实质性幻觉…

一句话看懂:Artificial Analysis 与 Harvey 在 2026 年 10 月 8 日发布 Harvey LAB-AA v1.1,首次把幻觉检查纳入法律 Agent 评测,新指标 Hallucination-Gated All-Pass Rate 让模型排名明显洗牌,超过六成原本通过的结果含有实质性幻觉。

事件核心:发生了什么

这项评测面向真实法律 Agent 任务,模型需要完成 120 个由 Harvey 团队构建的私有法律任务,覆盖公司并购、资本市场、税务、诉讼和破产等领域。v1.1 有三处关键变化:每个交付物都要对照源文档做两阶段幻觉审计;评分改为三位 LLM 评委——GPT-6 Sol、Grok 4.7 和 Claude Opus 5.5——共同打分;新头名指标要求任务同时满足全部评分标准且不含实质性幻觉。

结果上,Grok 4.7(xhigh)以 9.4% 的 Hallucination-Gated All-Pass Rate 领先,Muse Spark 1.3(max)为 8.9%,GPT-6 Astra(max)为 8.6%,GPT-6.1 Sol(max)为 6.9%,Claude Fable 5.1(max,启用 fallback)为 6.4%,Kimi K3(max)为 5.3%,Claude Opus 5.5(max,启用 fallback)为 4.2%。

更值得注意的是排名变化:若不看幻觉门槛,Muse Spark 1.3 以 26.7% 的 All-Pass Rate 大幅领先,但其中三分之二的通过含有实质性幻觉。GPT-6 Astra 则几乎保留全部通过结果,从 All-Pass 并列第十升至新指标第三。

为什么重要

法律工作对事实准确性要求极高,交付物一旦引用虚构内容,后果可能远超普通问答错误。v1.1 把幻觉作为一票否决项,意味着评测不再只问“模型能否完成任务”,而是进一步追问“完成得是否可靠”。目前公开信息显示,超过 60% 的原本通过结果含有实质性幻觉,多个模型在计入幻觉后得分为零,这说明此前若干法律 Agent 评测可能高估了模型可交付性。

另一个信号是,三位评委分别来自不同模型家族,Artificial Analysis 表示已检查并发现自我偏好有限,再通过平均分数降低偏差。这套评测方法若被更多企业法律采购采用,可能影响 AI 供应商的竞争重心:不是只拼覆盖率和任务通过率,还要拼引用可追溯与事实一致性。

对用户/开发者/创作者的影响

对正在评估法律 AI 工具的企业来说,Hallucination-Gated All-Pass Rate 比传统通过率更有参考价值,采购时可以要求供应商在自有文档集上做类似幻觉审计,而不要只看“通过率”单项数字。对开发者,如果正在构建法律、合规、金融等高风险 Agent,v1.1 的“先判候选幻觉、再复核分类”思路可作为产品内事实校验模块的设计参考。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对使用大模型处理合同、尽调或法务材料的普通用户,这项评测提醒一件事:高通过率不代表内容可直接使用,关键结论仍应回到源文档核对。目前公开信息显示,即便表现最好的模型,端到端无幻觉通过率也仅在 9% 左右,距离无人监督的自动交付仍有明显距离。

值得关注的后续

一是 Harvey LAB-AA 后续版本是否会把风格、语气等律师看重的可用性维度纳入评分;二是其他法律 AI 或通用 Agent 评测是否跟进加入幻觉门槛,形成新的行业评测基线;三是随着模型迭代,Hallucination-Gated All-Pass Rate 是否能从个位数显著提升,以及企业是否会据此调整采购标准。

来源:Artificial Analysis

celebrityanime
celebrityanime
文章: 28349

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注