Artificial Analysis says Gemini 4 Argon (high) matches GPT-6 Astra (max) on its Intelligence Index and has a 15% hallucination rate, compared with 51% for Astra (Artificial Analysis)

第三方评测机构 Artificial Analysis 称,Gemini 4 Argon(high)在其智能指数上与 GPT-6 Astra(max)打成平手,但幻觉率仅 15%,而后者高达 51%。同一档智能水平下差距超过三倍的幻觉率,是这次对比最值得注意的地方。

一句话看懂:第三方评测机构 Artificial Analysis 称,Gemini 4 Argon(high)在其智能指数上与 GPT-6 Astra(max)打成平手,但幻觉率仅 15%,而后者高达 51%。同一档智能水平下差距超过三倍的幻觉率,是这次对比最值得注意的地方。

事件核心:发生了什么

据 Techmeme 收录的信息,Artificial Analysis 公布了对两款旗舰大模型的评测结果:谷歌的 Gemini 4 Argon(high)与 OpenAI 的 GPT-6 Astra(max)在其 Intelligence Index 上得分相当,属于同一智能档位。差别出在可靠性指标上——Gemini 4 Argon(high)的幻觉率为 15%,GPT-6 Astra(max)为 51%。

Artificial Analysis 是业内较常被引用的独立评测方,其指数通常综合推理、知识、代码等多类任务;幻觉率则衡量模型在不确定时仍输出错误内容的比例。目前公开信息显示,这次对比针对的是两款模型的特定配置(high 与 max),并非全系列横评。

为什么重要

过去一年,旗舰模型的竞争焦点集中在“谁更聪明”,各家发布时也习惯拿基准分数说事。这次结果提供了一个不同的信号:在智能指数接近的情况下,幻觉率可能成为更实际的区分维度。对企业和开发者来说,一个答题准确但经常编造事实的模型,落地成本往往高于一个稍弱但更稳的模型——后者需要的人工复核、兜底逻辑和合规成本都更低。

如果 51% 这一数字在后续复现中站得住,它也会给“堆算力、堆参数换智能”的路线提出一个问题:能力提升是否以可靠性为代价。这会影响闭源旗舰模型的定价逻辑,也可能让开源模型在垂直场景中获得更多比较空间。

对用户/开发者/创作者的影响

开发者选型时,建议把幻觉率与智能分数放在同等位置评估,尤其是客服、医疗、法律、金融等容错率低的 AI 应用,高幻觉率意味着必须加检索增强、结果校验或人工审核,实际成本要算进去。通过 API 接入的团队,可以在自己的业务数据集上做小规模对比测试,而不是只看榜单。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

内容创作者和普通用户则要留意:同一档智能不代表同样的可信度。用模型查资料、生成事实性内容时,对幻觉率高的模型需要更谨慎地交叉验证。

值得关注的后续

一是 Artificial Analysis 是否公布完整评测方法、任务集与复现细节,让 15% 与 51% 的差距可被第三方验证;二是 OpenAI 是否回应或调整 GPT-6 Astra 的默认配置、推理策略与定价;三是两家在下一轮模型更新中,会不会把幻觉率作为独立卖点来宣传。

来源:Techmeme

celebrityanime
celebrityanime
文章: 26632

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注