AI论文盲测:学生更青睐Gemini而非ChatGPT和Claude

盲测平台 StudyArena 对 6851 份学生投票的分析显示,在论文写作任务中,Google 的 Gemini 以 39.6% 的盲选率领先 Claude(31.8%)和 ChatGPT/OpenAI(29.2%)。更重要的是,学生偏好更长但推理强度更低的回答,这对大模型在写作场景的产品设计有直接参考意…

一句话看懂:盲测平台 StudyArena 对 6851 份学生投票的分析显示,在论文写作任务中,Google 的 Gemini 以 39.6% 的盲选率领先 Claude(31.8%)和 ChatGPT/OpenAI(29.2%)。更重要的是,学生偏好更长但推理强度更低的回答,这对大模型在写作场景的产品设计有直接参考意义。

事件核心:发生了什么

StudyArena 发布了一组基于盲测的写作模型对比数据。所谓“盲测”,是指学生在看到回答后、展示模型名称前进行投票,因此排除了品牌偏好和付费习惯的影响。截至 2026 年 8 月的数据,共有 6851 次有效投票被纳入统计。

结果显示,Gemini 系列模型在“大学论文”类任务中以 39.6% 的选择率排名第一;Anthropic 的 Claude 以 31.8% 位居第二;ChatGPT 及 OpenAI 其他模型以 29.2% 排在第三。该榜单涉及的模型包括 GPT-5.6 Sol、Claude Opus 5 和 Gemini 3.1 Pro 等最新版本,并非早期模型。

值得注意的是,胜出的回答平均比落选回答长 37%。在“决胜局”中,最长回答赢了 47.7% 的对比,最短回答仅赢 25.0%。然而,推理强度与胜率呈反向关系:低推理设置的回答胜率为 40.7%,中等为 33.3%,默认设置为 30.8%,高推理设置反而只有 29.5%。更多推理带来了更多限定语和重复,对散文写作并不友好。

为什么重要

这份数据挑战了两个常见假设。第一,“更强推理 = 更好输出”并不适用于所有任务,至少在写作场景中,过高推理设置会让文本变得臃肿。第二,长回答并不等于注水,在论文场景中,学生更倾向于信息密度更高的回答——前提是内容保持具体和清晰。

对模型厂商而言,这可能意味着推理能力需要在产品层做任务级路由,而不是笼统地“拉满”。Google 在写作反馈单项以 41.7% 领先,Claude 在作业规划单项以 43.2% 居首,OpenAI 在研究任务中以 39.3% 领先——各厂商在不同写作子任务上各有所长,这也会影响用户对模型的选择,以及 API 开发者在构建应用时的模型搭配策略。

对用户/开发者/创作者的影响

对普通用户和创作者,建议是:把 Gemini 当编辑器而非代笔。让它定位泛泛而谈的段落、缺失的事实细节和薄弱论点,而不是直接生成全文。同时,写作时优先使用默认或低推理设置,只有处理论证和事实核查时才调高推理强度。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对开发者来说,这组数据提示了一个产品设计方向:写作类 AI 应用可以默认设置更低的 effort 参数,并按照任务阶段拆分子模型——用 OpenAI 做论点梳理,用 Claude 做结构规划,用 Gemini 做文本润色。当前官方目录里已经区分了不同模型家族的定位,API 调用时也可以据此做输入分发。

值得关注的后续

首先,这份榜单是动态的,随着更多盲测投票进入,排名和优势幅度可能会发生变化,尤其是在模型版本快速迭代的背景下。其次,Gemini 3.1 Pro 目前在这些任务中领先,但 OpenAI 和 Anthropic 下一代模型是否会在写作任务上缩短差距,仍待观察。最后,该数据目前仅来自学生论文场景,如果扩展到营销文案、技术文档或代码注释等写作子类型,结论是否成立,还需要更多细分测评来验证。

来源:Hacker News

celebrityanime
celebrityanime
文章: 20378

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注