能拿高分的技能,正是AI最擅长伪造的。

意大利博科尼大学针对千余名新生的随机实验发现,GPT-4o 能显著提升商业作业的评分,而因果推理教学则催生更多元、非典型的解决方案。高分的构成要素恰恰是 AI 最擅长伪造的,现有评分体系与真实学习效果之间的错位被再次放大。

一句话看懂:意大利博科尼大学针对千余名新生的随机实验发现,GPT-4o 能显著提升商业作业的评分,而因果推理教学则催生更多元、非典型的解决方案。高分的构成要素恰恰是 AI 最擅长伪造的,现有评分体系与真实学习效果之间的错位被再次放大。

事件核心:发生了什么

2025 年 11 月,博科尼大学将 13 个管理入门课程的班级随机分为四组:对照组、因果推理教学组、GPT-4o 使用组、两者结合组。1,053 名大一新生需要为大学纪念品商店撰写不超过 180 词的营销建议。

结果显示,使用 GPT-4o 的学生在 1 到 5 分的评分标准上平均高出近 1 分,答案中多出约两个创意点,逻辑更连贯,且与三位领域专家的推荐更吻合。即便控制论证质量、观点数量、观点多样性和文本属性后,GPT-4o 带来的可测增益依然存在。研究者认为,这反映的是输出质量的提升,而非学生知识水平的增长。

相反,因果推理教学并未提高传统评分——该组学生的平均分甚至略低。但他们的答案更常解释“为什么某个行动有效”以及“在什么条件下会失败”,产生的观点也更偏离同伴的常规思路。将教学与 GPT-4o 结合并未进一步抬升传统分数,但两者在因果推理指标上形成互补。

为什么重要

这项研究揭示了一个核心矛盾:当前评分体系主要奖励结构化、完整度和润色程度,而这些维度恰恰是大语言模型的强项。论文中使用的评分细则显示,可证伪性、实施条件说明、与同伴观点的差异度等体现真实思考的指标,反而与低分相关。

博科尼的团队明确指出,若希望多样性和原创性计入成绩,就必须将其显式写入评分标准。否则,AI 辅助写作在现有评价体系下等同于一种“作弊工具”——它提升的是作业分数,而不是学习成果。研究同时承认,由于没有在无 ChatGPT 条件下进行后续测试,GPT 带来的优势究竟来自学生实际掌握的知识,还是单纯的 AI 辅助输出,目前尚无法回答。

这一结论与另一项覆盖超过 50 万个美国大学成绩的研究方向一致:决定 AI 对学生影响的关键,不是是否使用 AI,而是它支持了学生的自主思考,还是替代了思考本身。

对用户/开发者/创作者的影响

对教育科技开发者和 AI 应用设计者而言,这项实验提供了可量化的参考:GPT-4o 对“结构完整、观点丰富”型任务的增益显著,但对“因果解释、反事实推理”类任务的提升有限。这意味着在开发自动化评估工具或 AI 写作助手时,应谨慎区分“输出质量”与“理解深度”。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对使用 AI 辅助内容创作的个人和团队,这项研究也是一种提醒:依赖大模型润色和扩写能迅速提高文本的“表面质量”,但如果长期缺少独立思考训练,内容产出的多样性可能会被系统性地压缩到 LLM 的高概率分布区间内。博科尼实验中的教学干预之所以能增加观点多样性,正是因为它是“非 AI 介入”的思维训练。

对企业采购者和教育管理者来说,该研究揭示了 AI 工具引入教育场景时的评估盲区:只看成绩提升会高估 AI 的教学价值,需要配套设计不依赖 AI 的学习成果验证机制。

值得关注的后续

首先,是否有后续实验会在移除 ChatGPT 后对学生进行独立测试,以区分真正的知识留存与 AI 辅助的表现提升——这将是判断教育场景 AI 价值的关键证据。

其次,博科尼大学是否会调整评分标准,将可证伪性和观点多样性纳入正式考核指标,值得关注。若这类改革落地,意味着教育评价体系开始主动适应 AI 环境,而非被动等待。

最后,OpenAI 深度参与了这项研究(多位作者在 OpenAI 任职),涉及大模型公司对自身技术效果评估的独立性争议。未来类似研究中如何设置利益冲突隔离机制,也是行业需要回答的问题。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 21261

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注