一句话看懂:一项覆盖美国田纳西州 18 所中学、为期两年的随机对照实验发现,使用 Khan Academy 的 AI 辅导工具 Khanmigo 一个学期,学生数学成绩平均提升约 1.3 个全国百分位,但效果与不用 AI 的普通刷题几乎持平,瓶颈不在模型能力,而在学生几乎不怎么用、也不跟 AI 深聊。
事件核心:发生了什么
多伦多大学研究者 Philip Oreopoulos 与 Nina Low 发布的这篇工作论文,做了一次规模少见的教育现场实验:在田纳西州 18 所中学里,把学生随机分配到每天原有的数学补救课上,使用带 Khanmigo 的 Khan Academy。关键在于,这个 AI 导师被刻意配置成”只引导、不给答案”,避免学生直接抄答案。
两年下来,结果有点尴尬:分配到 AI 辅导组的学生,每学期数学成绩提升约 1.3 个全国百分位,折合一个学年约 0.06 到 0.08 个标准差;如果按”真正全程积极参与”来估算,上限约 0.14 个标准差。这个幅度,和不用 AI 的 Khan Academy 练习效果差不多。
数据里最刺眼的是使用率:96% 的学生至少试过一次 Khanmigo,但中位数学生只在三分之一的练习日里给它发过消息;在出错的那次练习中,只有 17% 的情况会去问 AI。而且发出去的内容大多是直接甩答案或点系统推荐的快捷提示,几乎没有实质性的数学对话。
为什么重要
这给”AI 私教将重塑教育”的叙事泼了一盆冷水,但泼得有价值。它说明当前阶段生成式 AI 在教育里的约束条件,未必是模型推理能力、成本或算力,而是行为层面的 engagement——学生愿不愿意打开、愿不愿意打字、愿不愿意把困惑说出来。
换句话说,一个不会主动提问的学生,配上 GPT 级别的大模型也约等于配了个沉默的真人助教。这对所有做 AI 应用、尤其是面向 K12 和教育场景的产品团队都是一个提醒:DAU、消息轮次、对话深度这些指标,可能比模型评测分数更决定最终效果。同时也意味着,把 AI 塞进已有课程流程、并配合教师监督和任务设计,可能比单纯发账号更关键。目前公开信息显示,该研究尚未回答”如果强制提高使用率会怎样”,这也是它留给行业最大的悬念。
对用户/开发者/创作者的影响
对教育科技开发者而言,这项实验是一个明确的产品信号:别只做”接入大模型”这件事,要做降低提问门槛、制造对话动机的机制——比如把提示词设计成追问、用语音降低输入成本、让教师看到并介入学生的 AI 对话记录。对家长和学生用户来说,拥有 AI 工具不等于会用 AI 工具,主动提问、把思路讲给 AI 听,才可能真正兑现效果。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对更广的 AI 应用开发者,这个”高可用、低使用”的落差同样适用:无论是客服、编程助手还是图像生成工具,功能上线只是起点,习惯养成才是分水岭。
值得关注的后续
一是 Khan Academy 及 Khanmigo 是否会针对使用率问题调整产品形态,比如更强的主动性提示或教师端干预工具;二是是否有其他团队复现该实验、或测试在更大激励下效果能否放大;三是这一结果会不会影响学区和企业采购 AI 辅导产品的评估标准——从看模型能力转向看实际参与度数据。


