如果LLM从未接触过五年级以上的内容,会发生什么?

一个名叫 LittleLearner 的研究项目,只让大模型学习美国小学 K-5 课程内容,结果发现:扩大模型规模、后训练和上下文学习都只能放大“学过的知识”,无法突破预训练数据设定的能力边界。这个实验为“大模型的能力到底是从哪来的”提供了一个难得的受控证据。

一句话看懂:一个名叫 LittleLearner 的研究项目,只让大模型学习美国小学 K-5 课程内容,结果发现:扩大模型规模、后训练和上下文学习都只能放大“学过的知识”,无法突破预训练数据设定的能力边界。这个实验为“大模型的能力到底是从哪来的”提供了一个难得的受控证据。

事件核心:发生了什么

LittleLearner 是由科研团队发起的一个开源研究项目,核心方法很直接:把训练数据本身变成实验变量。研究者从 FineWeb-Edu 语料中,按照美国 Common Core 课程标准过滤出一个约 880 亿 token 的 LittleCurriculum 数据集,只保留 K-5(幼儿园到五年级)阶段的概念、事实和词汇,明确排除五年级以上的内容,并用它从头训练了 0.6B、1.3B、5B 三个规模的模型,同时提供架构、数据量和训练方法完全一致的“未过滤对照模型”。

在 MathCAMPS 数学评测上,他们测试了三种常见干预手段:扩大参数量、SFT+GRPO

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

celebrityanime
celebrityanime
文章: 18746

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注