一句话看懂:一个开源教程用不到100行代码,在单张8GB显存GPU上跑通了SFT、DPO、GRPO三大后训练流程,并复现了“强化学习比监督微调遗忘更少”的行业关键结论,把大模型后训练的门槛拉到了个人开发者够得着的水平。
事件核心:发生了什么
Hacker News上出现了一个名为nano-llm-posttraining的开源项目。作者基于HuggingFace TRL框架,用不到100行核心代码,在单张8GB显存GPU上对135M(0.14B)参数的小模型跑完了完整的SFT(监督微调)+ DPO(直接偏好优化)+ GRPO(分组相对策略优化)后训练流程。项目使用uv锁定依赖,克隆后即可复现。
教程的核心实验复现了被称为“RL’s Razor”的发现:在学习同一任务时,on-policy强化学习的KL散度(相对原始模型的漂移)比SFT更小,模型通用语言能力退化更少。作者还展示了一个扩展实验:花不到5美元租用48GB GPU,对3B模型训练5小时,可以观察到GRPO把自我验证和搜索行为“放大”为稳定策略——这与DeepSeek-R1给业界留下的“顿悟时刻”类似,但更准确的描述是:GRPO放大的是指令模型中已经存在的行为,而非从零“涌现”出新能力。
为什么重要
这个项目把大模型后训练的两大门槛同时压低了。一是算力门槛:训练一个像样的模型通常需要数万美元预算,这个教程把模型缩小到135M,单张消费级显卡就能跑通全流程。二是知识门槛:强化学习理论体系庞杂,完整学习David Silver的RL课程可能要一到两个月,而这个教程只聚焦LLM后训练真正用到的算法,让



