Nathan Lambert 写一本专门介绍大模型 RLHF 的书。 配套 13 讲正课和免费 PPT,大善人啊。 不要求大语言模型基础,只有学习动力,加上AI辅助完全可以学。 开头讲基础:LLM原理、KL 散度、交叉熵等。 后正文讲了 RLHF 和后训练的基础框架、指令微调、奖励模型、拒绝采样、RLVR 、DPO等。 还有合成数据和现在的Post Traing训练方法。 课程和PPT下载见评论区,比较硬核。

AI 研究者 Nathan Lambert 发布了一本专门介绍大模型 RLHF 的书籍,并配套 13 讲免费课程和 PPT,把后训练阶段的核心技术系统整理成公开学习资源,成为目前少见的完整入门路径。








