一句话看懂:斯坦福大学把 CS329A“自我改进 AI 智能体”研讨课的全部 9 节视频公开到 YouTube,两位曾参与 PaLM、Gemini、Claude 的主讲人系统拆解了“采样→验证→筛选→训练→更强模型”的循环,并解释了为何编程类智能体已普及、写作类却迟迟无法突破。
事件核心:发生了什么
斯坦福大学研究生课程 CS329A(Self-Improving AI Agents)已面向公众开放,主讲人为曾参与 PaLM、Gemini 项目的相关部门成员及 Claude 相关研究者。课程共 9 讲,以“一线经验 + 论文精读”方式,复盘了 OpenAI o1、DeepSeek 系列等模型背后的完整链路:大规模采样(如对 Llama 3 8B 每题采样至 10,000 次)、验证器打分、轨迹筛选,再通过 SFT 或强化学习训练出更强模型,形成闭环。课程中多次引用 Mirhoseini 实验室的“Large Language Monkeys”实验、Math-Shepherd、Weaver、DAPO、AlphaCode 2 与 METR、GDPval 等基准的最新结果,时间跨度覆盖 2025 年至 2026 年初。
为什么重要
这门课把当前 AI 竞争的核心从“参数量与预训练算力”移到了“后训练与推理侧扩展”。讲师明确提出,generation–verification gap(生成与验证之间的差距)决定了自我改进能走多远:数学、代码这类可自动验证的领域能形成持续复利,而创意写作因缺乏强验证信号,改进飞轮会停转。这也解释了行业现状——coding agent 已进入实际工作流,而写作类智能体仍停留在辅助生成层面。课程还指出,当前 RL 占训练算力比例已从约 1% 升至约 5%,但瓶颈不在算力而在 reward 信号的强度与噪声控制。对开发者而言,理解“哪些领域的验证能闭环”比追逐模型参数更具判断价值。
对用户/开发者/创作者的影响
对开发者:课程推荐了 Archon 这类把 generator、fuser、verifier、ranker 作为可搜索架构层的开源方案,意味着没有顶级基座模型的团队也能通过推理时策略组合追平 GPT-4o 或 Claude 3.5 Sonnet 的效果,降低了对单一闭源 API 的依赖。对创作者:目前公开数据显示,模型在需要隐性上下文与模糊需求的专业写作任务上,可靠性远低于软件工程场景(GDPval 测试中模型对十年经验专家的胜率最高仅 47.6%,而 METR 显示 80% 成功率任务时长仅约 15 分钟),短期不宜把关键内容生产完全自动化。对采购方:课程强调模型普遍过度自信(约 50% 正确率时却表现出 80% 的确定性),接入 Agent 时需自建验证层,而非信任模型自我评估。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是“可验证领域带动不可验证领域”是否会出现实际突破——例如用代码生成产生的过程监督信号来训练写作模型的推理链。二是 DeepSeek-Math V2 这类让 verifier 与 generator 互相审查、互相拉高的路线,能否在真实产品中形成数据飞轮。三是课程提到的“Intelligence per Watt”测算——约 77% 的 ChatGPT 请求不需要前沿模型,本地小模型可覆盖 88.7% 查询,推理负载向边缘迁移的进程是否会在未来两年明显加速,直接影响算力采购与端侧芯片市场格局。
来源:@shao__meng


