我写了一本 AI 教科书–AI 还要多久才能写得更好?

AI 领域知名研究者 Nathan Lambert 在完成一本强化学习(RLHF)教科书后复盘发现:大模型在长文技术写作上的能力几年几乎没有进步,与它在代码、数学上的飞跃形成鲜明对比。这说明模型在“组织已知知识并有效呈现”这类核心能力上存在短板,也挑战了外界对 AI 近期独立解决开放式科学难题的乐观预期。

一句话看懂:AI 领域知名研究者 Nathan Lambert 在完成一本强化学习(RLHF)教科书后复盘发现:大模型在长文技术写作上的能力几年几乎没有进步,与它在代码、数学上的飞跃形成鲜明对比。这说明模型在“组织已知知识并有效呈现”这类核心能力上存在短板,也挑战了外界对 AI 近期独立解决开放式科学难题的乐观预期。

事件核心:发生了什么

Nathan Lambert 于 2026 年 8 月在个人博客 Interconnects 发文,分享了他在撰写《Reinforcement Learning from Human Feedback》教科书过程中的观察。这本书由 Manning 和 Amazon 出版,他使用大模型辅助处理 LaTeX 格式、copyediting、绘制 TikZ 图表等,但在全程深度使用后得到一个明确结论:模型在长文技术写作上“确实糟糕”——单句可以写对,但整章输出会出现组织混乱、用词令人困惑、结构模糊的问题。

他指出,即使到了 2026 年,公认写作能力最好的模型仍是 OpenAI 的 GPT-4.5 和 Moonshot 的 Kimi K2 等相对较老的模型。同一时期,模型在编码、数学等任务上已从“尚可”跃升到“超人类”,在搜索和研究类任务上也有了明显改观,唯独高质量写作进步平缓。他认为这不是被忽视,而是这项任务缺乏可干预的高质量训练数据,且推理时扩展(inference-time scaling)尚未在写作上带来显著突破。

为什么重要

这件事的意义不在于“AI 写不好文章”,而在于它暴露了模型能力分布的不均衡。Lambert 的核心判断是:写作是一种“压缩”——把既有知识组织成有逻辑的结构,这恰是产生洞察的前提。如果模型连成熟领域中的教科书级内容都无法条理化呈现,那“让 AI 自主解决开放式科学难题”的预期就需要打上问号。

一个值得注意的背景是:就在同一天,Anthropic 发布了 Claude 在黎曼猜想相关问题上取得进展的博客。Lambert 对此保持审慎,认为科学问题覆盖面极广,现有模型的实际覆盖能力被许多人高估了。这个观点提醒我们:AI 在数学等边界清晰、验证机制明确的任务上快速突破,并不等同于它在开放性强、需要长期推理与知识组织的任务上同样可靠。

对用户/开发者/创作者的影响

对创作者:不要把大模型直接当作“整书写手”,更可靠的方式是定位为“章节级编辑器”——让模型处理润色、格式、局部重写,而把结构设计和论点推进留给自己。当前模型的写作天花板决定了它更适合做辅助工具,而非代笔。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对开发者:写作能力的瓶颈提示了一个潜在的技术机会:如何为长文写作设计专门的训练环境、评估标准和推理时扩展机制,目前仍是空白。Claude Code 这类专用 harness 可能带来局部改善,但 Lambert 认为难以产生“乘法级”的能力提升,这块存在真实的研究空间。

对依赖 AI 做科研的团队:需要重新校准预期。模型在文献整理、跨领域联想、低垂果实型发现上依然有用,但把它们当作能自主推进长线科学问题的“研究代理”还为时过早。

值得关注的后续

一是看 GPT-5 及下一代模型是否会在长文写作上专门投入训练数据,而不只是依赖通用能力的“外溢”;二是观察“写作型推理扩展”是否会出现,也就是让模型在输出前进行更长的内部规划,类似 o1 在数学上的思路;三是关注 Anthropic 等在数学推理上的进展能否真正泛化到更开放、更混乱的知识任务中——目前公开信息显示,这两个方向上都没有明确的落地时间表。

来源:Nathan Lambert:Interconnects(RSS)

celebrityanime
celebrityanime
文章: 18299

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注