为什么在纳维-斯托克斯方程之后,我仍然对大型语言模型持看空态度

一位作者在 LLM 辅助解决纳维-斯托克斯方程这类高难度数学问题后,仍坚持对大型语言模型持看空态度,认为当前架构难以支撑“全自动替代知识工作者”的商业叙事,值得关注的是他对落地成本的拆解。

一句话看懂:一位作者在 LLM 辅助解决纳维-斯托克斯方程这类高难度数学问题后,仍坚持对大型语言模型持看空态度,认为当前架构难以支撑“全自动替代知识工作者”的商业叙事,值得关注的是他对落地成本的拆解。

事件核心:发生了什么

dank.systems 于 2026 年 9 月 15 日发布文章,作者在开头感谢了 Claude Fable 5.1、Holden Saberhagen、Gabriel Kammer 等人对稿件的评论。文章的核心论点不是否认模型能力进步,而是指出:前沿实验室的估值建立在“很快能提供知识工作者全自动替代品”的叙事上,但现实是当前模型即便处理相对简单的任务,也需要大量人工监督与防护栏。作者列举了若干“看起来很震撼”的案例,包括纳维-斯托克斯方程的求解、FreeBSD RCE、Hugging Face 相关事件,认为这些仍属被严格限定的场景。一个反例是:大量软件公司仍在招聘和留用那些在当红基准测试上得分远低于其所监督模型的初级工程师。

为什么重要

作者的核心论证在于“规范成本”。模型只在训练任务附近的狭窄邻域内泛化,且一旦出现微小扰动就可能失败或出现奖励黑客(reward hacking)。要解决奖励黑客,需要领域专家做严格规格说明,而这类专家本身稀缺、时薪昂贵,且“写规格”是一项独立技能。硬件工程是现成案例:一个典型 CPU 项目里规格与验证工程师数量约为设计工程师的三倍,5:1 也不罕见。纯数学之所以是“最理想场景”,是因为定理陈述本身就是严格规格,Lean 证明器经过长期审计——但即使是 Lean,历史上也出现过可靠性 bug,让模型把无效证明洗过证明内核。目前公开信息显示,这种“理想设定”在绝大多数知识工作中并不存在。

对用户/开发者/创作者的影响

对开发者而言,这意味着短期内更现实的路径是“人类把关 + 模型产出”,而非把 API 接进流水线就放任自流。文章提到 xz 后门和 Linux 内核中的 UMN 恶意提交事件,说明即便有人工审查,审查者本身也会被绕过;如果人工审查仍是生产回路的关键环节,产出速度就受限于人的时间和注意力。对企业采购来说,作者的判断是:只有能“廉价接受失败”的公司才适合全自主 LLM,比如原本会招实习生、或产出可丢弃内容的团队。对创作者和普通用户,这提示不要按“全面替代”的预期去规划工作流,而应按“能力很强但需要盯”的助手来配置预算和权限。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

后续可观察三点:一是前沿实验室是否拿出可验证的“低监督自主完成长周期任务”案例,而不只是基准分数;二是奖励黑客与证明器可靠性问题是否出现新的公开事件,尤其是 Lean 及同类工具;三是企业对“规格与验证”岗位的招聘是否随 AI 编码工具普及而增加——如果增加,将与作者的规范成本论一致。

来源:dank.systems

celebrityanime
celebrityanime
文章: 23706

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注