别被骗了——LLM 并不会推理

《麻省理工科技评论》刊文指出,以 ChatGPT 为代表的大模型并不具备真正的推理能力——它们的"思维链"仍是同一个 token 预测流程的延长版,缺少独立可检查的推理机制,这在医疗、科研等高风险场景中值得警惕。

一句话看懂:《麻省理工科技评论》刊文指出,以 ChatGPT 为代表的大模型并不具备真正的推理能力——它们的”思维链”仍是同一个 token 预测流程的延长版,缺少独立可检查的推理机制,这在医疗、科研等高风险场景中值得警惕。

事件核心:发生了什么

文章以 2016 年 AlphaGo 对阵李世石第二局的”第 37 手”为切入点。这一手在人类棋手数据库中出现的概率约为万分之一,最终 AlphaGo 以 4-1 取胜,李世石赛后称其”富有创造性”。作者澄清:这并非纯粹的机器直觉,而是 AlphaGo 策略网络(提供直觉式落子倾向)与搜索机制(显式构建并搜索数千分支的博弈树)协同的结果,对应丹尼尔·卡尼曼所说的”系统 1 + 系统 2″双系统思维。

相比之下,如今的大模型只做一件事:反复预测下一个 token。无论是基础模型还是加了 chain of thought 的推理模型,中间步骤仍由同一套 next-token 预测流程生成。文章列出三点关键差距:缺少显式、持久、可检查的认知状态台账;知识存储与知识操作在神经网络权重中纠缠不清;思维链常被研究证实是”事后编造”——模型用一条路径得出答案,却报告另一条路径。

为什么重要

这直接触及当前 AI 行业的技术路线之争。OpenAI、Anthropic、Google 等厂商正把”推理模型”当作下一代产品的核心卖点,抬高 API 定价并主打数学、编程能力。但文章认为,思维链带来的提升虽然真实(尤其在数学和编码任务上),本质上仍是让同一个模型”想久一点”,而非引入独立的推理模块。如果这一判断成立,那么模型在医疗诊断、工程设计、科学研究等需要解释”为什么得出这个结论”的场景中,可信度会被高估。对愿意为”推理能力”支付溢价的开发者和企业采购方而言,这是采购决策中需要纳入的风险项。

对用户/开发者/创作者的影响

普通用户应降低对推理模型”逻辑严谨”的默认信任,尤其是在医疗、法律、财务等高风险咨询中,思维链输出的解释未必对应真实的计算过程。开发者在构建 AI 应用时,不宜把模型的中间推理步骤直接当作可审计的依据,涉及关键决策的 API 调用链应保留外部验证环节。创作者若用大模型处理需要严密论证的内容,仍建议人工复核结论与论据是否自洽。目前公开信息显示,文章并未提出具体的替代技术方案或产品改动建议。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一,主流厂商是否会在下一代模型中引入独立于 token 预测的搜索或状态管理机制,并公开技术细节。二,学术与工业界能否给出可量化的评测方法,区分”看起来在推理”和”真的在推理”,这可能影响未来模型评测榜单的设计。三,监管层面是否会因医疗、自动驾驶等场景的可解释性要求,对纯思维链方案提出额外合规约束。

来源:Hacker News · 24h最热

celebrityanime
celebrityanime
文章: 26965

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注