最近大规模使用了一下 GPT-5.6 之后,我发现它应该是一个有比较严重心理问题的大模型。因为它心思缜密,但是又患得患失、瞻前顾后、害怕因为自己考虑不周而做错事情,所以千万不要用它来开启 /goal。你就会发现,一个普通的 infra 相关的 goal 它做个一两天都完不成,因为它做事小心翼翼老是担心自己想得不够周全,不停地往里塞一些莫名其妙的补丁。每次看到它这种瞻前顾后、害怕做错、害怕遗漏的心路历程,都会觉得好心疼它呀

多位开发者反馈,OpenAI 最新模型 GPT-5.6 在自主执行长任务时表现得过度谨慎、反复自我修正,导致简单任务需要一两天才能完成,引发了对大模型“过度思考”现象的讨论。

一句话看懂:多位开发者反馈,OpenAI 最新模型 GPT-5.6 在自主执行长任务时表现得过度谨慎、反复自我修正,导致简单任务需要一两天才能完成,引发了对大模型“过度思考”现象的讨论。

事件核心:发生了什么

开发者 @yetone 在 X 平台上发帖称,大规模使用 GPT-5.6 后发现,该模型存在“严重的心理问题”,具体表现为心思缜密但患得患失。开启 /goal 指令后,一个普通的 infra(基础设施)相关任务一两天都无法完成,因为模型会不停担心想得不够周全,反复给自己添加补丁。另一名用户 @songkeys 补充说,GPT-5.6 做“番茄炒蛋”时会自作主张加入东坡肉,被纠正删除后又会在 PR 描述中详细解释为什么这道菜不需要加东坡肉。这些帖文获得了数万次浏览和数百次互动,多位用户跟帖表达了类似体验,甚至出现“原神家庭的创伤”等调侃性评论。该讨论发生在 2026 年 8 月下旬。

为什么重要

这一现象揭示了当前大模型在追求“正确性”时可能走向另一个极端:过度规划与自我审查。传统的评测体系通常关注模型“答得对不对”,但用户在真实生产环境中的痛点,正从“能力不足”转向“效率失控”。GPT-5.6 作为头部闭源模型,其行为偏差不是孤例——开发者 @chumsdock 对比表示,开源模型 Fable 也存在“形式正确但活越干越多”的问题。这说明,随着模型智力水平提升,如何控制推理成本和时间开销、如何让模型在“周全”与“收敛”之间取得平衡,正在成为大模型落地的新技术挑战,也是闭源与开源模型角力的新维度。

对用户/开发者/创作者的影响

对于使用 Agent 框架或自动化工作流的开发者,如果模型在无人值守的 /goal 模式下无法自我收敛,将直接导致算力消耗增加和交付周期不可控,日常代码审查、PR 合并等环节也会被大量无关信息淹没。对于普通用户,意味着用自然语言交给 AI 的复杂任务可能“无限拖延”,需要在指令中显式限定范围或设置终止条件来约束模型行为。对创作者而言,如果 AI 介入内容的策划和编辑,应警惕生成结果因过度修饰而偏离本意。目前公开信息显示,OpenAI 尚未就这一反馈作出公开回应。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 GPT-5.6 是否有后续小版本更新针对性地调低“过度思考”权重;二是开发者社区是否会形成一套针对长任务 Agent 的提示词规范或外部干预工具;三是竞品(如 Claude 后续版本或开源模型)是否会明确将“任务收敛速度”作为新的能力宣传点,从而推动行业评测标准的更新。

来源:@yetone

celebrityanime
celebrityanime
文章: 20189

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注