Ethan Mollick 谈能力悬差:GPT-6 Astra 与 Fable 5.1 的现有能力远未被用尽

Ethan Mollick 指出,GPT-6 Astra 与 Fable 5.1 现有能力已足以完成数周人类工作量,但绝大多数用户几乎没用到。真正的差距不在模型,而在人是否带上了自己的判断力与品味。

一句话看懂:Ethan Mollick 指出,GPT-6 Astra 与 Fable 5.1 现有能力已足以完成数周人类工作量,但绝大多数用户几乎没用到。真正的差距不在模型,而在人是否带上了自己的判断力与品味。

事件核心:发生了什么

2026 年 9 月 18 日,宾大教授 Ethan Mollick 在其 Substack 专栏 One Useful Thing 发表《The Overhang》一文。他给出两个具体案例:让 GPT-6 Astra 把 1977 年的纯文字冒险游戏 Zork 重制成可玩的 3D 动作冒险游戏;让 Fable 5.1 依据十几段视频、基金会拍摄的书架照片和两份藏书目录,在 3D 空间中重建翁贝托·埃科米兰公寓的藏书布局,把约 5000 本可识别书籍放入 27000 个书架格位,并标注“确定/推测/未知”。此外,他仅凭一句提示,就让模型自主调用 3D 建模软件 Blender、生成脚本、配音、配乐与音效,在 45 分钟内产出新书《Co-Existence》的预告片,随后又按“30 秒动作片风格”改出第二版。Mollick 强调,这些任务若由人类团队完成,需要研究者、程序员和设计师协作数周。

为什么重要

Mollick 提出的“能力悬差”(capability overhang)指向一个被忽视的事实:行业讨论多集中在下一代模型会做什么,却低估了 GPT-6 Astra、Fable 5.1 这类已发布模型的实际上限。他甚至是在模型自行操作 Blender 之后,才知道它具备这项能力。这意味着当前瓶颈不是训练或推理能力,而是用户能否用对提示、给出有效反馈并识别错误。对闭源大模型厂商而言,产品价值正从“参数规模”转向“自主调用工具链”的能力;对开源生态来说,可复用的正是这类多工具编排经验,而非单一模型权重。目前公开信息显示,这些案例都未消耗其付费 ChatGPT 账户的多少 token 预算。

对用户/开发者/创作者的影响

普通用户可先尝试把一件完整小事交给模型端到端完成,而非只做单步问答。开发者值得关注模型自主调度 Blender、视频生成器等外部工具的模式,这对构建 AI 应用与 Agent 工作流有直接参考价值。创作者应意识到,输出本身不再是壁垒,选题、判断与审美才是:Mollick 全程没有参与制作决策,但选择了任务、知道 Zork 和埃科的书该是什么样,并在第一版不对时要求重做。把人类优势作为与模型协作的基础,比试图在产出速度上竞争更有效。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

其一,模型自主操作专业软件(如 Blender)的稳定性与可复现性是否提升,会否开放为 API;其二,这类多工具任务的实际 token 与算力成本是否透明,决定普通用户能否规模化使用;其三,厂商是否会把“能力悬差”转化为产品引导与教程,而非继续堆叠参数宣传。

来源:Ethan Mollick:One Useful Thing(RSS)

celebrityanime
celebrityanime
文章: 24298

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注