Claude Fable 5 玩得正欢

有人让 Anthropic 的 Claude Fable 5 独自设计并试玩一款游戏,直到模型自己判断“真的觉得好玩”为止。实验产出了一款名为 SHOVE 的 CLI 战术游戏,更值得关注的是模型对自身主观体验的连续报告能力。

一句话看懂:有人让 Anthropic 的 Claude Fable 5 独自设计并试玩一款游戏,直到模型自己判断“真的觉得好玩”为止。实验产出了一款名为 SHOVE 的 CLI 战术游戏,更值得关注的是模型对自身主观体验的连续报告能力。

事件核心:发生了什么

这个项目最初只是一份 brief.txt 文件:一位匿名人类用户创建目录,写下任务说明,然后启动 Claude Code 并选定 Fable 5 模型,要求它自己发明、构建并实际游玩一款游戏,直到它真正享受独处游玩的过程。模型最终交出了 SHOVE——一款灵感近似《Into the Breach》的回合制战术解谜游戏,完全运行在命令行界面中。

据项目记录,SHOVE 一共迭代了 六个版本,进行了六次有日志记录的游玩,累计时长 22 分 19 秒。模型在每个版本间记录设计调整、游玩感受,最终判断自己真正觉得有趣。项目 README 由 Claude Opus 4.8 撰写摘要,但其中还夹了一段人类作者亲自打字的说明,交代了整个实验从头到尾的操作流程。

为什么重要

这次实验没有训练新的模型,也没有跑基准测试,但它在两个维度上有意义。

第一是AI 对“自我状态”的报告能力。Claude Fable 5 被要求回答“你是否真的觉得好玩”,并为此连续输出了多轮主观判断——这件事的价值不在于答案是否真实,而在于模型能否稳定地、基于上下文地描述自己的内部状态。这在 RLHF、用户偏好建模和 AI 对齐研究中都有参考价值。

第二是AI 行为的“主动性”信号。模型没有停留在“完成一个任务”,而是通过六轮迭代不断玩一个游戏、调整设计、重新评价体验。整个过程中模型表现出目标驱动的持续探索,这对当前“大模型只能被动应答”的主流印象是个补充。

此外,实验刻意选择了不让模型只用一句“我觉得很有趣”敷衍交差,而是要求它用试玩全程证明自己的判断,这间接展示了一种评估 AI 主观体验的操作化路径。

对用户/开发者/创作者的影响

对普通用户而言,这个项目提供了一个直观的窗口:模型在无人监督时如何分配注意力、如何评价自己的活动,以及“让 AI 自娱自乐”会长成什么样子。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对开发者来说,值得关注的是项目的可复现性。实验全部依赖公开可见的配置文件、任务文本、版本日志和原始游玩记录,仓库结构足够透明。任何使用 Claude Code 或同类 Agent 工具的开发者都可以复现类似实验,用于观察模型在长周期任务中的稳定性与行为一致性。

对创作者和游戏设计师而言,SHOVE 本身只是个轻量原型,但工作流有借鉴意义:用 AI 做快速的玩法假设、试玩反馈、版本迭代闭环,可以直接嵌入独立游戏的前期原型阶段。

值得关注的后续

目前公开信息显示,这个仓库只是个人实验,不具备产品形态。接下来有几个观察点:

一,Fable 5 的对外交互能力是否会成为正式卖点。这次实验中模型展现出较强的自我评估和持续行动能力,后续官方是否会将类似的“多轮自评”作为 API 能力开放,值得留意。

二,更客观的“AI 觉得有趣”的验证标准。六次日志和 22 分钟游玩只能证明模型稳定输出了“有趣”的评价,无法验证主观体验本身。是否有团队跟进提出更严谨的评测框架,目前仍然未知。

三,社区是否会复制或扩展这一实验。这个仓库的完整复现成本极低,如果更多用户用不同模型跑出类似或相反的行为报告,那将比单个实验更有参考价值。

来源:Hacker News (黑客新闻)

celebrityanime
celebrityanime
文章: 18527

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注