We’re starting to leave the territory where you’d test an LLM by e.g. “create an svg of pelican on a bicycle”. As one idea to generalize it, I was interested what Opus 5 would do if I gave it the first paragraph of th…

Andrej Karpathy 用约 10 美元的成本,让 Claude Opus 5 花两个小时写出了 5500 行代码,把《指环王》第一章做成一个可运行的 3D 场景。这件事本身很粗糙,但它说明大模型的测试方式和能力边界正在发生变化。

一句话看懂:Andrej Karpathy 用约 10 美元的成本,让 Claude Opus 5 花两个小时写出了 5500 行代码,把《指环王》第一章做成一个可运行的 3D 场景。这件事本身很粗糙,但它说明大模型的测试方式和能力边界正在发生变化。

事件核心:发生了什么

Karpathy 在 X 上分享了一次实验:他给 Claude Opus 5 提供《指环王》第一部第一段作为输入,配合 100 万 token 的上下文预算(成本约 10 美元),要求模型用 three.js 把它渲染出来。Opus 5 连续工作了约两小时,写出 5500 行代码,程序化地生成了与故事情节对应的 3D 场景和动画。

Karpathy 评价这个结果是“有点粗糙但有趣”。他也指出,模型在过程中需要反复截图来检查自己的渲染效果,并且确实出现过几次错误。这条推文发布于 2026 年 8 月 2 日,目前浏览量超过 110 万次。

为什么重要

这不是一个“AI 画图”的新纪录,而是一个信号:测试大模型的方式正在从“画一只骑自行车的鹈鹕”这种单轮、单文件任务,转向长时程、多步骤、需要自主规划和修正的复杂工程任务。1M token 的上下文窗口让模型可以持续工作数小时而不丢失目标,这种能力在一年前还不现实。

更值得注意的是成本结构的变化。Karpathy 的原话是:以前这种高度定制化的东西“没有人会花时间去写”,但现在因为成本几乎为零,它变成了“当然可以试试”。这意味着大量原本因为人力成本过高而无法存在的个性化内容,有可能被大模型以极低价格批量生产。

同时,这次实验也暴露了当前模型的短板:LLM 无法直接观看视频或进入 3D 世界去审查自己的作品,只能靠截图这种低效方式逐步确认效果。多模态感知和游戏内操作能力,可能是下一代模型竞争的关键差距。

对用户/开发者/创作者的影响

对创作者来说,这类实验展示了一种新可能:用自然语言描述一段小说、一个设定或一个世界观,就能得到一个可探索的 3D 场景雏形。虽然现在的输出还远谈不上精致,但“按需生成一个迷你世界”的成本已经低到可以频繁试错。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对开发者而言,这个案例的价值在于参考价值。5500 行代码、两小时连续工作,说明当前大模型已经可以承担超长编程任务;但 Karpathy 提到的“模型需要截图自查”也提醒开发者,为模型设计可反馈的执行环境,比单纯堆算力更重要。未来更实用的方向可能是让模型直接获得屏幕画面理解能力,而非依赖文本日志。

对 API 使用者来说,1M token 预算 10 美元的价格如果持续,会直接打开一批需要长上下文和高输出的应用场景,包括自动化游戏开发、动态叙事系统和个性化互动内容。

值得关注的后续

一是 Claude 后续版本或竞品模型是否会跟进类似的“长时程 3D 生成”测试,以及它们能否做到免截图、实时自检;二是这类 5500 行 AI 生成代码的可靠性问题,未来是否会出现更成熟的自动测试与校验工具;三是 API 定价能否在长上下文需求增长的背景下继续下降,这决定了“按需生成世界”能不能从实验变成产品。

来源:Follow Builders · X · Andrej Karpathy

celebrityanime
celebrityanime
文章: 16513

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注