一句话看懂:GPT-6 Astra 在《宝可梦 火红》中仅用约 18 小时通关,远超前代模型近百小时的成绩,并首次在《我的世界》中推进到末地传送门阶段;但一次苦力怕爆炸让它丢失全部关键物资,随后数小时只在种土豆。
事件核心:发生了什么
根据 Vals AI 的公开记录,GPT-6 Astra 在一场《我的世界》长程测试中运行超过 141 小时,是迄今该系统记录到走得最远的 AI。它在地狱搭建半自动烈焰人农场、击杀多名末影人,并集齐烈焰棒与末影珍珠,凑齐合成末影之眼的材料——这是通往最终战的关键物品。数千名观众围观了直播。然而一只苦力怕炸毁了存放物资的箱子和床,Astra 意识到时还下起了雨。它写下一句部分大写的笔记,提醒自己“关键物品必须随身携带”,随后数小时几乎只种土豆。
在其他游戏中,这个模型的优势更直观:《宝可梦 火红》通关耗时 18 小时 12 分,而 GPT-5.6 Sol 用了 96 小时 35 分,GPT-5.5 超过 218 小时仍未通关;在《Factorio:太空时代》中约两小时产出蓝色科技包、十小时发射首枚火箭,GPT-5.6 Luna 和 Fable 5.1 连供电和石油勘探都没过。ARC-AGI-3 基准上,Astra 标准接口得分 62.7%,OpenAI 自有测试环境接近 99.9%,而 GPT-5.6 Sol 仅 7.78%。
为什么重要
关键不在游戏分数,而在能力路线的变化。ARC Prize 的解释是,Astra 会把陌生游戏机制翻译成紧凑的符号化描述,自行发明一套简写来跟踪对象、坐标、规则和行动计划——观察变成规则,规则变成计划。这与 2023 年 Nvidia、Caltech 参与的 Voyager 项目思路一致,但 Voyager 依赖结构化数据和 Mineflayer 编程接口,等于“开挂”;Vals AI 的《我的世界》测试走的是通用电脑操作,只用屏幕、鼠标和键盘。过去研究者要在模型外面搭的脚手架,现在模型自己能长出来。这对依赖 API 做 AI 应用的开发者意味着:任务规划与工具调用的自主性,可能不再需要那么多外部编排。
对用户/开发者/创作者的影响
对开发者,值得关注的是通用计算机操作能力的稳定性——它能连续上百小时执行长程任务并自我修正,这类能力迁到浏览器自动化、桌面软件操作或复杂工作流编排上,会直接影响 Agent 产品的设计取舍。对企业和创作者,短期更现实的用途是多步骤流程代理,而非“AI 自己打通所有游戏”。此外,Astra 的失败案例同样有参考价值:一次意外就丢失关键状态,说明长程任务中的状态管理和检查点机制仍是工程重点。目前公开信息显示,这些测试多为社区或第三方跑分,并非官方产品发布。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 OpenAI 是否把这种符号化规则学习和通用操作能力开放到 API 或 Codex 类产品中;二是 Vals AI 等第三方是否会发布可复现的测试协议与成本数据,毕竟 141 小时的推理消耗不是小数目;三是 GPT-5.6、Claude Opus 5 等竞品会不会跟进长程游戏基准,把它变成新的能力对比维度。


