一句话看懂:开发者 cozyblaze 让 GPT-6 Astra 在无人工干预的情况下,耗时约 23 小时 43 分完整通关《传送门》(Portal),全程由 AI 自主完成操作与决策。这被视为大模型从“对话问答”迈向“长时长自主操作”的一次具体技术验证。
事件核心:发生了什么
据 The Decoder 报道,开发者 cozyblaze 在 X 平台发布消息称,OpenAI 的 GPT-6 Astra 模型已完整通关 Valve 经典解谜游戏《Portal》:从设定初始目标开始,模型自主完成全部关卡直至看到通关制作人员名单,全程没有人类介入。整个过程耗时为 23 小时 43 分钟。
这次运行的 Token 消耗按 Astra 官方列表价计算至少为 570 美元,但 cozyblaze 实际使用的是每月 200 美元的 Codex 订阅服务。技术上,模型通过 MCP(模型上下文协议)和修改版的 SourcePauseTool 控制游戏。该工具会在模型“思考”时暂停游戏,并为其提供当前屏幕截图、玩家位置和摄像机角度等信息;模型据此做出下一步操作选择后,游戏再恢复运行。为了观看方便,发布视频已剪掉所有暂停等待片段。相关代码和文档已上传至 GitHub。
cozyblaze 在推文中特别提及,OpenAI 曾在 2016 年设定“用单一智能体解决多种游戏”的目标,而这次自主通关可视为该原始愿景的小范围阶段性呈现。他也评价称,GPT-6 Astra 是“我们未来将拥有的模型中‘最差’的一个”,暗示后续模型还有更大空间。
为什么重要
这次通关的意义不在于“AI 会玩游戏”本身,而在于它展示了大模型在长链条任务中的持续决策与容错能力。《传送门》并非简单反应型动作游戏,它要求模型具备空间推理、物理直觉和跨关卡目标拆解能力。在近 24 小时的连续操作中保持目标一致性,并自行处理意外状态,是 Agent 类应用走向实用化的关键难点。
从商业角度看,公开数据给出的成本信号同样值得行业关注:一次 24 小时的完整游戏通关推理成本约 570 美元。这一数字为开发者评估复杂 Agent 任务的算力成本和 API 定价策略提供了难得的参考基准。同时,模型通过暂停游戏换取“思考时间”的做法,也是一种应对实时性约束的工程惯用方案,对游戏 AI、具身智能和实时控制系统均有借鉴价值。
对用户/开发者/创作者的影响
对于 AI Agent 开发者,这次实验提供了一份清晰的技术参考:使用 MCP 接入外部工具、通过暂停机制绕开实时推理延迟、利用视觉截图加状态信息驱动决策,均为现成可实现的技术路径。cozyblaze 已在 GitHub 开源相关代码,降低了后续复现与二次开发门槛。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对于普通用户而言,这类案例的意义在于直观建立起对“AI 自主操作软件”的能力预期。目前公开信息显示,相关能力仍处于早期玩家实验阶段,距离商业化应用仍有距离;但模型可以长时间自主操作,并按照既定目标逐个拆解执行,暗示了更广泛的软件自动化可能性。对于游戏行业创作者,这则消息也提供了关于 NPC 智能、程序化叙事或自动化测试的想象空间。
值得关注的后续
其一,OpenAI 是否会针对 GPT-6 Astra 的长时间 Agent 任务推出更细化的商用定价或订阅层级,以匹配目前 570 美元/次级别的实际 Token 消耗。
其二,该方案依赖 Valve 游戏引擎的暂停修改工具,尚不适用于实时多人游戏或对操作延迟有硬性要求的场景;未来若出现取消暂停机制的端到端解决方案,将是更重要的技术节点。
其三,其他模型厂商(如 Google、Anthropic、Meta 的开源阵营)是否会在类似长时程 Agent 挑战中跟进展示对标结果,将直接检验各家在多步推理与状态跟踪上的真实代差。


