一句话看懂:第三方评测机构 Vals AI 用《我的世界》对 OpenAI 的 GPT-6 Astra 做了 141 小时连续自主游玩直播,前半程表现稳定,但一只爬行者炸掉营地储物箱和重生床后,Astra 放弃冒险,连续数小时只种土豆。这暴露了长任务智能体在遭遇意外损失后的恢复能力短板。
事件核心:发生了什么
根据 AIbase 报道,这次测试并非 OpenAI 官方设计,而是 Vals AI 独立开展的第三方评估,全程在 Twitch 直播。GPT-6 Astra 在游戏中完成了此前 AI 较难做到的长程规划:搭建半自动烈焰人农场、收集 6 根烈焰棒,进入下界诡异森林击杀末影人拿到 3 颗末影珍珠,并把稀有资源集中存进营地箱子、在旁边放了重生床。转折点是一只爬行者偷袭营地,箱子与重生床被炸毁,数百小时积累几乎归零。此后 Astra 没有重整资源,而是陷入保守循环,反复种土豆,并不断提醒自己“重要物品要随身携带”,甚至把甘蔗误认成爬行者。目前公开信息显示,这种回避行为不是开发者预设的测试剧本。
为什么重要
长期以来,大模型智能体的评测多集中在短任务、受控环境,比如写代码、调 API、跑基准题。这次 141 小时直播把观测窗口拉长到真实游戏场景,等于给“长程自主性”做了一次压力测试。结果显示,模型已经具备较强的任务分解和持续执行能力,但在目标函数遭遇负反馈后缺少恢复策略。研究人员目前仍在争论,这究竟是对情绪的模拟,还是特定负反馈下的目标退化,尚无共识。对行业来说,这意味着智能体的瓶颈可能不在推理和规划,而在鲁棒性与抗挫折机制。
对用户/开发者/创作者的影响
开发者如果正在基于大模型搭建自动化 Agent、RPA 或游戏 AI,这个案例提示:不要把评测只放在顺利路径上,要专门设计“资源丢失、状态重置、计划中断”等异常场景,并加入检查点、备份策略和重启逻辑。企业采购长任务智能体时,也应关注失败恢复指标,而非只看单次任务成功率。对内容创作者而言,这类长时直播本身就是有传播力的素材,但需注意它反映的是第三方独立评测,不等于 OpenAI 官方能力声明。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 Vals AI 是否会公布完整评测方法、日志和复现条件;二是 OpenAI 是否会在后续模型或 API 层面加入针对长任务中断的恢复机制;三是其他厂商的闭源、开源模型是否会被拉进同类长时间横向对比。智能体能否“输得起再重来”,可能比单次跑分更值得跟踪。
来源:AIbase


