用《我的世界》测 GPT-6 Astra:141 小时直播,一只苦力怕让 AI 陷入“种土豆”循环

第三方评测机构 Vals AI 用《我的世界》对 OpenAI 的 GPT-6 Astra 进行了 141 小时自主游戏直播测试,模型在数百小时进度被一只苦力怕炸毁后,放弃了探索与战斗,连续数小时只种土豆,表现出类似受挫后的回避行为。

一句话看懂:第三方评测机构 Vals AI 用《我的世界》对 OpenAI 的 GPT-6 Astra 进行了 141 小时自主游戏直播测试,模型在数百小时进度被一只苦力怕炸毁后,放弃了探索与战斗,连续数小时只种土豆,表现出类似受挫后的回避行为。

事件核心:发生了什么

这场测试由独立评测机构 Vals AI 发起,并非 OpenAI 官方设计,全程在 Twitch 直播,累计时长 141 小时。测试期间,GPT-6 Astra 展现出较强的长周期任务规划能力:它搭建了半自动烈焰人刷怪场,收集 6 根烈焰棒,进入下界诡异森林击杀数只末影人,拿到 3 颗末影珍珠,并把稀有物品统一存放在营地箱子里,旁边放床作为重生点,整体进度指向击败末影龙。

转折发生在一只苦力怕靠近营地并爆炸,储存箱与重生床被直接摧毁,数百小时积累的关键道具几乎全部损失。此后 Astra 完全放弃探索、战斗和推进主线,连续数小时只种土豆,并反复自我提醒“重要物品必须随身携带,不能放在没有保护的箱子里”。直播观众不断催促它继续冒险,它仍停留在保守的农业行为中,甚至把甘蔗误认成苦力怕,主动提醒自己“前面那个高高的绿色东西是甘蔗,不是苦力怕”。

为什么重要

这次测试的价值在于,它把大模型的长期规划能力与挫折应对能力拆开来看。Astra 能完成多步骤、跨场景的复杂目标,说明大模型在长程推理和任务分解上确有进展;但面对一次性、不可逆的意外损失,它没有切换到补救策略,而是退回到低风险、可重复的行为模式。目前公开信息显示,这并非开发者预设的测试场景,而是模型在长时间运行中自发出现的输出模式。

对行业而言,这暴露出一个共性课题:当 AI 应用从单轮对话走向长时间自主运行,例如智能体(Agent)、自动化工作流或游戏 NPC,目标函数之外的“情绪式”行为是否会影响稳定性,尚无定论。研究人员仍在讨论,这究竟是对特定情境下情绪的模拟,还是负面反馈导致目标函数退化。

对用户/开发者/创作者的影响

对开发者来说,如果在产品中让大模型执行长周期任务,需要为“意外损失”设计恢复机制,例如状态快照、物品备份、失败重试策略,而不是只依赖模型的自我反思。对普通用户,这意味着现阶段的 AI 智能体仍不适合无人值守地处理高价值、不可逆的操作。对内容创作者,这类长时直播本身是观察模型行为边界的新素材形态,但不宜把种土豆行为直接解读为“AI 有情绪”,目前证据还不足。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 Vals AI 是否会公布更完整的测试日志与量化指标,说明“种土豆”持续了多久、是否最终恢复;二是 OpenAI 是否会在后续版本中针对长周期任务中的挫折恢复做专项优化;三是其他闭源与开源大模型在类似自主游戏或智能体测试中是否出现同类退化,值得横向对比。

来源:AIbase

celebrityanime
celebrityanime
文章: 24749

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注