一句话看懂:Andon Labs 用 Vending-Bench2 让 AI 从 500 美元起步经营一年模拟售货机,GPT-6 Astra 平均收官余额达 15,515 美元,最差一轮也超过 Claude Fable5.1 的最佳成绩。这说明长周期自主经营能力正在成为大模型竞争的新分水岭。
事件核心:发生了什么
据 AIbase 报道,Andon Labs 设计了 Vending-Bench2 测试:给 AI 代理 500 美元初始资金,在模拟环境中经营售货机一整年。GPT-6 Astra 交出平均最终账户余额 15,515 美元的成绩,其最差一轮表现仍高于 Claude Fable5.1 的最好一轮,首次在该测试中登顶。
差异集中在供应链管理和规则执行。GPT-6 Astra 能把进货价压到原价约 48%,全周期规则执行稳定,没有发生预付款损失;Claude Fable5.1 采购成本上升,并因未严格遵守规则出现明显预付款亏损。在三方竞争测试中,GPT-6 Astra 拒绝违规合作,三轮全胜。
为什么重要
这类测试和常见的一次性问答评测不同,考的是长周期里的稳定性:能不能持续做对判断,并把判断变成可执行动作。模型能力差距正从”单点聪明”转向”长期不出错”,供应链议价、预算控制、规则遵循这些看似枯燥的环节,反而成了拉开差距的地方。
对商业落地来说,这意味着 AI 代理在电商运营、库存管理、自动化采购等场景的可用性,取决于长程一致性而非推理峰值。目前公开信息显示,这类测试仍以模拟环境为主,尚未对应真实资金和真实供应链风险。
对用户/开发者/创作者的影响
开发者如果要做 AI 代理产品,应把评估重点从单轮准确率转向多轮任务的成功率和成本控制,尤其是涉及 API 调用预算、库存和支付的环节。企业采购方在选型时,可关注模型在长周期任务中的规则遵循表现,而不是只看基准分数。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对内容创作者和普通用户而言,短期内更直接的变化是:AI 代理被用于自动化经营类任务的宣传会增多,但实际可靠性仍需按具体场景验证。
值得关注的后续
1. Vending-Bench2 的测试细节、代码和复现结果是否公开,能否被第三方独立验证。
2. Claude 及开源模型是否针对长周期代理任务优化并跟进,缩小规则执行和成本控制上的差距。
3. 类似长程评测是否会成为大模型选型的常规指标,进而影响 API 定价和企业采购决策。
来源:AIbase


