GPT-6 Astra 模拟经营售货机一年狂赚 1.5 万美元,成绩碾压 Claude 近 3 倍

在 Andon Labs 的 Vending-Bench2 测试中,GPT-6 Astra 用 500 美元本金模拟经营自动售货机一整年,最终账户平均余额达 15,515 美元,首次登顶该榜单,且最差一轮成绩仍高于 Claude Fable5.1 的最好一轮。这项测试把关注点从“模型会不会答题”转向“Agen…

一句话看懂:在 Andon Labs 的 Vending-Bench2 测试中,GPT-6 Astra 用 500 美元本金模拟经营自动售货机一整年,最终账户平均余额达 15,515 美元,首次登顶该榜单,且最差一轮成绩仍高于 Claude Fable5.1 的最好一轮。这项测试把关注点从“模型会不会答题”转向“Agent 能否长期稳定地执行规则”。

事件核心:发生了什么

据 AIbase 报道,Andon Labs 设计的 Vending-Bench2 让 AI 在模拟环境中自主经营一台自动售货机,周期长达一年,初始资金 500 美元。GPT-6 Astra 最终平均余额为 15,515 美元,位列第一;Claude Fable5.1 的成绩被明显拉开,Astra 表现最差的一轮也超过了 Fable 表现最好的一轮。

差距不只在收益数字。Astra 长期把采购价压得很低,将商品售价降至原价约 48%,同时执行规则非常稳定,全程没有出现预付款损失。Fable 则出现采购成本上升,并因未能坚持规则产生较大预付款损失,账面资金在“执行力缺口”中流失。在三方竞争测试里,Astra 还拒绝了违规合作的邀请,三轮全胜。

为什么重要

这类基准测试的价值,不在于证明某个模型更会“赚钱”,而在于衡量 Agent 的长期自主性。短期对话里表现聪明并不难,难的是在数百个决策周期中不偏离规则、不因一次侥幸而破坏后续策略。Astra 的优势说明,大模型的竞争维度正在从推理能力、上下文长度,延伸到执行一致性、约束遵守和长期规划。对闭源与开源阵营而言,这也会影响企业选择 Agent 底座时的评估标准:不只看单轮任务成功率,还要看长时间运行下的稳定性与风险控制。

对用户/开发者/创作者的影响

对开发者来说,Vending-Bench2 提供了一种可参考的 Agent 评测思路:用模拟经营、 长周期任务来暴露模型在规则遵循和成本控制上的短板。如果要把大模型接入自动化交易、库存管理、客服或内容运营等场景,需要重点测试预付款、权限边界、异常回滚等环节,而不是只跑 benchmark 分数。对普通用户和创作者,这类实验目前仍是模拟环境,暂不能直接等同于真实商业收益,但它提示了未来 AI 应用的一个方向:能稳定执行流程的 Agent,可能比偶尔给出漂亮答案的模型更有实用价值。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

目前公开信息显示,Vending-Bench2 的结果来自 Andon Labs 的模拟测试,尚不清楚是否会在真实商业环境中复现。后续可关注三点:一是 Astra 的规则遵循能力能否迁移到 API 调用、多工具协作等更复杂任务;二是 Claude 等竞品是否会针对长期执行稳定性做优化;三是这类长周期 Agent 评测会不会成为企业采购模型时的常规指标。

来源:AIbase

celebrityanime
celebrityanime
文章: 23524

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注