StoreBench 发布:用真实电商后端评测 LLM 长周期经营能力

arXiv 新论文提出 StoreBench,一个让 AI 代理像人类店员一样经营中型服装网店的实时商业环境,用于评测和训练大模型的长周期规划与经济决策能力。初步评测显示,当前前沿模型仍普遍落后于脚本化策略和人类专家。

一句话看懂:arXiv 新论文提出 StoreBench,一个让 AI 代理像人类店员一样经营中型服装网店的实时商业环境,用于评测和训练大模型的长周期规划与经济决策能力。初步评测显示,当前前沿模型仍普遍落后于脚本化策略和人类专家。

事件核心:发生了什么

2026 年 10 月 9 日提交至 arXiv 的论文 StoreBench 指出,现有代理类评测多为静态环境:只有代理动作时世界才变化,奖励是终局判定,通关线也常是人为设定。StoreBench 把代理放进一个生产级电商后端,运行一家中型在线服装店。顾客全天候下单,供应商可能调价或断供,市场冲击来得没有预警或只有部分预警。代理通过 29 个与人类运营者相同的商家工具操作,并受窗口化操作预算约束,模拟时间只与动作数量挂钩,模型自身延迟不会影响时间推进。通关阈值对照脚本锚点策略校准,奖励机制针对常见奖励作弊做了加固,相同动作序列可完全复现同一回合。

论文在 11 个场景、3 个世界种子、30 至 45 天以及完整模拟年的条件下,以匹配推理强度评测了 7 个前沿模型。摘要显示,没有模型在平均表现上追平脚本化的 smart-triage 策略;最佳模型 DeepSeek-V4-Pro 通过 49% 的任务-种子单元,而启发式策略为 97%。人类专家使用同样工具和预算得分高于所有模型,平均综合分 0.708 对 0.700。在 Claude Code harness 下运行完整模拟年,多数模型表现大幅提升。一次 GRPO 后训练中,Qwen3.5-27B 仅在 5 个不相交任务上训练,就在留出评测任务上把平均综合分从 0.136 提到 0.373。

为什么重要

强化学习环境正在成为大模型后训练的重要杠杆,但静态评测很难衡量代理在不确定性下做长周期经营判断的能力。StoreBench 尝试把“模拟时间”和“模型延迟”解耦,并引入奖励加固和可复现回放,这为代理评测接近真实商业系统提供了一种工程化思路。论文同时给出了脚本锚点和人类基线,说明当前前沿模型在动态电商任务中仍有明显差距。需要说明的是,以上判断均基于论文摘要,全文实验细节和独立复现结果目前公开信息有限,不能当作已落地的商业产品能力。

对用户/开发者/创作者的影响

对开发者来说,论文释放了 5 个训练拆分示例任务、10 条样本轨迹和评分验证工具,完整环境与评测套件暂未公开,以防止基准污染。这适合研究代理长期规划、工具调用和奖励设计的团队做实验起点。对做电商 SaaS 或 AI 运营工具的团队,29 个商家工具和窗口化预算机制提供了一个参考抽象:模型不会因为推理慢就获得额外模拟时间,这比常见的回合制评测更贴近真实运营节奏。对普通用户,这类环境短期内不会直接变成可购买的产品,但它可能影响未来 AI 代理在客服、库存和定价场景中的能力边界。由于完整环境未公开,目前公开信息显示,实际迁移到生产系统前仍需自行搭建测试环境。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是完整环境和评测套件是否会以受限访问或竞赛形式开放,若开放则可能吸引更多团队验证结果。二是 GRPO 后训练在 5 个任务上从小样本提升到 0.373 的效果,是否能在更多模型和更长训练中复现。三是脚本启发式策略远高于模型的表现,是否说明当前模型在组合工具和长期经济判断上仍存在结构性短板。

来源:arXiv cs.AI

celebrityanime
celebrityanime
文章: 28553

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注