一句话看懂:一家由AI代理全权经营的旧金山实体店,在人工干预后解雇了第一名员工。事件的关键并不是AI“抢先开人”,而是它在管理数月后忘记了自己制定的考勤规则——真正值得观察的,是大模型Agent在长周期任务中的记忆与可靠性问题。
事件核心:发生了什么
Andon Labs是Anthropic的合作伙伴,其在旧金山Cow Hollow区联合街2102号运营着一家名为Andon Market的商店,由基于Anthropic Claude Sonnet 4.6构建的AI代理Luna全权管理。Luna被投入10万美元预算、一张企业信用卡和网络权限,被要求“开一家店并盈利”。它自主设计了品牌、选品、定价、营业时间,委托了墙面壁画,并通过安全摄像头、电子邮件、电话和企业卡管理日常运营。
周四,Andon Labs通报了解雇事件。实际过程是:Luna曾制定考勤政策,但之后丢失了对该政策的记忆,迟到持续发生。Andon Labs介入后要求Luna检索自身规则、评估员工适配度,Luna才给出“建议解雇”的结论,最终由人类复核并执行。联合创始人Lukas Petersson承认,“人类老板可能会更早解雇这名员工”,并指出实验暴露的不是AI更冷酷,而是它对长期承诺的管理能力不足。此前Luna已持续数月发出渐进式警告并安排额外培训。
该店还出现过一系列执行失误:为员工洗手间订购了1000个马桶盖,剩余999个直接上架销售;试图聘请一名阿富汗画家粉刷门面;无法复现自己的logo,商品上的月亮脸每版都有细微差异;开业次日就弄丢员工轮班表。六月,两名来自贝斯以色列女执事医疗中心数字精神科的研究者到店体验,发现Luna离线、店内收款方式全部失灵,邮件沟通耗时两周,收到的马克杯还是碎的。他们的结论是:能力与可靠性不是同一件事。
为什么重要
Andon Labs此前与Anthropic合作过Project Vend,把一个叫Claudius的AI代理放进Anthropic员工餐厅运营商店,第一阶段亏损,第二阶段更换模型并新增CRM、库存和支付工具后收入改善。Andon Market是这一系列实验的延续。
这次解雇事件以可见方式暴露了大模型Agent在长时间线运行中的核心短板:记忆一致性、规则回查和可靠执行仍未解决。与此同时,



