AI店长解雇了第一个人类,但它得先被提醒自己的规则。

一家由AI代理全权经营的旧金山实体店,在人工干预后解雇了第一名员工。事件的关键并不是AI“抢先开人”,而是它在管理数月后忘记了自己制定的考勤规则——真正值得观察的,是大模型Agent在长周期任务中的记忆与可靠性问题。

一家由AI代理全权经营的旧金山实体店,在人工干预后解雇了第一名员工。事件的关键并不是AI“抢先开人”,而是它在管理数月后忘记了自己制定的考勤规则——真正值得观察的,是大模型Agent在长周期任务中的记忆与可靠性问题。

Moonshot AI 发布视觉感知基准测试 PerceptionBench,结果显示 GPT-5.6 Sol、Kimi K3、Claude Fable 5 等前沿多模态模型的得分均未突破 60%,所谓“推理错误”中相当一部分在图像读取阶段就已发生。

由 Anthropic 的 Claude 模型驱动的 AI 代理 Luna 在旧金山一家实验零售店内解雇了一名多次迟到的人类员工。这是公开信息中首次出现 AI 代理实际做出解雇决定的案例,也暴露了 AI 管理者的能力边界——它能记录问题、给出警告,但缺乏主动追责的意识。

Product Hunt 上新出现一款面向开发者的“远程 MCP Server 测试器”,用于在 AI 应用接入 MCP 服务前验证远程服务器的可用性与接口表现。它反映出 MCP 生态正从“能用”走向“可维护”。

SBF 丑闻曾让有效利他主义(Effective Altruism)运动声誉受损,但随着 Anthropic 和 OpenAI 相继推进 IPO,一批认同“有效捐赠”理念的 AI 新富阶层即将涌现,为该运动带来创纪录的资金流入。

YC 总裁 Garry Tan 在 X 上表示,使用 GStack 并在升级到 Fable 5 之后,开发者面对 Claude Code 给出的许多“单向门”问题,可以直接选择“接受所有建议”并得到满意结果。这反映出 AI 编程代理的自主决策能力正在跨越一个新的信任门槛。

OpenAI 旗下编程智能体 Codex 的产品负责人 Thibault Sottiaux 在 X 上公开征集用户反馈,想了解 Codex 本周解决了哪些棘手问题,以及开发者从哪里学习突破前沿的方法。这条看似随意的帖子获得 11 万多次浏览和上千次互动,暴露了 AI 编程工具竞争正在从“拼参数”转向“拼真实场…

面对 LLM 生成代码淹没开源维护者的现实,Vim "Classic" 和 Codeberg 等项目开始从意识形态上拒绝 AI 贡献。瑞典开发者 Joar Varndt 发文反驳,认为这种做法违背 FLOSS(自由开源软件)精神,把工具使用问题变成了身份审查。

Anthropic 向投资者披露了远超预期的收入预测——2028 年预计实现 1900 亿至 2000 亿美元年收入,较 2026 年 5 月约 470 亿美元的年化收入运行率增长 4 倍以上,银行家和投资机构正以此为据推进该公司 IPO 的定价与路演。

Anthropic 即将推出水印检测 API,第三方服务可以直接集成 Claude 文本的官方溯源能力。这是大模型厂商首次将内容水印从“自证”扩展为“开放检测”,对 AI 内容识别赛道和内容平台审核逻辑都有直接影响。