一句话看懂:Anthropic 的 Claude Code 负责人 Boris Cherny 做了一个实验:让 Claude 通过 Slack 中的 Claude Tag 控制 GitHub 的 macOS 虚拟机,把现有的 Electron 版 Claude 桌面应用改写成 Swift 原生版,并逐像素对比验证——任务已运行超过两周仍未完成。实验展示了 AI 编程的新工作方式,但未必能解决 Claude 桌面应用真正的体验问题。
事件核心:发生了什么
上周在 Y Combinator 的 Startup School 2026 上,Boris Cherny 接受 Diana Hu 采访时透露了这个实验细节。他在 Claude Tag(Anthropic 推出的 Slack 内 Claude 机器人)中,先后确认了 GitHub macOS runner 的可用性和一个空的 Swift 代码库的访问权限,然后下达了简短指令:在 Mac 虚拟机中运行现有 Electron 版 Claude 应用并截图,再与 Swift 版逐像素对比,直到一致才停止。Cherny 说,这个任务已经运行了 14 到 15 天,目前仍在进行。
他强调,当前 AI 工作的关键已不再是提示词工程,而是如何给 Claude 分配一个“稍显困难”的任务,并设计出让 Claude 在执行过程中自行验证的机制——验证能力是大多数人做不对的部分。
为什么重要
这个实验有两点值得关注。第一,它展示了“验证驱动”的 AI 编程范式:Cherny 没有让 Claude 一次性重写代码,而是要求它以 Electron 版输出的截图为基准,逐像素比对 Swift 版的结果,形成可循环的自我检查闭环。这说明 AI 编程的瓶颈正在从“生成代码”转向“如何设计让 AI 自行验证工作的流程”。
第二,Anthropic 内部负责人拿自家旗舰桌面应用做“吃自己的狗粮”式测试,反映出该公司对 AI 自主完成大型工程任务的能力有相当信心。不过,Daring Fireball 的评论也点出了这项实验的盲区:Claude 桌面应用的体验问题不只是 Electron 技术栈造成的,其界面设计本身就不符合 Mac 原生习惯,在 Web 和 Windows 上同样糟糕。用 Swift 重写只是换掉“糟糕配方里的食材”,并未改变“配方”本身。
对用户/开发者/创作者的影响
对开发者来说,这个案例提供了一个可借鉴的工作流:在 Slack 里用 Claude Tag 连接 GitHub runner,让 AI 在云虚拟机中执行长周期任务,并通过截图等视觉手段让 AI 自行验证中间结果——这种“AI 操作电脑完成任务”的范式可能比传统 API 调用更接近实际工程场景。前提是你能为任务设计出清晰、可量化的验证标准。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对普通用户而言,这个实验不会很快改善 Claude Mac 客户端的实际体验。原生化只能解决“卡顿”等技术性能,而产品交互是否好用是另一个维度的问题。目前公开信息显示,实验尚未产出可安装的原生客户端,因此也不存在对现有用户可感知的版本变更。
值得关注的后续
接下来可以观察三点:一,这个已运行两周的实验最终能否产出可用的 Swift 版客户端——若中途失败或产出不可用,意味着当前 AI agent 在整应用重构这种长


