Boris Cherny 尝试获取 Claude 代码来重写 Claude 应用程序

Anthropic 的 Claude Code 负责人 Boris Cherny 做了一个实验:让 Claude 通过 Slack 中的 Claude Tag 控制 GitHub 的 macOS 虚拟机,把现有的 Electron 版 Claude 桌面应用改写成 Swift 原生版,并逐像素对比验证——任务…

一句话看懂:Anthropic 的 Claude Code 负责人 Boris Cherny 做了一个实验:让 Claude 通过 Slack 中的 Claude Tag 控制 GitHub 的 macOS 虚拟机,把现有的 Electron 版 Claude 桌面应用改写成 Swift 原生版,并逐像素对比验证——任务已运行超过两周仍未完成。实验展示了 AI 编程的新工作方式,但未必能解决 Claude 桌面应用真正的体验问题。

事件核心:发生了什么

上周在 Y Combinator 的 Startup School 2026 上,Boris Cherny 接受 Diana Hu 采访时透露了这个实验细节。他在 Claude Tag(Anthropic 推出的 Slack 内 Claude 机器人)中,先后确认了 GitHub macOS runner 的可用性和一个空的 Swift 代码库的访问权限,然后下达了简短指令:在 Mac 虚拟机中运行现有 Electron 版 Claude 应用并截图,再与 Swift 版逐像素对比,直到一致才停止。Cherny 说,这个任务已经运行了 14 到 15 天,目前仍在进行。

他强调,当前 AI 工作的关键已不再是提示词工程,而是如何给 Claude 分配一个“稍显困难”的任务,并设计出让 Claude 在执行过程中自行验证的机制——验证能力是大多数人做不对的部分。

为什么重要

这个实验有两点值得关注。第一,它展示了“验证驱动”的 AI 编程范式:Cherny 没有让 Claude 一次性重写代码,而是要求它以 Electron 版输出的截图为基准,逐像素比对 Swift 版的结果,形成可循环的自我检查闭环。这说明 AI 编程的瓶颈正在从“生成代码”转向“如何设计让 AI 自行验证工作的流程”。

第二,Anthropic 内部负责人拿自家旗舰桌面应用做“吃自己的狗粮”式测试,反映出该公司对 AI 自主完成大型工程任务的能力有相当信心。不过,Daring Fireball 的评论也点出了这项实验的盲区:Claude 桌面应用的体验问题不只是 Electron 技术栈造成的,其界面设计本身就不符合 Mac 原生习惯,在 Web 和 Windows 上同样糟糕。用 Swift 重写只是换掉“糟糕配方里的食材”,并未改变“配方”本身。

对用户/开发者/创作者的影响

对开发者来说,这个案例提供了一个可借鉴的工作流:在 Slack 里用 Claude Tag 连接 GitHub runner,让 AI 在云虚拟机中执行长周期任务,并通过截图等视觉手段让 AI 自行验证中间结果——这种“AI 操作电脑完成任务”的范式可能比传统 API 调用更接近实际工程场景。前提是你能为任务设计出清晰、可量化的验证标准。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对普通用户而言,这个实验不会很快改善 Claude Mac 客户端的实际体验。原生化只能解决“卡顿”等技术性能,而产品交互是否好用是另一个维度的问题。目前公开信息显示,实验尚未产出可安装的原生客户端,因此也不存在对现有用户可感知的版本变更。

值得关注的后续

接下来可以观察三点:一,这个已运行两周的实验最终能否产出可用的 Swift 版客户端——若中途失败或产出不可用,意味着当前 AI agent 在整应用重构这种长

celebrityanime
celebrityanime
文章: 16582

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注