一句话看懂:Anthropic 正在让 Claude Code 以“值班工程师”身份处理自家软件的日常维护,几周内生成 388 个 Pull Request,经人工审查后合并 180 个,合并率约 46%。这是 AI 编码从“辅助生成”走向“自主维护”的一次真实压力测试。
事件核心:发生了什么
据 The Decoder 报道,Anthropic 工程师 Boris Cherny(Claude Code 的创造者)在社交平台上披露,Claude Code 已在过去几周内负责 Anthropic 内部应用的日常维护。Claude 通过一个名为“proj-claude-maintains-apps”的 Slack 频道,以自然语言接收指令,围绕公司所有平台(iOS、Android、桌面、Web、CLI 和 Agent SDK)运行 12 套维护例程。
这些例程覆盖了代码维护的典型场景:“崩溃模糊测试”会在模拟器中随机操作应用以触发崩溃、分析根因并生成修复;“重复实现合并器”扫描代码库中相似但略有差异的抽象并提议合并;“死代码删除”先为可疑代码添加日志,次日确认未被使用后再移除。其他例程还包括逻辑简化、无效测试清理、功能开关移除、不稳定 CI 测试修复等。
公开数据显示,Claude Code 在首批几周内创建了 388 个 Pull Request,经自动审查和人工复核后,其中 180 个被合并,合并率约为 46%。Cherny 表示,Claude 通常能一次写对 PR,失败时团队会调整例程细节,让 AI 次日做得更好。
为什么重要
这则新闻的关键不在于“AI 能写代码”,而在于 AI 开始承担持续性的、跨仓的日常维护工作。46% 的合并率说明,在有人类审查兜底的前提下,AI 生成的代码已经可以进入真实生产仓库,且能覆盖崩溃定位、重复抽象合并、死代码清理等繁琐但必要的工程任务。
对行业而言,这验证了一种新的分工形态:人类工程师定义维护目标、审查关键变更,AI 负责执行大量机械性、重复性的代码操作。Anthropic 用自家产品维护自家软件,既是 dogfooding,也为其 Agent 能力积累了真实的工程场景数据。相比通用的代码生成演示,这类生产环境中的合并率数据更有参考价值。
同时值得注意:超过一半的 PR 并未被合并。这既说明当前自主维护仍存在明显上限,也意味着“自动生成的代码”与“可合入的代码”之间仍有相当距离——这种距离恰恰定义了未来 AI 编码工具的优化方向。
对用户/开发者/创作者的影响
对开发者来说,Claude Code 的这套实践暗示了一种可复制的工作流:用自然语言在 Slack 等界面中给 AI 下达维护例程,AI 自动执行、提交 PR、接受审查。对于需要维护多平台应用的小团队或独立开发者,这类能力有望降低日常维护的精力成本。但 46% 的合并率也提醒开发者,自动生成的 PR 仍需人工严格把关,不能直接信任。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对使用 AI 编程工具的企业团队而言,这个案例提供了衡量 Agent 效果的参考指标:不仅看生成代码的速度,更要看合并率、返修周期和人工介入成本。Anthropic 目前正在优化机械性变更的合并流程,后续若合并率进一步提升,类似的自主维护模式可能被更多团队采纳。
值得关注的后续
目前公开信息显示,至少有三个观察点值得跟进:其一,随着例程持续调优,Claude Code 生成的 PR 合并率能否从 46% 继续提升,以及提升的瓶颈在代码审查环节还是生成质量;其二,Anthropic 是否会把这套维护能力产品化,开放给外部开发者在自己的代码仓库中使用;其三,GitHub Copilot、Cursor 等竞品是否会在“自主维护”方向跟进,推动 AI 编码从“辅助写码”转向“独立处理工程任务”。此外,这类自主变更在大型代码库中的安全边界和责任划分,也会成为企业采用时的重要考量。


