Anthropic 如何重构测试影响分析服务以应对智能体编码带来的 CI 压力

Anthropic 披露其测试影响分析服务在 6 个月内遭遇 CI 任务量 25 倍增长,三次临时修补分别只撑了 70 天、29 天和不到 1 天,最终被迫重构架构。这说明智能体编码已经开始反噬软件工程流水线本身。

一句话看懂:Anthropic 披露其测试影响分析服务在 6 个月内遭遇 CI 任务量 25 倍增长,三次临时修补分别只撑了 70 天、29 天和不到 1 天,最终被迫重构架构。这说明智能体编码已经开始反噬软件工程流水线本身。

事件核心:发生了什么

Anthropic 工程师 Sachin Malhotra 在官方博客中披露,公司季度代码交付量已达到 2021 至 2025 年平均水平的 8 倍,其中约 80% 的代码由 Claude 生成,Claude 还大量参与 PR 的评审与批准。代码生产不再是瓶颈,评审提速后压力转移到了 CI:代码库中的测试量增长 10 倍,工程师人数只略有增加,导致 6 个月内 CI 任务量上涨 25 倍。

Anthropic 的测试影响分析服务由两个确定性组件构成:listener 记录每次 CI 运行的测试结果,selector 根据历史数据决定每个 PR 该跑哪些测试。两者必须保持同步,而 v0 架构是单进程、单写入者,无法水平分片。当 CI 任务密集到每秒多个时,listener 开始落后于 PR 队列,20 分钟延迟就可能意味着数万个测试更新未能生效,直接后果是坏改动被合并、脆弱依赖阻塞合并、修复过的测试迟迟不运行。团队先后尝试加大机器、分片和重启服务,效果越来越短暂,最终选择整体重设计。

为什么重要

这是少见的、来自一线 AI 公司关于“智能体编码副作用”的工程复盘。过去讨论 AI 编程多集中在生成质量和效率,而这次暴露的是下游基础设施的承压问题:当代码和测试同时指数级增长,传统 CI 的“每次改动跑全量测试”模式会迅速变得昂贵且不可信。原文作者判断,水平扩展的测试选择架构会成为行业标准。对正在推 AI 编码工具的公司来说,这既是技术债预警,也是产品差异化机会——谁能把 agent 生成的 PR 与智能化的测试选择打通,谁就能让 AI 编码真正跑完闭环。

对用户/开发者/创作者的影响

对使用 Claude Code 等智能体编码工具的开发者,短期内不必担心服务本身,但应意识到:agent 写得越多,CI 等待时间和红色构建噪音可能越多。团队可以考虑引入或自建测试影响分析,让 agent 拿到一组明确有效的测试来自我验证,而不是靠人判断哪些失败与自己无关。对企业采购方,评估 AI 编码平台时,CI 流水线的承载能力和测试选择机制值得纳入考察清单,而不只是看代码生成准确率。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

其一,Anthropic 重构后的测试选择服务是否开源或产品化,可能影响一批 CI 与 DevOps 厂商的路线;其二,其他大规模使用 agent 的公司是否出现类似的 CI 瓶颈,若形成共识,测试影响分析赛道会升温;其三,当 Claude 参与 80% 代码的编写与评审,如何保证测试本身的质量与可信度,目前公开信息显示这一层尚未给出完整答案。

来源:Claude:Blog(网页)

celebrityanime
celebrityanime
文章: 23451

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注