一句话看懂:开发者 Peter Steinberger 公开表示要大幅削减持续集成(CI)任务,改由 Codex 判断哪些测试真正需要运行,并改为每小时批量执行一次,以缓解 CI 负载和成本压力。
事件核心:发生了什么
2026 年 9 月 27 日,开发者 Peter Steinberger 在 X 上回应另一位工程师关于 CI 成本的讨论。他提到 Blacksmith(@useblacksmith)一直是很好的赞助方,但团队需要分散负载,因此计划让 Codex 决定哪些测试实际需要运行,大幅“砍掉”现有 CI 流程,并把测试改为每小时运行一次。该帖获得约 10 万次浏览。在同一讨论串中,Flo Crivello 表示 CI 已成为他所接触的每家工程团队的首要瓶颈,Lindy 的 CI 支出也“高得离谱”。
为什么重要
CI 原本是保障代码质量的自动化环节,如今在 AI 编程助手大量生成代码后,测试数量和执行频率被推高,CI 从“后台成本”变成显性瓶颈。这条新闻的价值在于它展示了一种新分工:不再是所有测试无条件全跑,而是让大模型(Codex)判断测试相关性,配合降频执行来压缩推理与算力消耗。这既是成本工程问题,也涉及质量保障逻辑的转变——测试从“写死规则”走向“模型筛选”。如果这种模式被验证可行,可能影响其他团队对 CI 供应商、开源方案和 AI 编程工具的选择。
对用户/开发者/创作者的影响
对开发者而言,短期可关注两点:一是 Codex 判断测试范围的准确率,二是每小时跑一次是否会造成反馈延迟。对使用 AI 编程助手生成代码的团队,这意味着需要重新评估测试策略——保留少量高价值测试,可能比堆数量更划算。对 CI 服务商和 Blacksmith 这类赞助方,客户主动缩减用量会带来收入结构压力,也可能催生按“相关性”计费的新产品。目前公开信息显示,该方案仍是个人计划,没有公布具体实现细节或效果数据。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 Codex 筛选测试的误判率是否被公开,漏测是否会引发线上问题;二是“每小时跑一次”是否成为团队默认节奏,还是仅限特定项目;三是 Blacksmith 等 CI 服务商是否跟进推出模型驱动的测试筛选能力,或调整定价模式。


