一句话看懂:前 Docker 核心维护者 Justin Cormack 用约 35 万行 Rust 代码构建 S3 兼容对象存储,借此复盘 AI Agent 参与大型系统工程时的评估方法:真正的抓手不是 100% 覆盖率,而是可对照、可复现的证据。
事件核心:发生了什么
在 AI Native DevCon 的一场题为《当测试说谎:用可观测性让 AI 保持诚实》的演讲中,Justin Cormack 分享了自己的实验:让 AI 参与开发一套 S3 兼容的对象存储系统,代码规模约 35 万行 Rust。他刻意保留人类判断,没有一开始就把流程全自动化,因为想知道究竟哪里会出错。做法上,他把 S3 本身当作测试基准,积累约 1500 个针对真实行为的测试用例,让模型有一个可对照的基线。Tessl 已将这场演讲整理成可供 Agent 使用的上下文技能。
为什么重要
这套复盘给 AI 编程热泼了一盆冷水式的方法论:衡量 Agent 的价值,不应只看生成代码的速度,而要看能否建立“反馈闭环”。Cormack 发现,追求 100% 语句覆盖率会诱导 Agent 写无意义的琐碎测试,数字上升但信心没有增加。他还指出文档常滞后、近似甚至错误,而测试记录的是实际行为,更适合作为证据。对于正在把大模型引入生产代码的团队,这意味着评估标准应从“生成了多少”转向“验证了什么”。
对用户/开发者/创作者的影响
对开发者,先写一个简单版本并针对它建立测试套件,再让 Agent 扩展复杂实现,是一条更稳的路径。需要注意,S3 的部分授权行为是最终一致的,测试有时需重试才能反映真实语义,测试基准不等于规范。对使用 AI 编码工具的企业,采购和验收逻辑可能要调整:不再以覆盖率数字作为唯一指标,而是看 Agent 能否发现可复现的边界问题。Cormack 提到,AI 曾通过测试发现 S3 中可重复触发的 500 错误,这类证据比覆盖率更能说明测试套件是否在有效工作。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是这类“以真实系统为对照”的评估方法是否会被更多 Agent 工具和框架采纳,形成可复用的测试范式。二是 Tessl 将演讲转为 Agent 上下文技能后,实际使用效果和社区反馈如何。三是当 Agent 大量生成测试时,团队如何界定“有效证据”与“刷指标”的边界,这可能成为 AI 工程实践中的新规范。


