一句话看懂:蚂蚁数科资深技术专家魏长征在 AICon 大会上分享 Harness 工程实践:AI Coding 的瓶颈正从”写代码”转向”验收代码”,团队用约束、对抗验证、证据与状态记录构建验证闭环,在一个 60 万行 C++ 存量项目中把缺陷率从 20% 以上降到个位数。
事件核心:发生了什么
随着 Claude Code、Cursor 等工具把 AI 编码从 Tab 补全推向 Agent 独立执行完整任务,研发团队的矛盾变了:代码产出成倍提升,需求约束、Code Review 和测试验收却未必跟得上。魏长征结合两个真实项目给出解法。一是从零建设的 Rust 项目,代码超 40 万行,基本由 Agent 参与开发,团队从第一天起就把 Harness 内建进流程,用 AGENTS.md 等文档明确唯一事实源,并要求每个 PR 同步提交变更文档、由 CI 检查文档与测试用例对齐。二是超过 60 万行的 C++ 存量项目,先重建事实源和质量门禁,再让 Agent 参与仓库升级,改造后代码缺陷率从 20% 以上降至个位数。所谓 Harness,并非某项具体技术,而是围绕约束、验证和验收建立的研发闭环。
为什么重要
魏长征的判断是:AI Coding 没有创造全新的软件工程问题,而是以更高产能把需求模糊、目标漂移、事实冲突和验证不足集中放大。过去需求评审、架构评审、Code Review、测试准出这些环节,如今需要迁移到与 Agent 协作的流程里。他还提到一个容易被忽视的变化——开发者正从代码生产者变成结果的评判者,判断标准也从”代码写得好不好”升级为”放进完整链路能否稳定运行”。这解释了为何从 Prompt 工程、上下文工程到 Harness 工程、Loop 工程的概念演进,本质都指向同一件事:让验证能力跟上生产能力。
对用户/开发者/创作者的影响
对使用 AI Agent 编码的团队,最直接的启发是别只追生成速度:先写清任务目标与非目标,明确唯一事实源,避免多份冲突文档让 Agent 困惑;在 CI 中让不同 Agent 分工做 Code Review,分别检查命名规范、是否重复造轮子、是否只修了当前 case;用 HTML 报告、架构图等可视化证据替代逐行读代码。长任务(原文提到部分 Agent 任务连续运行 15 到 20 小时)还需阶段性持久化状态,并让 Agent 复述目标与方案,防止跑偏。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是这套 Harness 思路能否沉淀为可复用的开源工具或平台能力,而非停留在单个团队的方法论;二是当 Agent 一次提交四五千行代码,CI 中 AI Review 的成本与准确率如何平衡;三是存量工程改造中,缺陷率下降能否在更多语言和更大仓库上复现。目前公开信息显示的相关数据来自蚂蚁数科内部两个项目,规模化验证仍有待观察。
来源:InfoQ CN


