一句话看懂:得物推荐团队在 AICon 大会上公开了将 AI 从“写代码”扩展到企业级研发全链路的实践方案,核心是用一套名为“七阶段护栏”的 Harness 体系,把 AI 约束进需求、开发、测试、复盘四个环节,而不只是让它生成代码。
事件核心:发生了什么
在 AICon 全球人工智能开发与应用大会上,得物资深技术专家白忠魏分享了推荐团队在复杂业务系统中推进 AI 研发的落地经验。得物推荐系统本身覆盖商品交易和内容社区双场景,包含召回、粗排、精排等模块,是一个运行多年、依赖复杂的超大型工程。团队没有停留在 AI 辅助编码,而是将研发流程抽象为 PDCA 循环(Plan-Do-Check-Act),并在每个环节建立工程护栏。他们引入了 TPRD(技术化产品需求文档)和 Contract 机制,把自然语言需求拆解成可执行的 EP 和边界约束;在开发阶段建设了沙箱隔离、UTD(单测驱动)和外部依赖 Mock 三类基础设施,让 AI 能持续自主执行而不频繁中断;在测试阶段则用 AI 模拟用户画像,对推荐结果做 L1-L5 质量评分,把人工评测从每天约 200 条的上限扩展为 7×24 小时常态化运行。
为什么重要
目前行业里多数 AI 编程实践仍集中在“让 AI 写代码”的单一环节,但企业级项目的瓶颈往往不在编码本身,而在需求理解、影响范围控制和效果验收。得物此次分享的价值在于,它提出了一套可复用的基础设施思路:通过环境设计而非 Prompt 禁令来约束 AI 行为,用数据闭环替代人工逐行检查。这种“Harness 是环境而不是铁笼”的设计哲学,回应了 AI 进入大型老项目时最常见的失败原因——目标漂移和环境依赖。如果这套方法论被验证有效,意味着 AI 的渗透率有机会从代码行数延伸到研发周期管理,双周迭代压缩到周级、周级压缩到天级的判断,将不再只是理想化表述。
对用户/开发者/创作者的影响
对于企业技术负责人和开发者,这套实践提供了几个可参考的落地抓手:在需求阶段增加 TPRD 和 Contract,能显著降低 AI 在错误方向上长时间空转的风险;在开发阶段建设本地沙箱和 Mock 服务,不仅服务 AI,也减少了工程师等待联调环境的成本。对于推荐系统相关的产品和算法团队,用 AI 模拟用户画像做质量前置评测,意味着人工评测的注意力和一致性瓶颈可以被技术手段缓解,评测结果还能沉淀为可复用的知识资产。对于普通用户而言,这类实践的最终效果是推荐质量可能在功能上线前就经过更细致的校验,体验问题的发现时点从“用户投诉后”提前到“发布之前”。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
目前公开信息显示,得物推荐仍未公开 AI 全链路改造后具体的业务指标提升幅度,后续值得关注三个观察点:一是这套七阶段护栏是否会被抽象为通用工具或开源方案,供其他大型企业直接采用;二是 AI 评审员与人工评测的对齐准确率能否持续提升,这会决定“AI 代替人工验收”的可信度边界;三是 Check 和 Act 阶段目前仍依赖人工深度参与,未来是否会出现更成熟的自动化业务效果判断机制,这将是 AI 真正深入企业核心研发流程的关键分水岭。
来源:InfoQ CN


