The future is verification-engineering. Proofs, (e2e) tests, benchmarks, linters… Some tests will be deterministic, some agentic. This looks great. https://t.co/ZSwn1UEupp

Vercel 首席执行官 Guillermo Rauch 提出"验证工程(verification-engineering)"将成为软件开发的下一阶段,与此同时,一款名为 e2e 的开源智能体测试框架同步亮相,尝试把确定性测试和 Agent 驱动的测试混合在同一个工具链里。

一句话看懂:Vercel 首席执行官 Guillermo Rauch 提出”验证工程(verification-engineering)”将成为软件开发的下一阶段,与此同时,一款名为 e2e 的开源智能体测试框架同步亮相,尝试把确定性测试和 Agent 驱动的测试混合在同一个工具链里。

事件核心:发生了什么

Guillermo Rauch 在 X 上发帖称:”未来属于验证工程。”他把形式化证明、端到端(e2e)测试、基准测试(benchmarks)、代码检查工具(linters)并列,视为同一套验证体系的组成部分。他特别提到,其中的测试将分为两类:一类是确定性测试,另一类由 Agent 驱动,并评价这一方向”看起来很棒”。

这条表态对应的具体产品,是开发者 Oskar 推出的开源项目 e2e。按照其公开介绍,e2e 定位为”适用于任何应用的智能体测试框架”,通过 npx e2e init 即可初始化;支持混合调用确定性 API 与智能体 API,覆盖 Web、移动端等场景,允许开发者自带 Agent 和基础设施,既能在本地运行,也能接入 CI。该帖子获得约 28.2 万次浏览。

为什么重要

过去一年,AI 编程工具的重心集中在”生成”——让大模型写代码、补函数、改 bug。Rauch 的判断把这个重心往”验证”一端拉:当代码产出速度被模型大幅提升后,瓶颈不再是写得多快,而是能否确认写出来的东西是对的。确定性测试解决可复现的逻辑校验,Agent 驱动的测试则尝试覆盖那些难以穷举、需要语义判断的场景,比如界面行为、交互流程和多步任务。

这对生态的直接影响是,测试框架可能成为继 IDE、代码助手之后的又一个 AI 落地入口。对 Vercel 这类以部署和 CI/CD 为核心的平台来说,把验证能力纳入流水线,也意味着在开发者的日常工作流中占据更靠前的位置。目前公开信息显示,这一方向仍处于早期,更多是方向性表态加一个新兴开源项目,而非成熟的标准或产品。

对用户/开发者/创作者的影响

对开发者而言,最实际的变化是测试策略可能从”纯断言”扩展为”断言加 Agent 评审”。如果 e2e 这类框架成熟,团队可以在同一条 CI 流水线里既跑确定性用例,也跑由模型判断的软性检查,减少人工回归成本。自带 Agent 和基础设施的设计,也意味着模型选择、算力成本和数据合规仍掌握在使用方手中,而不是被工具锁死。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对企业采购来说,值得先观察的是可靠性:Agent 驱动的测试结果是否稳定、误报率多高、能否解释失败原因。对内容与产品创作者,短期内影响有限,但”验证”思路会逐步渗透到 AI 生成内容的审核、评测和上线流程里。

值得关注的后续

一是 e2e 是否从开源项目走向被主流 CI 平台集成,形成实际使用规模;二是确定性测试与 Agent 测试的比例、成本和准确率是否有公开的基准数据;三是 Vercel 或同类平台是否会跟进推出配套的验证产品,把”验证工程”从口号变成付费能力。

来源:Follow Builders · X · Guillermo Rauch

celebrityanime
celebrityanime
文章: 26873

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注