一句话看懂:Box 首席执行官 Aaron Levie 提出,企业无法自动化自己无法度量的流程,因此“评测(evals)”正成为 AI 在企业扩散的关键门槛;他同时判断,围绕企业自身环境定制的评测将是一个巨大机会。
事件核心:发生了什么
2026 年 9 月 25 日,Aaron Levie 在 X 上发帖指出,传统软件可以测试确定性流程,但大多数企业今天并没有有效手段去理解自身的非确定性流程运转得如何,尤其是 AI 智能体(agents)替它们完成的那部分工作。在他看来,企业采用 AI 时,评测是“任务关键”的:如果没有办法判断什么在正常工作、什么已经损坏、什么发生了变化、什么得到了改善,企业就无法决定哪些环节可以扩大使用。所有变更、升级和部署,都建立在可靠评测的下游。他据此判断,除了模型实验室和整个行业会推出越来越多垂直领域的评测之外,每一家企业也都需要清楚掌握智能体在自己环境中的表现,这是一个巨大的机会。
为什么重要
这句话切中了企业 AI 落地的核心堵点。大模型的输出本身具有概率性,同一个提示词在不同时间、不同上下文中可能给出不同结果,这让过去基于断言(assertion)的软件测试方法很难直接套用。企业采购 AI 应用时,常见障碍不是模型能力不足,而是无法量化“上了这套系统之后,业务流程究竟变好了多少、风险是否可控”。目前公开信息显示,Levie 的论点是:评测不只是模型厂商的事,企业需要针对自己的数据、权限、工具链和业务规则建立评测体系,才能真正把智能体推向生产环境。这也意味着评测工具、评测数据集和评测服务可能成为企业 AI 栈中的独立层,而非附属功能。
对用户/开发者/创作者的影响
对开发者而言,构建 AI 应用时,评测环节需要从“上线前跑一次”变成持续运行的基础设施,涉及 API 调用日志、推理结果比对、回归测试和人工复核流程。对企业采购方来说,供应商能否提供可解释、可复现的评测报告,可能比模型跑分更具决策价值。对内容创作者和普通用户,短期感知不会太直接,但长期看,评测标准会影响哪些 AI 产品被企业放行,进而影响这些工具能否进入日常工作流。值得注意的是,Levie 引用的另一位用户 Alex Lieberman 提到,有大型数据标注公司预测其收入大头将在几年内来自财富 1000 强企业而非模型实验室,这与“企业自有评测”的判断方向一致。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是评测工具是否会从模型厂商和云平台中独立出来,形成专门的企业级产品;二是企业自建评测与第三方评测之间的分工如何划分,涉及数据主权和合规;三是当评测成为采购门槛后,AI 应用厂商是否会公开更细粒度的评测结果,以及这些结果能否被客户独立验证。


