一句话看懂:企业 AI 落地的真正瓶颈不再是模型能力不够,而是缺乏一套能评估具体业务场景的评测体系。云存储公司 Box 的 CEO Aaron Levie 指出,没有可靠的评估,企业就无法大规模自动化业务流程,AI 扩散速度远比大多数人意识到的更受限于“评测”环节。
事件核心:发生了什么
Box 联合创始人兼 CEO Aaron Levie 在社交平台 X 上发文提出一个观点:AI 的扩散速度受限于“优质评测(evals)”的程度,远超多数人的认知。他认为,目前每发布一个新模型,伴随的通用评测基准确实很有用,但只能反映整体 AI 进步的大致轮廓与模型间的相对能力。
Levie 强调,更广阔的评测空间在于企业实际工作流的覆盖——从行业共性问题到单个公司内部的独特流程。他的帖子引发讨论,一位用户回复称,大量企业每年在推理上投入上亿美元,却连决定用哪个模型的离线评测体系都没有,这种情况“疯狂且普遍”。
为什么重要
这一观点切中了当前 AI 商业化进程中的痛点。过去一年多,大模型能力的快速迭代吸引企业争先恐后地采购算力、接入 API,但“买完算力、接完模型”之后,如何判断这套系统是否真的提升了业务效率,成了被忽视的环节。Levie 的判断实际上是在提醒行业:模型能力只是基础,真正决定 AI 能否在千行百业落地的,是能否建立一套“可评估、可追踪、可对比”的评测基建。
如果企业无法评估 AI 在具体流程中的表现,就只能凭感觉做决策——这在严肃的生产环境中是不可持续的。这也意味着,评测体系本身可能成为一条巨大的新赛道,其市场空间甚至可能超过单一模型产品的价值。
对用户/开发者/创作者的影响
对于企业和开发者而言,这则观点意味着在挑选大模型时,不应只看榜单分数或演示效果,而应优先建立针对自身业务数据的离线评测集。那些年支出千万甚至上亿美元推理成本的组织,更需要一套“成本—效果”对照评估机制,而非盲目绑定单一供应商。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对 AI 应用开发者来说,提供可定制、可嵌入业务系统的评测工具,是一个明确的商业机会。对普通创作者或日常用户而言,这意味着未来 AI 工具会更务实——厂商将更多精力放在解决“做完之后是否达到预期”的问题上,而非单纯堆砌参数和演示效果。
值得关注的后续
目前公开信息显示,这一观点尚停留在行业讨论层面,但可以持续跟踪以下几个方向:一是主流云厂商和模型提供商是否会推出面向企业场景的标准化评测工具包;二是第三方评测服务是否会从“跑分平台”转向“业务模拟器”,并出现一批垂直行业评测基准;三是企业 IT 采购时,是否会将“是否具备离线评测能力”纳入供应商遴选清单。这些都是观察行业从“模型竞赛”转向“落地竞赛”的风向标。


