一句话看懂:斯坦福与英伟达联合开源了 CLM 模型,它不再逐 token 写字,而是把当前局面和候选动作都编码成向量,直接比对谁更接近;在多个 Agent 决策任务中,决策速度比 Jev 快 4 到 13 倍。这条路让「System One」式的快速决策在单卡上跑通。
事件核心:发生了什么
据 @NFT_Chen 分享,斯坦福与英伟达联合开源了 CLM(对比学习模型)。它针对 Agent 每一步都要从候选动作里挑一个的场景,放弃了让大模型逐 token 生成答案的常规做法:把当前状态编码成一个向量,再把每个候选动作编码成向量,选距离最近的那个。
动作向量可以提前算好并缓存,候选数量越多,省下的生成开销越明显。目前公开信息显示,约 1024 个候选动作时,CLM 决策速度可达 Jev 的 13 倍。三个实例数据:恐龙跑酷任务中,CLM 单次决策 16ms,Jev 约 150ms,快约 9 倍且零样本过关;Super Mario 中 CLM 约 33.5ms,Jev 约 132.6ms,约 4 倍,两边都能通关;WikiRacing 中从「板块构造」点到「生物发光」,CLM 79.8ms,Jev 225ms。此外,经轻量微调充当「裁判」后,DeepSWE 挑中方案通过率 81.6%,Jev 为 71.1%,且快 5.7 倍,Terminal-Bench 2.1 也有相应结果。代价是它只能在给定候选里挑,不会自己发明新动作。
为什么重要
过去一年,Agent 的推理能力大多押在让大模型「想得更久、写得更多」上,代价是延迟和算力。CLM 把决策问题从「生成」转成「检索比对」,等于把 System One 式的直觉反应做成可工程化的模块:状态和动作向量解耦缓存,推理成本随候选规模摊薄。对行业而言,这意味着 Agent 的速度瓶颈未必只能靠更大模型和更多算力解决,向量检索、对比学习这类相对轻量的路线重新进入主流视野。开源且单卡能跑,也降低了复现和二次开发的门槛,可能推动更多团队在动作空间固定的任务上优先考虑这类方案。
对用户/开发者/创作者的影响
开发者最直接的机会,是把 CLM 用在对延迟敏感的 Agent 环节,比如游戏操作、网页导航、GUI 自动化、终端命令选择。这些任务候选动作有限,正好适合「状态向量比动作向量」的框架,配合缓存可以大幅压低单步耗时。需要注意它的边界:候选集之外的新动作它发明不了,所以更适合做执行层的快速筛选,而不是开放式规划。创作者和企业若在做 AI 应用,可以把 CLM 当作低成本决策模块,与生成模型分工,前者负责快速选,后者负责解释和生成。目前公开信息显示项目已开源、单卡可跑,具体 API 和工程集成方式还需看后续文档。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 CLM 是否会在更多 Agent 基准上公布完整复现数据,尤其是候选动作规模扩大后的延迟曲线;二是它能否与现有 Agent 框架、工具调用协议顺畅集成,形成可用的开源工具链;三是 Jev 及同类逐 token 决策方案是否会跟进优化,或转向混合路线。若这条路线被验证,Agent 的推理成本结构可能出现明显变化。
来源:@NFT_Chen


