一句话看懂:LiquidAI 在 Hugging Face 发布两款开源决策模型 d1-3B 和 d1-omni-600M,专为边缘设备设计,不做逐 token 生成,而是单次前向推理直接输出结构化决策,3B 模型在 Jetson AGX Thor 上单题响应仅 16 毫秒。
事件核心:发生了什么
2026 年 10 月 7 日,LiquidAI 发布 d1 决策模型家族的两款开源模型:d1-3B 和实验性的 d1-omni-600M。与常见的生成式大模型不同,决策模型不逐 token 输出文本,而是在一次前向传播中直接给出答案,因此推理速度更快、更适合本地部署。
d1-3B 基于解码器架构的 LFM2.5-VL-3B 训练,支持文本和图像输入;d1-omni-600M 基于双向编码器 LFM2.5-Encoder-350M,额外接入视觉和音频编码器,可处理文本加图像或文本加音频。目前 d1-omni-600M 仍处于早期研究阶段。
在 Decision Index 0.2.1 上,d1-3B 得分 48.57,高于所有 4B 和 9B 模型,也超过 Decider 35B-A3B 的 47.11。在七个公开数据集的综合测试中,d1-3B 平均 82.9 分,d1-omni-600M 平均 78.4 分,以约四分之一参数量超过 Decider 2B 的 77.1 分。速度方面,d1-3B 在 NVIDIA Jetson AGX Thor 上单题 16 毫秒,Jetson Orin Nano 上 50 毫秒;RTX 4090 上单题低于 10 毫秒。
为什么重要
当前大模型推理大多依赖云端算力,延迟、带宽和隐私是落地瓶颈。d1 系列把决策任务压缩到边缘设备可跑的规模,并保持有竞争力的准确率,这对需要实时判断的场景——如客服工单分类、内容审核、意图识别——意味着模型可以留在本地,不必上传数据。
更关键的是路线选择:LiquidAI 没有继续堆参数或走通用生成,而是用“单次前向决策”替代“逐 token 生成”,在 3B 规模上实现低延迟。这为边缘 AI 应用提供了一种不同于云端 API 的部署范式,也可能推动更多厂商把小型决策模型作为端侧 AI 的基础组件。
对用户/开发者/创作者的影响
开发者可以用 transformers>=5.14 加载模型,通过 trust_remote_code=True 调用,支持在 CUDA、MPS 或 CPU 上运行。模型允许在同一个文本状态上并行提出多个命名问题,例如判断是否要求退款、该转给哪个团队、紧急程度如何,一次推理完成多项分类。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对硬件选型而言,Jetson AGX Thor、AGX Orin、Orin Nano 以及 RTX 4090、AMD MI325X 都有实测数据,边缘设备和桌面 GPU 均可覆盖。对内容平台和客服系统来说,这类模型适合做前置过滤和路由,但需要注意 d1-omni-600M 尚未提供速度数据,音频决策评测也仍是开放问题,目前不宜作为生产环境主力。
值得关注的后续
一是 d1-omni-600M 的音频和视觉能力何时从实验走向稳定,是否补充公开评测;二是 Decision Index 的私有视觉分割和音频决策基准能否形成社区共识;三是这类单次前向决策模型是否会与云端大模型形成明确分工,以及开源许可和商用限制的具体条款。


