Liquid AI 开源 d1 决策模型:零输出 Token,单次前向返回带概率答案

Liquid AI 于 2026 年 10 月 7 日发布两款开放权重多模态决策模型 d1-3B 与 d1-omni-600M,它们不生成文本,而是在一次前向传播中直接返回带概率的结构化答案,输出 Token 数为 0,目标是把实时决策放到 NVIDIA 全栈上跑。

一句话看懂:Liquid AI 于 2026 年 10 月 7 日发布两款开放权重多模态决策模型 d1-3B 与 d1-omni-600M,它们不生成文本,而是在一次前向传播中直接返回带概率的结构化答案,输出 Token 数为 0,目标是把实时决策放到 NVIDIA 全栈上跑。

事件核心:发生了什么

Liquid AI 将其 d1 决策模型家族中的两个检查点开放权重发布。d1-3B 拥有 3.12B 参数,可同时读文本和图像,基于 LFM2.5-VL-3B 构建,文本主干融合了 LFM2.5-2.6B 的权重,视觉侧使用 400M 的 SigLIP2 NaFlex 编码器,上下文长度 32,768 Token。d1-omni-600M 为 587M 参数,基于双向编码器 LFM2.5-Encoder-350M,含 381M 共享主干与决策头、94M 视觉编码器和 112M 音频编码器,音频上限 30 秒,上下文 16,384 Token,单次请求只能带图像或音频其中之一。

两者都支持 noul(是/否概率)、choice(多选标签的完整概率分布)、score(2 到 10 级有序评分的位置)三类问题,一次调用可让多个问题共享同一个状态,每个响应都标记 output_tokens: 0。检查点已上 Hugging Face,可通过 Transformers 加载,并在发布首日获得 llama.cpp 支持;LFM Open License v1.0 允许年收入低于 1000 万美元的商业免费使用。

为什么重要

生成式大模型的输出是逐 Token 写出来的,应用层还要额外解析,而决策模型把这一步压缩成一次概率计算。它更适合路由、内容审核、意图分类、重排序、LLM-as-a-judge、Agent 护栏与视觉检查等场景,这些任务往往不需要自然语言答案,只需要确定的选择和置信度。目前公开信息显示,d1 在 Decision Index v0.2.1 上得 48.57,超过所有 10B 以下模型并略高于 Decider 35B-A3B 的 47.11,只有 Winnow-12B 的 50.02 更高;不过该分数由 Liquid AI 自行运行官方评分器,并非榜单提交。跨七个公开文本基准,d1-3B 平均 82.9;11 个图像基准平均 74.1,与基座模型的 73.9 接近。

对用户/开发者/创作者的影响

开发者可以把它当作低成本、低延迟的分类与评分组件嵌入现有系统。Liquid AI 给出的一组端到端延迟数据是:RTX 4090 单问题 8 毫秒,Jetson AGX Thor 16 毫秒,AGX Orin 26 毫秒,Orin Nano 50 毫秒;AGX Thor 上三个问题共享一个状态为 20 毫秒。d1-3B 在 Jetson AGX Thor 上读取 384 像素图像约 35 毫秒,适合边缘摄像头逐帧审核和手势控制。语音侧 d1-omni-600M 可处理最长 30 秒语音加文本,直接返回说话者意图或主题,适合小设备的语音命令路由。需要注意的是,两者都不是聊天模型,不写文本;d1-omni-600M 是早期研究版本,尚未公布延迟数据,音频训练仅覆盖英语说话人到助手的请求。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 d1-omni-600M 的官方延迟与多语言音频能力是否补齐;二是 d1 的音频决策基准仍是开放问题,后续有没有第三方复现和评测;三是开源决策模型赛道上 Decider、Winnow 等独立项目是否跟进同类零输出 Token 路线,以及年收入 1000 万美元的商用门槛是否影响中小团队采用。

来源:MarkTechPost Research

celebrityanime
celebrityanime
文章: 28061

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注