Liquid AI 发布 d1 决策模型并新增图像输入能力

Liquid AI 发布首个决策模型 d1,在文本基础上新增图像输入,用一次前向推理直接输出概率化答案,在六项真实任务中的四项追平或超过 GPT-6.1 Sol,成本仅为后者的 1/19 至 1/200。

一句话看懂:Liquid AI 发布首个决策模型 d1,在文本基础上新增图像输入,用一次前向推理直接输出概率化答案,在六项真实任务中的四项追平或超过 GPT-6.1 Sol,成本仅为后者的 1/19 至 1/200。

事件核心:发生了什么

Liquid AI 推出决策模型 d1,本周新增图像输入能力。与生成式大模型逐 token 输出文本不同,d1 接收非结构化数据(文本、图像或两者)加一个或多个问题,在一次前向计算中返回概率结果,不生成任何 token。它支持三类问题:Noul(是/否,输出 0 到 1 的概率)、Choice(多标签选择,每标签一个概率)、Score(带权重的量表打分)。一次请求可对同一情境同时提多个问题,省下重复输入。文本决策耗时约 200 至 300 毫秒。目前公开信息显示,d1 可在 console.liquid.ai 与 d1 Playground 试用,并已上线 Liquid AI API(模型名 d1),同时通过 Vercel 和 OpenRouter 提供,但后两者暂只支持文本,视觉能力稍后跟进。计费只按输入 token,图像按 1.5 token / 32×32 像素块计算,1024×1024 图像约 1536 token。

为什么重要

d1 代表了一条与主流大模型不同的技术路线:不追求生成能力,而是把”判断”做成专用的低成本原语。在工单过滤、电路板质检等结构化决策场景中,调用通用大模型既贵又慢,d1 用概率输出替代自然语言回答,推理成本和时间大幅下降。它同时具备较强的泛化性——视觉质检任务(VisA 数据集,涵盖电路板、蜡烛、腰果、口香糖四条产线)达到 85% 至 97% 准确率,而模型并未针对该任务训练,仅凭一段简短描述理解任务。这意味着”专用决策模型”可能成为大模型 API 之外的一层新基础设施,对闭源大模型的低价值调用形成替代压力。

对用户/开发者/创作者的影响

开发者可以把 d1 当作 SQL 里的函数使用,例如 WHERE d1(ticket, ‘the customer wants to cancel’),对 150 张工单逐条判断是否要取消。官方演示的五个文本应用包括代码库检索、智能分文件夹、网页代理选动作、以及为编码代理压缩工具输出——后者能裁掉 52% 的 token 且保留任务所需内容。视觉方面,俄罗斯方块加入屏幕画面后通关行数从 70 提升到 81;Wordle 直接读截图,12 局全解,平均 3.8 次猜中;Quick, Draw! 在 62 个词中平均识别 5.2/6(随机猜测约 0.6)。对做 AI 应用、Agent 和自动化流程的团队来说,这是把高频、低复杂度判断从大模型迁移出去的一个现实选项。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是视觉能力何时登陆 Vercel 和 OpenRouter,以及 API 稳定性与延迟在真实流量下是否维持毫秒级;二是计费方式是否调整,尤其是图像输入与多问题合并计费的实际成本;三是这类决策模型是否会引来竞品跟进,以及它与现有大模型编排框架(如函数调用、结构化输出)是互补还是替代。

来源:Liquid AI 模型与工程博客(网页)

celebrityanime
celebrityanime
文章: 27448

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注