LFM2.5-VL-3B:为边缘端带来更好更快的视觉能力

LiquidAI 于 8 月 12 日发布 30 亿参数的视觉语言模型 LFM2.5-VL-3B,在屏幕理解、目标定位、函数调用等能力上大幅提升,为端侧本地部署视觉 AI 提供更实用的选择。

一句话看懂:LiquidAI 于 8 月 12 日发布 30 亿参数的视觉语言模型 LFM2.5-VL-3B,在屏幕理解、目标定位、函数调用等能力上大幅提升,为端侧本地部署视觉 AI 提供更实用的选择。

事件核心:发生了什么

LiquidAI 在 Hugging Face 博客发布了 LFM2.5-VL-3B,这是其目前最强大的可本地部署视觉语言模型。相比此前的 LFM2-VL-3B,新模型在四个方向上有明显改进:屏幕/UI 理解、基于自然语言的目标定位(Grounding)、多图输入推理以及函数调用能力,其中函数调用同时支持纯文本和视觉文本混合场景。

模型架构上,LFM2.5-VL-3B 采用 SigLIP2 400M NaFlex 视觉编码器,搭配 LFM2.5-2.6B 文本模型的骨干网络,参数量 3.1B。预训练数据约 34T tokens,其中视觉数据量为前代的 4 倍,涵盖图像描述、OCR、目标定位和指令跟随等类型。为了支持非拉丁语系,词表从原有规模扩展至 128K,且采用了原地扩展而非重新训练的方式。

后训练分两阶段:先做监督微调,用更大规模的教师模型做知识蒸馏,并引入 Antidoom 训练(一种防范模型能力退化的训练方法);再做基于多奖励的强化学习。官方强调该模型采用直接回答的模式,不输出显式推理过程,以保证实时交互场景的响应速度。

基准测试方面,新模型在 ScreenSpot-v2 桌面/移动/网页三项得分从上一代的 6.0/7.6/2.5 提升至 78.7/81.2/82.2,RefCOCO 平均分从 57.1 增至 87.9,多图理解 BLINK 从 50.2 升至 61.5,工具调用 ToolSandbox 从 26.4 大增至 59.5。

为什么重要

这件事值得关注的核心点在于:小参数模型正在缩小与大模型之间的能力差距。LFM2.5-VL-3B 只有 3.1B 参数,就能在屏幕理解、文档 OCR 和 grounding 等任务上逼近甚至部分超过 5B-8B 量级的 Gemma 3.5 和 InternVL 3.5 系列,这对“在边缘设备上跑得动且好用”这一目标具有重要意义。

LiquidAI 的技术路线也有独特性:拒绝在小型模型上强制加入链式思考(CoT),而是选择直接回答以保证速度;用原地扩展词表而非重新预训练来压低成本;用多奖励强化学习而非单纯堆数据来对齐能力。这些做法都是在“资源受限”这个前提下做取舍,对端侧 AI 的工程实践有参考价值。

此外,该模型发布在 Hugging Face 平台,意味着开发者可以立即下载权重自行部署,延续了开源小模型在工具调用和端侧智能体赛道上的竞争态势。

对用户/开发者/创作者的影响

对开发者而言:3.1B 参数量意味着有能力在消费级 GPU、边缘盒子甚至部分手机上运行。加上函数调用能力的增强,可以尝试构建本地 OCR、屏幕自动化、文档解析等应用,而不必把图像数据发送到云端 API。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对普通用户:这类模型落地后,设备端的“看懂屏幕”类助手体验会明显改善,例如根据屏幕内容自动操作 App、识别聊天截图中的信息等,且响应速度更快、隐私更可控。

对内容创作者:模型的多语言 OCR 和图表理解能力可以用于批量处理扫描件、截图素材和图表数据,降低信息整理成本。

对企业和算力采购方:如果模型确实能在较小算力下完成 UI 理解和工具调用,会降低端侧 AI 方案的硬件门槛,值得在选型时对比测试。

值得关注的后续

一,LFM2.5-VL-3B 的实际部署效果是否能复现官方 benchmark 水平,尤其是 ScreenSpot-v2 相比前代 70 分以上的跃升是否在真实环境中同样显著,建议开发者自行验证后再决定集成。

二,LiquidAI 此前曾探索非 Transformer 架构(如 Liquid 架构),但本次模型明确采用“LFM2.5-2.6B 文本骨干”,意味着其架构路线是否已收敛到 Transformer,还需留意后续技术报告。

三,当前开源社区中 Qwen3.5-VL、InternVL 3.5 等同级别模型竞争激烈,LFM2.5-VL-3B 能否在生态工具链、量化支持和推理框架兼容性上跟上,将决定它是否能真正被规模化采用。

来源:Hugging Face Blog

celebrityanime
celebrityanime
文章: 18303

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注