一句话看懂:Liquid AI 发布了一款名为 LFM2.5-VL-3B 的端侧视觉语言模型,参数量仅 3B,却支持读屏、物体识别和调用设备工具,意味着轻量级多模态模型正在从“能看”走向“能做”。
事件核心:发生了什么
据 MarkTechPost Research 报道,Liquid AI 推出了一款新的视觉语言模型 LFM2.5-VL-3B。这个模型的参数量为 3B(30 亿参数),属于当前资源开销较小的模型规模。它的核心定位是运行在设备端,而不是完全依赖云端算力。
从产品能力描述来看,“能读屏”意味着模型可以理解屏幕截图或界面内容;“识别物体”对应基础的视觉理解能力;而“在设备端调用工具”则指向 AI Agent(智能体)方向——模型不只是输出文字,还能直接触发设备上的操作或调用本地接口。这类能力组合在 3B 规模的开源生态中并不常见。
为什么重要
LFM2.5-VL-3B 值得关注,不是因为它“跑分高”,而是因为它在模型体积和任务复杂度之间选择了另一种平衡。
目前主流的视觉语言模型大多走“大参数量 + 云端推理”路线,而 3B 模型要想在手机上完成读屏和工具调用,必须在架构效率、训练数据和推理优化上同时做功课。Liquid AI 此前以液体神经网络和高效架构设计知名,这次的新模型也延续了“用小模型做复杂事”的技术路线。
从行业格局看,端侧多模态模型正在成为一个新的竞争焦点。无论是芯片厂商还是手机品牌,都在寻找能在本地运行、保护隐私且具备 Agent 能力的模型。LFM2.5-VL-3B 的出现,意味着这个赛道又增加了一个有技术积累的玩家,也将进一步压低端侧 AI 应用的内存和能耗门槛。
对用户/开发者/创作者的影响
普通用户:端侧视觉模型意味着照片识别、屏幕内容总结、智能助手等场景可以脱离网络运行,数据不出设备,隐私风险更低,响应速度也更快。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
开发者:3B 模型相对容易部署在手机、平板、边缘设备上。可以在本地做 UI 自动化测试、无障碍辅助工具、基于屏幕理解的快捷指令等应用。官方模型是否开放权重、是否支持微调,会直接影响开发者的接入成本。
创作者:设备端识图能力可以用来做本地素材管理、场景识别、图片分类,减少大量素材上传云端的工作,对处理敏感或未公开内容尤其友好。
值得关注的后续
目前公开信息显示,LFM2.5-VL-3B 的主要细节来自发布说明,实际项目是否开源、是否有 API、运行在具体硬件上的表现如何,外界还不能完全确认。后续可以观察三点:
一,模型是否开放权重或提供测试入口,这将决定开发者能否真正把它集成到自有产品中;二,它在真实手机或边缘设备上的推理速度和内存占用,是否真的达到“可用”级别;三是竞品反应——微软、谷歌、阿里等团队都有各自的端侧小模型产品,LFM2.5-VL-3B 以“读屏 + 工具调用”为差异化方向,是否能形成细分优势。


