一句话看懂: LiquidAI 于 2026 年 7 月 28 日发布了两款通用编码器模型 LFM2.5-Encoder-230M 和 350M,核心优势是在 CPU 上处理超长文本(8192 token)时,速度比同尺寸的 ModernBERT-base 快约 3.7 倍,同时性能可匹敌或超越体积更大的竞品。
事件核心:发生了什么
LiquidAI 在 Hugging Face 上开源了 LFM2.5-Encoder 系列(230M 和 350M 参数)。这两款模型从同系列的 LFM2.5 解码器骨干网络初始化,通过引入双向注意力掩码、非因果短卷积以及 30% 的掩码语言建模任务,转变为通用编码器。
训练分两阶段:先在大规模网页语料上以 1024 token 上下文完成短文本语言能力学习,再扩展至 8192 token 上下文,强化事实、法律和多语言处理能力。在 GLUE、SuperGLUE 以及多语言分类任务中,350M 版本排名第四,超越它的是三款参数更大(最大达 3.5B)的模型;230M 版本则击败了 ModernBERT-base 和所有 EuroBERT 模型。
推理速度方面,在 CPU 上处理 8192 token 的输入时,ModernBERT-base 单次前向传播需超过 90 秒,而 LFM2.5-Encoder-230M 仅需约 28 秒。在 GPU(苹果 GPU)上,短输入场景 ModernBERT 略有领先,当输入长度超过约 2000 token 后,LFM2.5-Encoder 系列反超。
为什么重要
这一发布打破了“长上下文推理必须依赖高端 GPU”的行业假设。此前,长文本编码任务(如合同扫描、完整对话分类)通常被视为高算力消耗场景,企业往往需要部署 GPU 集群或在云上租用昂贵算力。LiquidAI 用实测数据证明,在现有 CPU 硬件上,开发者就能以低于半分钟的单次推理速度完成长文档级分析任务。
对 AI 部署的商业模式而言,这意味着编码器类应用(安全过滤、意图路由、文档分类)的基础设施成本可能大幅下降,尤其是面向全天候运行的生产环境。这也给 ModernBERT、EuroBERT 等竞品带来了明确的性能与成本压力,可能导致长上下文编码器的竞争从“堆参数”转向“优化推理效率”。
对用户/开发者/创作者的影响
开发者:可以直接在 Hugging Face 下载模型权重,在普通笔记本电脑 CPU 上运行完整合约、长对话或支持线程的分类与扫描,无需申请 GPU 配额。LiquidAI 还提供了基于微调模型的演示,包括零样本提示路由、零样本合规性审查、PII 检测(支持 16 种语言、40 类个人信息)和拼写检查,这些 demo 全部运行在纯 CPU 的 Hugging Face Space 上,可作为实际部署的参考起点。
企业用户:对于需要大规模部署意图分类器、政策审查机器人或隐私过滤器的团队,可以采用更便宜的 CPU 服务器替代 GPU 实例,从而显著降低运维和采购成本。
AI 创作者与研究者:LiquidAI 开源了完整的微调框架和实验结果(14 个模型 × 17 个任务,每个任务报告 5 个种子的平均值),便于复现和在此基础上做二次开发。
值得关注的后续
1. 竞品动向: ModernBERT 和 EuroBERT 是否会通过稀疏注意力、量化或其他架构优化,在 CPU 长文本场景下追赶这一速度优势?如果追赶速度不快,LiquidAI 可能在企业级部署市场中率先占领份额。
2. 实际部署案例: 目前公开信息显示,LiquidAI 已提供 demo 和开源权重,但尚无大规模企业用户的性能基准。后续是否存在独立第三方(如 MLPerf 推理基准)的评测,将是验证“CPU 实时文档扫描”能否广泛落地的重要观察点。
3. 模型生态扩展: 两个模型参数规模(230M/350M)相对较小,容易在边缘设备上部署。如果 LiquidAI 后续推出更小(如 100M 级别)或蒸馏版本,可能进一步打开离线和 IoT 场景的编码器应用市场。


