扩展分类流映射(Categorical Flow Maps)规模

苹果机器学习研究团队训练了一个 17 亿参数的流匹配语言模型,并自蒸馏成只需 4 步推理的分类流映射(CFM)模型,首次把这类非自回归生成方法推进到数十亿参数规模,证明了它在文本生成质量与速度上可以接近现有扩散方法。

一句话看懂:苹果机器学习研究团队训练了一个 17 亿参数的流匹配语言模型,并自蒸馏成只需 4 步推理的分类流映射(CFM)模型,首次把这类非自回归生成方法推进到数十亿参数规模,证明了它在文本生成质量与速度上可以接近现有扩散方法。

事件核心:发生了什么

论文《Scaling Categorical Flow Maps》由苹果与牛津大学研究者合作完成,发表于 2026 年 8 月。该方法建立在“连续流匹配”框架上:将离散文本用 one-hot 编码映射到连续空间,再通过高斯噪声与数据分布之间的流匹配实现生成。与自回归模型逐 token 预测不同,CFM 可以并行采样,并将推理步数压缩到个位数。

实验部分,团队在 2.1T tokens 上训练了一个 1.7B 参数的基座流模型,再通过自蒸馏得到 CFM 模型,仅用 4 步推理即可生成文本,且输出熵接近真实数据分布。论文还提出了半离散设定下的似然界,使该模型能用于标准语言模型评测基准,得分与离散扩散方法处于同一区间。此外,研究揭示了大规模训练 CFM 时的一些关键问题,特别是损失加权与时间调度的设置策略。

为什么重要

这项研究回应了一个悬而未决的问题:非自回归的流匹配语言模型究竟能不能规模化?此前相关实验大多在 10 亿参数以下,规模上缺乏说服力。把 CFM 扩展到 17 亿参数、2.1T tokens 之后,研究证明了这条技术路线的可行性,也为语言模型生成范式提供了自回归之外的新选项。

流匹配模型拥有连续模态模型的一些优势,比如加速采样、可控生成和推理步数灵活调整。如果这些能力在更大规模下依然成立,语言模型的推理效率和交互方式可能发生变化——不再严格依赖“逐字生成”的串行过程,而可以通过并行计算大幅缩短响应时间。苹果选择在这个时间点公布论文,也显示其在生成式 AI 基础模型上的持续投入,而不仅仅聚焦于端侧小模型。

对用户/开发者/创作者的影响

对普通用户来说,最直接的变化可能藏在终端产品里:如果这项技术落地到 Siri、快捷指令或写作辅助功能中,文本生成速度会有明显提升,尤其是在短文本、摘要、改写等场景中的延迟感受会更友好。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对开发者而言,CFM 的 4 步推理意味着更低的推理算力消耗,能够在相同硬件上承载更大的请求量,这对 API 成本控制和服务端扩容有实际意义。不过目前苹果尚未公布相关 API 或开发者工具,论文方法也没有开源迹象,开发者短期只能关注后续是否以框架形式释放。

对创作者和内容生产者来说,这种快速并行采样机制也可能改变生成式写作工具的使用体验:从“等待几秒补全”过渡到“近实时产出多个候选版本”。但需要注意的是,论文重点是生成质量与推理效率的平衡,暂未涉及真实场景下的事实性、安全性和长文本一致性评估,投入创作流程前仍需谨慎验证。

值得关注的后续

目前公开信息显示,这项研究仍停留在论文阶段,以下几个观察点值得持续跟踪:

第一,苹果是否会将 CFM 模型接入其产品线或开发者生态。若推出相关 API,将直接改变开发者的技术选型。第二,该方法的训练配方(损失加权与时间调度)是否被其他研究团队复制并验证到更大规模,比如 70B 以上参数,这决定它能否真正挑战自回归范式。第三,是否会有开源社区复现版本出现,推动流匹配文本生成在商业场景中进入实用阶段。

来源:Apple Machine Learning Research(RSS)

celebrityanime
celebrityanime
文章: 18311

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注