SpecForge v0.3.0 发布:统一解耦与共置投机解码栈,新增开放 SpecBundle 草稿模型

LMSYS 团队发布 SpecForge v0.3.0,将投机解码中的目标模型推理与草稿模型训练彻底解耦,并开放多种算法的草稿模型。这意味着大模型推理加速的训练门槛和资源成本有望显著下降。

一句话看懂:LMSYS 团队发布 SpecForge v0.3.0,将投机解码中的目标模型推理与草稿模型训练彻底解耦,并开放多种算法的草稿模型。这意味着大模型推理加速的训练门槛和资源成本有望显著下降。

事件核心:发生了什么

SpecForge 是服务于投机解码(Speculative Decoding)的训练与推理工具栈。投机解码通过一个小型草稿模型先生成候选 token,再由大型目标模型一次性验证,从而加速推理。v0.3.0 最大的变化是:不再由同一个训练任务同时占用目标模型和草稿模型,而是把“目标模型特征采集”与“草稿模型训练”拆成两个独立的资源池。特征数据通过 Mooncake 传输张量,控制面只传递轻量的 SampleRef 元数据,训练端可以按需引用。

具体数据上,LMSYS 在 8xH20 测试平台上使用 3 个 SGLang 推理服务器加 5 个训练 worker,端到端训练吞吐量比上一代共置方案提升约 10%。同时,该版本统一支持 EAGLE3、EAGLE3.1、P-EAGLE、DFlash、Domino、DSpark 等多种草稿模型家族,DFlash 还可选配 D-PACE 训练目标。新发布的一批草稿模型大多由社区贡献,皆基于开放数据训练。

为什么重要

以往投机解码的草稿模型训练,推理与训练共享进程生命周期和资源布局,直接带来三个问题:推理与训练比例固定,无法单独扩容;两类任务互相抢显存和算力;特征生成卡顿会拖停整个训练。v0.3.0 用明确的契约边界把训练流水线拆成了生产者与消费者两个池子,推理与训练可以独立扩缩容,失败边界也彼此隔离。这是投机解码工程化落地的一次关键补课——它把“训练一个草稿模型”从绑定目标模型的单项任务,变成了一条可复用、可编排的训练流水线。

此外,一套运行时同时支持六种草稿模型算法,且社区已经用同一框架在不同目标模型上训练出多个草稿模型,说明 SpecForge 正在从“单一 EAGLE3 工具”转向“草稿模型生态平台”。这对提高投机解码的模型覆盖率和部署普及度有直接帮助。

对用户/开发者/创作者的影响

对使用 SGLang 做推理服务部署的开发者,这个版本降低了草稿模型的训练和适配成本:推理服务器继续用 SGLang,训练端只需消费特征张量,不再需要把大模型塞进训练进程。对需要为专属大模型训练草稿模型的团队,解耦意味着可以按瓶颈单独加推理节点或训练节点,资源利用更灵活,不用为少量训练任务被迫部署整套大型训练环境。目前公开信息显示,v0.3.0 已内置训练与推理一致性校验门禁,在完整训练前可以用小样本快速验证产出和部署是否对齐,减少返工成本。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,这一套解耦训练栈能否从 H20 测试环境平滑迁移到生产级大规模集群,吞吐提升在更大规模下是否保持。第二,社区贡献的草稿模型是否会被 SGLang 生态广泛采纳,形成“目标模型—草稿模型”之间的标准化发布与共享机制。第三,SpecForge 下一步是否会把训练数据策略与特征接入解耦得更彻底,让用户在不更换推理引擎的前提下接入自己的数据管道。

来源:LMSYS:Blog(Chatbot Arena 团队)

celebrityanime
celebrityanime
文章: 16919

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注