一句话看懂:腾讯混元开源了AngelSpec投机解码框架,提供训练与部署的一站式解决方案。在Hy3-A21B模型上,该框架可将自回归解码端到端速度提升1.98–2.40倍,吞吐量比现有的DFlash方案高出10.5%–11.8%,并同步开放了训练代码与Drafter模型权重。
事件核心:发生了什么
2026年7月29日,腾讯混元团队在X上宣布开源AngelSpec,这是一个支持投机解码(Speculative Decoding)的端到端框架,涵盖训练与部署两个环节。投机解码通过引入一个轻量级Drafter模型提前生成候选token,再经原始大模型并行验证,从而在不降低生成质量的前提下大幅加速推理。
根据官方数据,在Hy3-A21B模型上,AngelSpec的DFly变体在并发数4到64的范围内实现了1.98–2.40倍的端到端加速,而吞吐量相比此前业界基准DFlash提升了10.5%–11.8%。目前,代码、Hy3-A21B的MTP(多个token预测)模型及DFly Drafter权重已通过GitHub、Hugging Face、ModelScope等渠道开源,同时提供了论文与详细文档。
为什么重要
投机解码是当前大模型推理加速的核心技术路线之一,但此前开源方案大多只覆盖推理阶段,缺乏配套的训练工具。AngelSpec首次将训练与部署整合为一个统一框架,降低了开发者从零搭建投机解码系统的门槛。其性能数据表明,在相同算力下,用户可以获得近两倍的响应速度或更高的并发支持,这对降低大模型部署成本、改善用户体验有直接价值。相比之下,DFlash作为此前较领先的加速方案被AngelSpec明显超越,显示腾讯在该方向上的积累已经形成实质性优势。
对用户/开发者/创作者的影响
开发者与部署工程师:可以直接复用AngelSpec的代码和预训练Drafter权重,快速为自己的模型(尤其是Hy3系列)添加投机解码能力,无需从头训练或调优。框架支持训练,也意味着团队可以在自己的数据上微调Drafter,进一步提升加速效果。这将显著降低推理延迟,让聊天机器人、代码助手等交互式应用响应更快。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
企业采购与算力规划者:在相同硬件条件下,使用AngelSpec可以容纳更高并发或降低响应时间,有助于降低每token的推理成本。如果计划部署Hy3系列模型,这个框架的性价比优势值得评估。
普通终端用户:短期内不一定直接接触框架,但使用腾讯混元相关API或基于Hy3模型的应用(如对话、写作辅助)时,可能会感受到响应速度的提升。
值得关注的后续
- 生态兼容性:AngelSpec能否被主流推理框架(如vLLM、TGI、Llama.cpp)集成或提供适配接口,将决定其实际覆盖范围。目前仍需要检查其与主流部署工具的原生支持程度。
- 模型泛化能力:当前公开的Drafter权重仅针对Hy3-A21B模型,未来是否会开源更多底座模型的配套权重,或者提供通用的训练脚本适配其他架构(如Llama、Qwen),会影响框架的通用性。
- 竞品跟进:阿里、百度等大模型厂商在推理加速上也有布局,AngelSpec的开源可能促使更多团队公开自己的投机解码方案,加速行业整体推理成本的下降。


