一句话看懂:腾讯技术团队正式开源了AngelSpec统一训练框架,通过多token预测与块扩散模型等创新方法,提升大模型在真实场景下的推理吞吐量,旨在缓解自回归解码带来的高昂成本瓶颈。
事件核心:发生了什么
2026年7月30日,腾讯开源了名为AngelSpec的训练框架,以解决大模型推理效率的行业痛点。该框架针对不同应用场景的文本特性采用差异化策略:对于高熵、开放式多轮对话任务,使用轻量稳定多token预测机制(MTP),并结合训练时测试(TTT)与端到端总变分损失,提升自回归扩展阶段的适应性;对于代码生成、数学推理等结构约束较强的任务,则通过专用块扩散模型来利用长跨度可预测序列。架构层面,AngelSpec引入了名为DFly的块扩散框架,采用混合目标条件编码骨干与先前条件自回归头组合,在保持高吞吐并行生成的同时优化目标特征利用和块内依赖建模,并内置动态验证机制,可根据在线负载、硬件条件和前缀置信度自适应调整验证深度。在Hy3模型系列的测试中,配置了DFly的方案在并发数4到64的范围内均实现了最高的平均吞吐量,显著超越传统自回归解码。
为什么重要
大模型规模与服务水平持续增长,自回归解码的串行特性成为推理效率的核心瓶颈。AngelSpec不依赖单一优化技巧,而是通过多方案协作与工作负载异构适应来系统化提升吞吐,意味着在不牺牲生成质量的前提下,单次推理的延迟成本可大幅降低。这对行业竞争格局而言,有助于推动大模型从“能用”向“用得省、用得广”过渡,尤其对需要高并发、低延迟的在线服务场景(如聊天机器人、代码辅助)具有直接价值。同时,腾讯选择开源,也为学术界与工业界提供了可复现的基准工具,可能加速社区对推理加速技术的探索。
对用户/开发者/创作者的影响
开发者:可直接获取开源代码与论文(项目地址:GitHub,论文:arXiv),在自己的硬件上评估和适配,无需从零设计加速方案,降低了优化门槛。但需要注意框架目前针对特定模型(Hy3系列)进行测试,迁移到其他架构(如Llama、GPT)可能存在适配成本。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
AI应用创作者:若使用基于AngelSpec优化的模型服务,将获得更快的响应速度和更高的并发处理能力,尤其适用于长对话、代码生成等交互频繁的场景,用户体验可能显著改善。
企业用户:部署自建大模型时,采用AngelSpec有望减少所需GPU数量或提升现有集群的吞吐,从而降低推理算力支出。不过需评估与自身业务场景(如内容生成类型、服务负载模式)的匹配度,以及动态验证机制带来的额外调度复杂度。
值得关注的后续
1. 模型兼容性扩展:框架是否快速支持主流开源模型如Llama、Mistral等,以及腾讯自身Hy3模型的开放程度,将直接影响社区的采用范围。
2. 性能验证与对比:目前公开数据基于Hy3模型系列测试,后续需要更多第三方横向对比(如与投机解码、Medusa等方法)来确认其普适优势。
3. 生态工具配套:腾讯是否会提供预训练权重、推理部署示例文档,或与主流推理引擎(如vLLM、TensorRT-LLM)整合,这将决定开发者能否低成本落地。
来源:AIbase


