突破 DeepSeek-V4-Pro 服务极限:H20 上的多场景优化方法

LMSYS(Chatbot Arena 团队)发布了对 DeepSeek-V4-Pro 在 H20 上的推理优化方法,通过多场景 serving profile 设计,让这款 1.6 万亿参数的 MoE 模型在显存和带宽受限的硬件上,仍能达到接近 B300 的延迟表现。

一句话看懂:LMSYS(Chatbot Arena 团队)发布了对 DeepSeek-V4-Pro 在 H20 上的推理优化方法,通过多场景 serving profile 设计,让这款 1.6 万亿参数的 MoE 模型在显存和带宽受限的硬件上,仍能达到接近 B300 的延迟表现。

事件核心:发生了什么

LMSYS 团队于 2026 年 8 月 19 日发表技术博客,详细展示了如何为 DeepSeek-V4-Pro 在 H20 GPU 上构建一套完整的推理服务优化方案。DeepSeek-V4-Pro 是 1.6 万亿参数的混合专家(MoE)模型,官方提供 FP8 和 FP4 两种权重格式。相比为这类大模型设计的 Blackwell GPU,H20 缺少原生 FP4 Tensor Core、高带宽显存和更强的互联能力,但仍在数据中心大量部署。

该团队的核心做法是放弃通用配置,针对不同负载设计多个 serving profile:Prefill 阶段根据上下文长度在 PP2 和 PP4 之间切换,Decode 阶段则分别优化低延迟和高吞吐两条路径。其中,单节点 H20-141GB 参考配置在 batch size 为 1 时达到 271 output tokens/s,对比 B300 报告的 383.7 tokens/s,性能差距被压缩到 1.42 倍。系统还支持处理 100 万 token 的长提示词,耗时 43.7 秒,Prefill 吞吐达到每节点 8.45k input tokens/s;高吞吐 decode profile 下每节点可输出 4.67k tokens/s,对应平均 TPOT 为 27.4 毫秒。

为什么重要

这篇文章的意义不在于单一 benchmark 数字,而在于它展示了一条可复制的方法论:在算力受限的硬件上,通过精细的 serving profile 设计,仍然可以为超大 MoE 模型提供可用的推理服务。当前大模型推理优化的主流讨论集中在最新旗舰 GPU 上,但现实是大量企业和云厂商仍依赖 H20 这类”够用但非顶级”的硬件。

LMSYS 的优化思路呈现了另一种竞争维度:不依赖硬件换代,而是通过软件层面的拆分——将 Prefill 与 Decode 分离、按延迟/吞吐目标定制 MoE 路由与投机解码策略——来满足服务等级目标(SLO)。这对于推理服务商和云厂商而言,意味着在硬件采购成本较高的情况下,仍有通过系统优化提升服务质量和容纳更多用户的空间。同时,文章也验证了 FP4 权重结合 MXFP4AFP8 格式在真实场景下的可行性,其精度表现通过了验证。

对用户/开发者/创作者的影响

对于使用 DeepSeek-V4-Pro API 的开发者来说,这类优化意味着更低的延迟和更稳定的吞吐表现——即便底层硬件不是最顶级的 GPU,长上下文处理、多轮对话和 Batch 调用仍可能获得明显更好的体验。具体而言,短输入、长上下文的交互式应用可以从低延迟 decode profile 中受益,而高并发场景则可由高吞吐 profile 承载,这为应用层设计提供了更明确的性能预期。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对于负责模型部署与推理优化的工程团队,这篇文章提供了一整套可参考的优化路径:从上下文并行(Attention-CP8 → MoE-TP8)的通信压缩,到投机解码 DSpark 在多流水线阶段的扩展,再到高并发条件下剔除瓶颈的 DP32-EP32 方案。值得指出的是,这些优化并非免费——不同的 profile 在 KV 缓存容量、上下文长度支持和 SLO 之间有权衡,团队需要根据自身流量特征选择。

值得关注的后续

目前公开信息显示,LMSYS 发布的是技术方法论和测试数据,尚未提及相关优化是否会整合进开源推理框架或其自有的服务。后续可以关注三点:一是这套方案是否会在 Chatbot Arena 的公开评测服务中实际采用,二是 DeepSeek 官方或第三方推理供应商是否会在 H20 上提供类似优化的 API,三是其他 MoE 架构模型(如 Qwen、Mixtral 后续版本)是否也能复现相近的优化收益。此外,若 H20 的替代硬件(如国产加速卡)表现出不同的显存和互联特性,这套 profile 设计思路是否仍能适配也是值得观察的方向。

来源:LMSYS:Blog(Chatbot Arena 团队)

celebrityanime
celebrityanime
文章: 19191

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注