一句话看懂:开发者 ryanzhou 发布了一套完整配置,让 DeepSeek V4 Flash(304B 参数)能在单颗 AMD MI300X 上生产级运行,无需量化即可将全部权重装入 192GB HBM,单流解码达 168.6 tok/s。这件事值得关注,因为它验证了 AMD 大显存卡在高端推理场景中可作为 NVIDIA 的经济替代方案。
事件核心:发生了什么
GitHub 用户 ryanzhou 开源了 deepseek-v4-flash-mi300x 仓库,包含 Docker Compose 部署栈、SHA-256 校验覆写文件、上游补丁差异及调优表。整套方案基于 vLLM ROCm nightly 0.26.1rc1 和 AITER 0.1.19,未对 DeepSeek-V4-Flash-0731 检查点做额外权重量化或 offload。
实测数据:单流解码中位数 168.6 tok/s;8 路并发时聚合 542 tok/s;64 路突发流量下聚合 830 tok/s 且无 OOM。预填充在调优内核下约 7.9–8.5K tok/s,上下文长度已验证 256K(架构支持 1M)。权重占 HBM 156.67 GiB,MI300X 的 192GB 显存还留有约 20GB KV 缓存池和 96GiB CPU 分层缓存空间。
技术难点集中在四点:MI300X(CDNA3)采用 AMD/Graphcore 的 fnuz 变体 FP8,与 MI325X 及之后使用的 OCP 标准 FP8 不兼容;高并发下 MoE 路由需要修复;因果推测验证与 CPU-KV 同步存在缺陷;AITER 调优表缺少 gfx942 的常见形状。仓库逐一提供了补丁和覆写文件。
为什么重要
官方 vLLM 配方主要面向 NVIDIA 和更新的 AMD GPU(如 MI325X、MI355X),单颗 MI300X 的 DeepSeek V4 Flash 生产配置原本是空白。MI300X 拥有 192GB HBM3 和 5.3TB/s 带宽,显存是 H100 SXM5 的 2.4 倍,列表价约为其一半。这使得 304B 参数的 MoE 模型可以完全驻留单卡 HBM,无需 PCIe 权重流式传输或层 offload,显著降低了大模型推理的硬件门槛。
更关键的是 FP8 兼容性:在 MI300X 上按 OCP 语义实现的内核,scale 域可能差两倍。这个仓库将“先保证正确性、再做性能调优”的完整路径公开,为后来者省去了大量排错成本。
对用户/开发者/创作者的影响
对开发者而言,这是一份可复现的部署模板:如果你手头有 MI300X,按仓库步骤即可拉起生产级服务,不再需要自己逆向修复 FP8 和 MoE 路由问题。对需要处理长上下文和多人并发的应用团队,256K 上下文验证和 20GB GPU KV 池意味着实际可用的并发承载能力。对企业采购方而言,MI300X 单卡跑 300B 级 MoE 模型这个事实,为算力选型提供了新的性价比参照——但要注意,方案依赖特定 ROCm nightly 版本,迁移到其他驱动或硬件仍需要工程投入。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
第一,上游 vLLM 是否会合入这些修复。如果 PR #47291 的 CPU-KV 同步修复等补丁进入主线,其他 AMD 用户将直接受益。第二,DSpark-7 推测解码的收益是否具有普适性,尤其是 64 路突发流量下 830 tok/s 聚合吞吐能否在真实生产负载中稳定复现。第三,DeepSeek 官方或社区是否会针对更大参数版本(如 V4 完整版)提供 AMD 原生支持,这将是衡量 AMD 在推理市场生态成熟度的重要信号。


