在 AMD GPU 上使用 vLLM 进行推测解码

Hacker News 上关于“在 AMD GPU 上使用 vLLM 进行推测解码”的讨论,暴露出一个现实:官方 vLLM 在 AMD 消费级显卡上性能远低于社区分支(如 Radiance),社区开发者正以 fork 形式填补 AMD 在软件生态上的明显缺口。

一句话看懂:Hacker News 上关于“在 AMD GPU 上使用 vLLM 进行推测解码”的讨论,暴露出一个现实:官方 vLLM 在 AMD 消费级显卡上性能远低于社区分支(如 Radiance),社区开发者正以 fork 形式填补 AMD 在软件生态上的明显缺口。

事件核心:发生了什么

讨论源自一篇关于 AMD GPU 上 vLLM 推测解码的技术文章。参与讨论的开发者指出,官方 vLLM 在 AMD 消费级显卡(如 R9700 AI Pro)上的生成速度仅为 20-30 tokens/s,而使用社区维护的 Radiance 等 fork 后,速度可提升至 150-200 tokens/s。目前 AMD/vLLM 的官方优化资源大多集中在数据中心级显卡或 Ryzen AI 系列上,消费级“AI Pro”产品线几乎未被覆盖。

更值得注意的是,有开发者透露,曾与 AMD RTG(Radeon Technologies Group)团队成员直接接触,发现 AMD 内部甚至不为驱动开发人员提供测试用的显卡硬件,相关人员需自费购买。社区因此出现了一批基于 vLLM 的优化分支,例如 Radiance-vLLM 及其 MXFP4 扩展,后者已支持早期 PARO 量化方案,并针对多卡(如 4x R9700)场景做了速度优化。

为什么重要

这件事的深层意义在于,AMD 显卡在 AI 推理领域的“纸面性能”与“实际可用性”之间存在巨大鸿沟。NVIDIA 消费级显卡(如 RTX 5070 Ti)因本地模型运行生态成熟,售价较同性能档的 AMD 竞品高出 50% 以上,但用户仍愿意支付溢价,这直接反映了两者在开发者信任度上的差距。

这与 AMD 从 2010 年至 2025 年间对显卡产品线的定位策略有关——早期并未将显卡视为通用计算平台。George Hotz(小马哥)曾公开尝试用 AMD 卡做 AI 项目也是备受关注的案例,但最终结果并不理想。其结果是,一批曾在 AMD 硬件上投入精力的开发者付出了成本,导致如今即便 AMD 官方放出一些积极信号,社区依然持观望态度,等待新一代产品证明“这次确实不同”。

对用户/开发者/创作者的影响

对于尝试本地部署大模型的开发者和创作者,目前选择 AMD 显卡做 AI 推理仍意味着需要主动规避官方软件栈,改用 Radiance、MXFP4 fork 等社区方案才能获得可用性能。这对只想“开箱即用”的用户并不友好,因为安装、配置、调试 fork 分支的维护成本明显高于 NVIDIA 成熟的 CUDA 生态。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

从成本角度看,AMD 显卡因 AI 生态弱势而价格上未被“AI 溢价”推高,对纯游戏玩家相对友好;但对有本地模型运行需求的人来说,省下的硬件费用很可能转化为更高的时间成本与技术门槛。对开发工具链的维护者而言,社区 fork 的活跃也说明官方支持不到位,反而刺激了开源生态的自我修复能力。

值得关注的后续

首先是 AMD 官方是否会认真回应社区诉求——至少为 RTG 的驱动开发团队提供必要的硬件资源,并将消费级 AI Pro 产品线纳入 vLLM 官方支持范围。其次是 Radiance 这类 fork 能否持续跟进上游 vLLM 更新,并在 MXFP4、PARO 等量化方案上保持兼容稳定,这决定了它们能否从“个人日常使用”走向更大规模的部署。最后,如果 AMD 未来确实推出更有竞争力的 AI 软件栈,社区是否愿意再次尝试,还是会因过去多年积累的“失望记录”而继续观望,将直接影响 AMD 在本地 AI 推断市场的实际份额变化。目前公开信息显示,AMD 尚未对此讨论作出正式回应。

来源:hackernews

celebrityanime
celebrityanime
文章: 22228

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注