一句话看懂:Wafer.ai 把 2.8T 参数的开源模型 Kimi K3 部署到了 AMD MI355X 上,在每美元推理吞吐上明显跑赢 NVIDIA B300 和 B200。它说明超大模型推理不再只能依赖英伟达 Blackwell,高显存容量的 AMD 芯片也能成为性价比选项。
事件核心:发生了什么
Kimi K3 是目前规模最大的开源模型之一,参数高达 2.8T。其权重在分配 KV cache 之前就需要超过 1.5TB 显存,单台 8 卡 B200 节点(192GB/卡)放不下,只能上双 B200 节点(TP16)或更高显存的 B300。Wafer.ai 的测试显示,AMD MI355X 凭借单卡 288GB 的 HBM 容量,可以在单节点 8 卡(TP8)内装下模型。
在 1024 token 输入 / 400 token 输出的基准下,8×MI355X 达到 952 tok/s/节点的聚合吞吐和 118 tok/s 的单流解码;双节点 16



