分类: AI 工具排错

CUDA out of memory

CUDA out of memory

该报错发生在 vLLM 使用 FlashMLA 稀疏 FP8 混合批次解码路径时,稀疏解码内核会分配一个随 --max-num-batched-tokens 线性增长的工作区,且该工作区不受启动时内存预检约束,批次增大后触发运行时 CUDA OOM。优先排查方向是调低 --max-num-batch