![[CI Failure]: LM Eval PCP (4xB200)](https://www.chat-gpts.plus/wp-content/uploads/2026/07/49334-644d5265.jpg)
[CI Failure]: LM Eval PCP (4xB200)
快速结论:该报错通常出现在 vLLM 的 CI 测试中,当运行 LM Eval 的 GSM8K 测试时,因 PR #46570 引入的 PCP+MLA 正确性缺陷导致测试失败。优先排查是否合并了引入该缺陷的 PR,并应用修复 PR #49294。
问题场景
该问题在 vLLM 项目的 CI 流水线中被触发,具体场景为运行 evals/gsm8k 中的 test_gsm8k_correctness 测试用例,测试环境配置为 4 块 B200 GPU。用户在执行 PCP (Precision Calibration Profile) 结合 MLA (Multi-Head Latent Attention) 路径时遇到正确性问题。
报错原文
[CI Failure]: LM Eval PCP (4xB200)
evals/gsm8k/test_gsm8k_correctness
原因分析
根据 Issue 讨论,PR #46570 引入了一个正确性缺陷,该缺陷影响 PCP+MLA 的执行路径,导致 GSM8K 评估测试结果不正确。该问题并非由外部库(如 transformers)引发,也不是偶发性测试失败,可以在本地稳定复现。
环境排查
- 确认是否合并了 PR #46570 引入的更改。
- 检查 vLLM 版本是否已包含 PR #49294 的修复。
- 验证 CI 测试环境配置:4 块 B200 GPU 是否正常运行。
- 确认测试命令行中是否启用了 PCP 或 MLA 相关参数。
解决步骤
- 检查当前代码版本:查看是否合并了 PR #46570(可在 Git 日志中搜索该 PR 的 commit)。
- 应用修复:该 Issue 已被标记为将由 PR #49294 修复。请将代码更新至包含 PR #49294 的版本。
- 本地验证:在合并修复后,手动运行以下测试命令确认问题是否解除:
python -m vllm.entrypoints.openai.run_batch --model ... --tasks gsm8k ...(具体参数参考测试脚本)。
验证方法
重新运行 test_gsm8k_correctness 测试用例,如果测试通过且 GSM8K 正确性指标符合预期,则问题已解决。可通过 CI 流水线的最终状态或本地测试结果进行确认。



