[CI Failure]: LM Eval PCP (4xB200)

该问题在 vLLM 项目的 CI 流水线中被触发,具体场景为运行 evals/gsm8k 中的 test_gsm8k_correctness 测试用例,测试环境配置为 4 块 B200 GPU。用户在执行 PCP (Precision Calibration Profile) 结合 MLA (Mul

[CI Failure]: LM Eval PCP (4xB200)

[CI Failure]: LM Eval PCP (4xB200)

快速结论:该报错通常出现在 vLLM 的 CI 测试中,当运行 LM Eval 的 GSM8K 测试时,因 PR #46570 引入的 PCP+MLA 正确性缺陷导致测试失败。优先排查是否合并了引入该缺陷的 PR,并应用修复 PR #49294。

问题场景

该问题在 vLLM 项目的 CI 流水线中被触发,具体场景为运行 evals/gsm8k 中的 test_gsm8k_correctness 测试用例,测试环境配置为 4 块 B200 GPU。用户在执行 PCP (Precision Calibration Profile) 结合 MLA (Multi-Head Latent Attention) 路径时遇到正确性问题。

报错原文

[CI Failure]: LM Eval PCP (4xB200)
evals/gsm8k/test_gsm8k_correctness

原因分析

根据 Issue 讨论,PR #46570 引入了一个正确性缺陷,该缺陷影响 PCP+MLA 的执行路径,导致 GSM8K 评估测试结果不正确。该问题并非由外部库(如 transformers)引发,也不是偶发性测试失败,可以在本地稳定复现。

环境排查

  • 确认是否合并了 PR #46570 引入的更改。
  • 检查 vLLM 版本是否已包含 PR #49294 的修复。
  • 验证 CI 测试环境配置:4 块 B200 GPU 是否正常运行。
  • 确认测试命令行中是否启用了 PCP 或 MLA 相关参数。

解决步骤

  1. 检查当前代码版本:查看是否合并了 PR #46570(可在 Git 日志中搜索该 PR 的 commit)。
  2. 应用修复:该 Issue 已被标记为将由 PR #49294 修复。请将代码更新至包含 PR #49294 的版本。
  3. 本地验证:在合并修复后,手动运行以下测试命令确认问题是否解除:
    python -m vllm.entrypoints.openai.run_batch --model ... --tasks gsm8k ...(具体参数参考测试脚本)。

验证方法

重新运行 test_gsm8k_correctness 测试用例,如果测试通过且 GSM8K 正确性指标符合预期,则问题已解决。可通过 CI 流水线的最终状态或本地测试结果进行确认。

参考来源

vllm-project/vllm #49334

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

celebrityanime
celebrityanime
文章: 14712

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注