标签: Transformer

PPFormulaNet training-loss bug

PPFormulaNet training-loss bug

该报错发生在 Transformers 库中 PPFormulaNet 模型训练时,原因是 ForCausalLMLoss 默认对 labels 左移一位,但 PPFormulaNet 是 encoder-decoder 架构,logits 与 labels 已对齐,导致训练标签错位、丢失最后一个目

Checkpoint conversion silently loads transposed fused-expert weights when the swapped dims are equal (Transpose(check_dims=True), qwen3_vl_m

Checkpoint conversion silently loads transposed fused-expert weights when the swapped dims are equal (Transpose(check_dims=True), qwen3_vl_m

该报错属于隐性问题,在使用 Transformers 加载 Qwen3-VL-MoE 旧版布局检查点时触发,当模型中间层维度恰好等于隐藏层维度或其二分之一时,专家权重会被静默转置加载,模型输出变成垃圾数据且不报任何警告。优先排查 moe_intermediate_size 与 hidden_size

CUDA out of memory

CUDA out of memory

该报错发生在 DeepSpeed ZeRO-3 加载大型稀疏 MoE 多模态模型(如 MiniMax-M3 428B)时,问题根源并非 ZeRO-3 分区失败,而是 transformers 的 _initialize_missing_keys 将整个模型所有未初始化参数放进单个 GatheredP