ValueError: Tokenizer class TokenizersBackend does not exist or is not currently imported.

用户在使用 vLLM 启动 API 服务(通过 Docker 命令 vllm/vllm-openai:qwen3_5 镜像)部署通过 LLaMA-Factory 或 SWIFT 微调后的 Qwen3.5 模型时触发此错误。无论微调方式是 LoRA(后合并)还是全参微调,均会复现。服务启动参数中包含

用户在使用 vLLM 启动 API 服务(通过 Docker 命令 vllm/vllm-openai:qwen3_5 镜像)部署通过 LLaMA-Factory 或 SWIFT 微调后的 Qwen3.5 模型时触发此错误。无论微调方式是 LoRA(后合并)还是全参微调,均会复现。服务启动参数中包含
![[Summary] Regarding memory issue in tests](https://www.chat-gpts.plus/wp-content/uploads/2026/07/18525-586377bc-768x403.jpg)
在对 Hugging Face Transformers 库执行测试时,用户在 CircleCI 持续集成环境中发现了内存泄漏问题。具体涉及以下框架和测试:

用户使用 transformers 5.12.0 加载 google/gemma-4-E2B-it 模型,并传入 assistant_model 启用 MTP(Multi-Token Prediction)加速生成,同时使用了 DynamicCache 和 use_cache=True 。生成过程中
![[LLaMA3] 'add_bos_token=True, add_eos_token=True' seems not taking effect](https://www.chat-gpts.plus/wp-content/uploads/2026/07/30947-cde5267c-768x403.jpg)
用户使用 Transformers 加载 LLaMA 3(如 llama3-8b)的 AutoTokenizer ,在 from_pretrained 中或通过 tokenizer.add_bos_token = True / tokenizer.add_eos_token = True 尝试控制

用户在修改 run_summarization.py 脚本时,使用 Trainer.hyperparameter_search 方法配合 backend="wandb" 进行超参搜索。用户定义了 compute_objective=hparam_objective 返回 metrics["eval_

用户在 Python 环境中执行 import transformers 命令,或脚本中导入该库时触发,常见于同时安装了 PyTorch、TensorFlow、JAX/Flax 等多种框架的开发环境。问题在 GitHub Issue #44273 中被报告,后续在 PR #45013 中有修复尝试,

在 Hugging Face Transformers 库的 Trainer 中,当用户从 checkpoint 恢复训练,并且 dataloader 包含随机操作(例如在 Dataset 的 __getitem__ 中应用随机噪声、数据增强或使用随机采样器)时,训练过程可能无法复现原始不间断运行的

用户在运行 PPDocLayoutV3 模型(通过 Hugging Face Transformers 库)时,发现模型在 CPU 和 CUDA 设备上输出结果不一致,具体表现为 _cached_generate_anchors 函数生成的 anchor 掩码存在差异。该函数在 transforme

用户在调用 Hugging Face Transformers 模型的 .generate() 方法时,尝试使用 torch CUDA graphs 进行推理加速(例如自行将模型整体包裹在 CUDA graph wrapper 中),但 stream capture 失败。单独使用模型的 forwa

用户使用 Hugging Face Transformers 加载 ibm-granite/granite-4.0-350m-base 模型,调用 model.generate() 进行文本生成时触发该错误。系统环境为 Ubuntu 24.04 with Python 3.12.12、Transfo