Standardize test image fixture loading for COCO images

用户在运行 Transformers 测试时,例如在本地执行 pytest tests/test_image_processing_common.py 或特定模型测试(如 tests/models/vitpose/test_image_processing_vitpose.py ),测试中直接使用

用户在运行 Transformers 测试时,例如在本地执行 pytest tests/test_image_processing_common.py 或特定模型测试(如 tests/models/vitpose/test_image_processing_vitpose.py ),测试中直接使用

用户在使用 transformers v5 加载所有 CodeLlama 系列模型( codellama/CodeLlama-7b-hf 、 codellama/CodeLlama-7b-Instruct-hf 、 codellama/CodeLlama-7b-Python-hf 、 codella

使用 transformers v5 的 AutoTokenizer.from_pretrained() 加载任何 tokenizer_config.json 中设置了 "tokenizer_class": "LlamaTokenizerFast" 或 "LlamaTokenizer" 的模型。已确

用户在 Kohya SS(版本 v21.8.3 及多个其他版本)中运行 BLIP captioning 功能时,设置 num_beams 大于 1(如 12)并启用 --beam_search ,导致脚本崩溃并返回 ModuleNotFoundError: No module named 'tqdm

用户在使用 Hugging Face transformers 库的 generate() 方法进行文本生成时,调用了以下解码策略之一: sample 、 beam search 、 beam sample 、 group beam search 。当初始上下文(prefix/prompt)很长(例

用户在 VS Code 中运行 Python 脚本,尝试从 transformers 导入 Trainer ,但脚本无任何输出(包括报错信息)。卸载 datasets 后导入成功。但在 PyCharm 中 datasets 未卸载时导入也能正常执行。

用户使用 Hugging Face transformers 库调用 yonigozlan/sam3-litetext-s0 模型进行图像分割推理。在第一次推理中显存已占用大部分,第二次推理时显存溢出,且模型体积本身并不大。

用户在使用 Hugging Face Transformers 库、FlashAttention2(FA2)、以及 Qwen3VL-2B-Thinking 模型进行长上下文视频理解生成任务时,发现 transformers 5.4.0 版本相比 5.2.0 版本生成耗时增加了 17% 以上。该现象在

用户在 macOS (Apple Silicon) 环境下,使用 transformers==5.9.0 和 PyTorch==2.12.0 (CPU) 对 Qwen/Qwen3.5-0.8B 模型进行两种推理模式(全序列前向与预填充+缓存解码)的 logit 一致性测试。模型中包含 GatedDe

vLLM 核心开发者莫梓峰将在 AICon 深圳大会上公开其针对多模态大模型(如 Kimi-K2.6、Qwen3.6)的推理优化方案,重点解决 Encoder 性能瓶颈,这是开源推理框架应对多模态趋势的关键技术演进。