Compute logits and past_key_values once for the initial context rather than `num_beams` times?

用户在使用 Hugging Face transformers 库的 generate() 方法进行文本生成时,调用了以下解码策略之一: sample 、 beam search 、 beam sample 、 group beam search 。当初始上下文(prefix/prompt)很长(例

用户在使用 Hugging Face transformers 库的 generate() 方法进行文本生成时,调用了以下解码策略之一: sample 、 beam search 、 beam sample 、 group beam search 。当初始上下文(prefix/prompt)很长(例

用户在 VS Code 中运行 Python 脚本,尝试从 transformers 导入 Trainer ,但脚本无任何输出(包括报错信息)。卸载 datasets 后导入成功。但在 PyCharm 中 datasets 未卸载时导入也能正常执行。

用户使用 Hugging Face transformers 库调用 yonigozlan/sam3-litetext-s0 模型进行图像分割推理。在第一次推理中显存已占用大部分,第二次推理时显存溢出,且模型体积本身并不大。

用户在使用 Hugging Face Transformers 库、FlashAttention2(FA2)、以及 Qwen3VL-2B-Thinking 模型进行长上下文视频理解生成任务时,发现 transformers 5.4.0 版本相比 5.2.0 版本生成耗时增加了 17% 以上。该现象在

用户在 macOS (Apple Silicon) 环境下,使用 transformers==5.9.0 和 PyTorch==2.12.0 (CPU) 对 Qwen/Qwen3.5-0.8B 模型进行两种推理模式(全序列前向与预填充+缓存解码)的 logit 一致性测试。模型中包含 GatedDe

vLLM 核心开发者莫梓峰将在 AICon 深圳大会上公开其针对多模态大模型(如 Kimi-K2.6、Qwen3.6)的推理优化方案,重点解决 Encoder 性能瓶颈,这是开源推理框架应对多模态趋势的关键技术演进。

用户在使用 Transformers v5(5+)版本的 Pipeline 对象进行推理或处理任务时,若输入是一个大型生成器(例如流式数据集、大文件逐行读取生成器),调用 pipeline 时会导致内存耗尽(OOM)。

用户在使用 Transformers 加载 MiniMaxAI/MiniMax-M3(428B 稀疏 MoE 视觉语言模型)时,配置了 4-bit 量化(nf4, double-quant)、 device_map="auto" 和 max_memory={i: "165GiB" for i in

在 Transformers 5.12.1 中,使用 AutoTokenizer.from_pretrained("vesteinn/ScandiBERT") 加载 vesteinn/ScandiBERT 模型的 tokenizer 时触发。该 tokenizer 的原始模型是 BPE 类型,但 t

用户在使用 Hugging Face Transformers 的语义分割模型(如 DETR、MaskFormer、Mask2Former、OneFormer 等)时,通过 post_process_semantic_segmentation 函数获取分割结果。当前该函数会强制对 logits/sc