RuntimeError: convolution(): expected the second dimension of the weight tensor

用户在实验性框架中使用 Transformers 版本 5.12.1,加载 Qwen3.5 模型(如 Qwen3.5-9B),并在张量并行度 TP=4 下触发。Qwen3.5 是一种混合注意力模型,其中约 75% 的解码器层使用 linear_attention (由 Qwen3_5GatedDel

用户在实验性框架中使用 Transformers 版本 5.12.1,加载 Qwen3.5 模型(如 Qwen3.5-9B),并在张量并行度 TP=4 下触发。Qwen3.5 是一种混合注意力模型,其中约 75% 的解码器层使用 linear_attention (由 Qwen3_5GatedDel

一个名为 AXIOM 的开源项目展示了如何从零编写一个专为 LLM 推理设计的 Rust 操作系统内核,旨在解决 Linux 通用调度和内存分配机制在推理场景下的低效问题,能大幅降低模型层间切换的流式传输开销。
![[Bug]: GPT-OSS Harmony: vLLM silently returns `content: null` with `finish_reason="stop"` when its parser ends in a non-terminal state](https://www.chat-gpts.plus/wp-content/uploads/2026/07/45736-079cc018-768x403.jpg)
用户在 vLLM 中部署 GPT-OSS Harmony 模型(基于 HarmonyEncodingName.HARMONY_GPT_OSS 编码),通过 OpenAI 兼容的 API 发送请求。当模型采样输出格式错误的 assistant turn(例如省略了 ` ` 标记)时,vLLM 未能检测
![[Bug]: [ERROR][Exception]: Exceptions from Trio nursery (2 sub-exceptions) -- **ERROR**: ERROR preTokenId.size[96805] must <= maxPositionEmb](https://www.chat-gpts.plus/wp-content/uploads/2026/07/6838-0dc40aa0-768x403.jpg)
用户在 RAGFlow v0.17.2-full 版本(基于 Ubuntu 22.04)中,使用知识图谱(Knowledge Graph)功能并配置 Qwen-72B 作为 LLM 时触发此错误。执行知识图谱抽取任务后,任务失败并抛出异常。

用户在 transformers serve 工具中部署 google/gemma-4-31B-it 模型,通过 curl 发送非流式聊天补全请求,且提示词中不启用思考(thinking)功能。

用户在 HuggingFace Transformers 库中使用 Gemma4 视觉语言模型(VLM)时,关注到 use_bidirectional_attention="vision" 配置下,图像 token 的双向注意力掩码在全局(full)与滑动(sliding)注意力层中的应用方式与官方
![[Bug]: Dynamic NTK RoPE scaling is wrong](https://www.chat-gpts.plus/wp-content/uploads/2026/06/41236-6f0d9c97-768x403.jpg)
用户在 vLLM 推理框架中加载 nomic-embed-text-v1 等嵌入模型时触发问题。该模型官方支持 8192 上下文长度,但 vLLM 仅支持 2048。问题源于 vLLM 中 DynamicNTKScalingRotaryEmbedding 实现的计算公式错误。可能受影响的范围包括所有

用户在使用 transformers 库(版本 5.8.0.dev0 或当前 main 分支,提交 a0fb01c )通过 LlamaConfig 初始化模型时触发。典型场景是自定义脚本中为 LlamaForCausalLM 传递自定义 head_dim 参数,但 hidden_size 与 num

在 Huggingface Diffusers 库中使用 Flux2 模型(transformer_flux2.py)进行训练或微调,启用了梯度检查点(gradient checkpointing)功能。具体发生在调制(modulation)计算的输出以元组(tuple of Tensors)形式传

用户在 Hugging Face Transformers 中使用 SinqConfig 量化模型(如 google/gemma-4-E4B-it ),执行 model.save_pretrained(save_dst) 后,再通过 AutoModelForCausalLM.from_pretrai