# Cache lazy initialization leads to spurious recompilation with chunked prefill

用户在 Hugging Face Transformers 中使用 generate() 进行文本生成,启用了 torch.compile 和 chunked prefill(通过设置 generation_config.prefill_chunk_size ),并使用静态缓存(Static Cac

用户在 Hugging Face Transformers 中使用 generate() 进行文本生成,启用了 torch.compile 和 chunked prefill(通过设置 generation_config.prefill_chunk_size ),并使用静态缓存(Static Cac

用户在 Conda 虚拟环境中运行 peer-reviewed 研究源码,尝试从 transformers 导入 AutoModelWithLMHead 、 AutoTokenizer 和 EsmModel 。此时已安装 PyTorch 2.12.0 和 transformers 5.10.0.de

用户在 Hugging Face Transformers 库中运行 SAM-HQ 模型的集成测试(非单元测试)时触发问题。测试命令为 pytest tests/models/sam_hq/test_modeling_sam_hq.py::SamHQModelIntegrationTest ,预期所

用户在运行 TextGen WebUI(text-generation-webui)时,使用 python server.py --gptq-bits 4 --model llama-7b 命令加载量化后的 LLaMA 模型,报错显示无法从 Transformers 中导入 LlamaConfig

据彭博社报道,中国量化基金行业在不到一年内,管理的资产规模翻了一倍多,达到约 3840 亿美元。背后主要推手是人工智能技术的快速采用,AI 正在重塑金融交易和投资策略的底层逻辑。

用户在实验性框架中使用 Transformers 版本 5.12.1,加载 Qwen3.5 模型(如 Qwen3.5-9B),并在张量并行度 TP=4 下触发。Qwen3.5 是一种混合注意力模型,其中约 75% 的解码器层使用 linear_attention (由 Qwen3_5GatedDel

一个名为 AXIOM 的开源项目展示了如何从零编写一个专为 LLM 推理设计的 Rust 操作系统内核,旨在解决 Linux 通用调度和内存分配机制在推理场景下的低效问题,能大幅降低模型层间切换的流式传输开销。
![[Bug]: GPT-OSS Harmony: vLLM silently returns `content: null` with `finish_reason="stop"` when its parser ends in a non-terminal state](https://www.chat-gpts.plus/wp-content/uploads/2026/07/45736-079cc018-768x403.jpg)
用户在 vLLM 中部署 GPT-OSS Harmony 模型(基于 HarmonyEncodingName.HARMONY_GPT_OSS 编码),通过 OpenAI 兼容的 API 发送请求。当模型采样输出格式错误的 assistant turn(例如省略了 ` ` 标记)时,vLLM 未能检测
![[Bug]: [ERROR][Exception]: Exceptions from Trio nursery (2 sub-exceptions) -- **ERROR**: ERROR preTokenId.size[96805] must <= maxPositionEmb](https://www.chat-gpts.plus/wp-content/uploads/2026/07/6838-0dc40aa0-768x403.jpg)
用户在 RAGFlow v0.17.2-full 版本(基于 Ubuntu 22.04)中,使用知识图谱(Knowledge Graph)功能并配置 Qwen-72B 作为 LLM 时触发此错误。执行知识图谱抽取任务后,任务失败并抛出异常。

用户在 transformers serve 工具中部署 google/gemma-4-31B-it 模型,通过 curl 发送非流式聊天补全请求,且提示词中不启用思考(thinking)功能。