Qwen3.5 crash with `cache_implementation=”static”` — `KeyError: ‘linear_attention’`

用户在 Transformers 5.10.1 中尝试使用 Qwen3.5 混合线性注意力模型(hybrid linear-attention model),通过 generate() 方法并启用静态缓存( cache_implementation="static" 或预构建 StaticCache
先解决问题,再了解资讯。选择你现在要完成的任务。

用户在 Transformers 5.10.1 中尝试使用 Qwen3.5 混合线性注意力模型(hybrid linear-attention model),通过 generate() 方法并启用静态缓存( cache_implementation="static" 或预构建 StaticCache

用户使用 Hugging Face Transformers 库(版本 5.10.1)中的 StaticCache.early_initialization 方法,为包含线性注意力层(如 layer_types = ["full_attention", "linear_attention"] )的混

用户使用 Transformers 库中的 CanineModel (google/canine-s),在调用 model.half() 后通过 torch.onnx.export 导出 FP16 ONNX 模型时触发报错。该问题在 PyTorch 2.9.0+cu129 / CUDA 和 PyTo

Cloudflare 自 2024 年 7 月提供一键屏蔽所有 AI 爬虫功能后,现在将其拆分为搜索、训练和代理三类独立控制,并将于 2026 年 9 月 15 日起默认拦截携带广告页面的训练和代理爬虫。此举旨在迫使 AI 公司明确区分爬虫目的,同时让网站所有者更精细地管理 AI 对自身内容的访问。

苹果在 iOS 27 开发者测试版中开放了 Siri 的语速和情感表达调节功能,允许用户通过滑块调整“节奏”与“表现力”。这是 Siri 围绕生成式 AI 重构的一部分,旨在让语音交互更自然个性化,但定制深度目前仍不如 ChatGPT。

Vercel CEO 吉列尔莫·劳奇指出,AI 代理进入生产环境后,最大的瓶颈已从“能否实现功能”转向“如何安全控制数据和权限”。Vercel 用内部框架 Eve 和 Sandbox 工具试图解决代理与模型的分离问题,同时暗示 OpenAI、Anthropic 等实验室的模型不再是企业唯一选择。

2026年上半年,包括Microsoft、Oracle、GitLab在内的至少10家知名科技公司,以“AI改变工作方式”或“为AI投资重组”为由,合计裁减了数万个岗位。截至6月底,全年科技行业裁员总数已达到约12万人,AI成为裁员最常被引用的理由。

Anthropic 旗下 Claude Code 团队发布了一篇关于智能体设计模式的技术文章,首次系统性地定义了四种“循环”(loop)类型,为开发者构建更可靠、可控的编码智能体提供了明确的技术框架,而非仅依赖提示工程。

运行 Ollama 加载模型(特别是 CPU-only 推理场景),模型可能有时能加载、有时被拒绝,尤其在内存接近临界值、系统有其他程序占用内存时更容易触发。用户反馈在 Linux、Windows ARM、macOS 上均会出现。

用户在 macOS 上使用 Ollama 0.13.3 尝试导入一个基于 mistral-small-3.2 的微调模型(从 HuggingFace 下载的 Safetensors 权重),执行 ollama create 命令时触发报错。同样的错误在使用官方版本 mistralai/Mistral