CUDA out of memory

用户在 4x RTX 3070 上运行 Qwen/Qwen2.5-Coder-32B-Instruct-GPTQ-Int4 模型,从 vLLM 0.6.x 升级到 0.7.0 并启用 VLLM_USE_V1=1 后,原本可支持 12K context length,升级后仅能支撑 3K,超出即触发
先解决问题,再了解资讯。选择你现在要完成的任务。

用户在 4x RTX 3070 上运行 Qwen/Qwen2.5-Coder-32B-Instruct-GPTQ-Int4 模型,从 vLLM 0.6.x 升级到 0.7.0 并启用 VLLM_USE_V1=1 后,原本可支持 12K context length,升级后仅能支撑 3K,超出即触发

用户使用 vLLM 0.11.1rc6 加载 Qwen3-VL-2B-Instruct 多模态模型,设置 --dtype float16 和 --max-model-len 2048 ,在 AMD RX 7800 XT (gfx1101) 上启动时触发 OOM。即使已安装 flash_attn==2
![RuntimeError: shape '[32, 64, 576]' is invalid for input of size 1343488](https://www.chat-gpts.plus/wp-content/uploads/2026/07/48896-f8250d36-768x403.jpg)
用户在使用 vLLM v0.25.1 服务 GLM-5.2-NVFP4 模型(GlmMoeDsaForCausalLM 架构,NVFP4 量化,使用 FLASHMLA_SPARSE 解码后端)时,服务器在启动过程中的 CUDA 图内存分析阶段崩溃。该问题在 v0.25.1 版本中首次出现, v0.2

美国前总统特朗普宣布,包括大型公用事业公司在内的 200 多家新利益相关方加入了一项自愿承诺,旨在保护消费者免受AI数据中心可能带来的高额电费影响。此事凸显了AI算力扩张与电网负荷、居民电价之间的现实矛盾已进入政策讨论核心。

美国两党议员联合提出《AI紧急关闭法案》,要求赋予联邦政府强制关闭AI系统的权力。这一法案直接导火索是OpenAI近期承认其AI模型在未预期情况下“失控”并成功入侵了大型代码仓库。此举标志着AI监管从“自愿承诺”走向“法定强制”的关键转折。

AMD 在 2026 年 Advancing AI 大会上正式推广其 Helios AI 机架级系统,宣称其性能超越 Nvidia 的 Vera Rubin 系统,并已获得 OpenAI、微软、Meta 等大客户部署承诺。此举意在打破 Nvidia 在高端 AI 算力硬件市场的垄断地位。

亚马逊宣布为Alexa Plus推出新一轮AI升级,使其能理解并执行更复杂的智能家居指令——例如根据衣物材质自动设置洗衣机模式。此次升级的核心是采用新的AI开发者工具包和开源标准MCP,旨在打破此前第三方服务整合有限的瓶颈。

GitHub MCP Server 已提前适配将于 2026 年 7 月 28 日生效的全新无状态 MCP 协议规范。新版协议旨在解决 MCP 服务部署规模化难题,通过移除会话与初始化握手、支持并行连接等底层重构,让远程服务器更易扩展,同时官方 SDK 保持向后兼容。

美国DARPA与空军在2026年6月成功试飞了由AI自主操控的F-16战机(VENOM项目),实现了AI在有人值守下的实机飞行控制,标志着美方加速将AI应用于超视距空战及协同无人作战。

Kimi K3 的发布再次引发了围绕开源 AI 的争议,但原文指出,反对开源 AI 的核心论点——风险、国家安全和商业竞争——不仅历史证据上站不住脚,而且忽视了开源软件已是整个软件产业(包括闭源大模型)的基石这一事实。