vram usage does not go back down after model unloads – stuck in Stopping…

该报错通常出现在 Ollama 模型卸载后 VRAM 无法回降、状态卡在 Stopping... 的场景。优先排查 ollama_llama_server 子进程是否残留,以及客户端(如 n8n)是否过早断开连接。

该报错通常出现在 Ollama 模型卸载后 VRAM 无法回降、状态卡在 Stopping... 的场景。优先排查 ollama_llama_server 子进程是否残留,以及客户端(如 n8n)是否过早断开连接。

使用 SeedVR2 7B Int8 模型进行图像放大(Upscale Image Template Workflow)时,VAE 模型存放路径错误导致工作流找不到文件。优先将 ComfyUI 更新到最新版本即可修复。

防务巨头洛克希德·马丁等公司参与的VC投资额2026年迄今已达41亿美元,创历史新高。无人机和自主系统正成为军事AI商业化的核心赛道,防务资本加速向AI初创公司倾斜。

《华尔街日报》报道,美国企业正从“堆算力、堆token”转向“极致节俭”——主动混用更便宜的中国大模型与OpenAI、Anthropic的顶级模型,这种策略直接冲击了后两家公司的营收预期和IPO估值。

NVIDIA 开源的 Nemotron 3 Ultra 模型在芯片设计中的 RTL 编码任务上,借助 ACE-RTL 智能体框架实现了 97.1% 的测试通过率,同时每轮迭代仅消耗 6629 个 token,准确率和效率均超过 GLM 5.2 和 Kimi K2.6 等开源模型。

亚马逊云科技发布了 Loom,一个开源参考平台,旨在为企业级 AI 代理管理提供统一的身份、权限和部署框架。它展示了如何使用标准 AWS 服务构建自有代理平台,而非使用托管服务,这为平台工程团队提供了可复用的企业级 AI 代理架构蓝图。

Cursor 工程团队让一群 AI 智能体仅凭 835 页 SQLite 技术手册,在无源码、无测试、不联网的条件下用 Rust 从零实现数据库引擎,并一次性通过全部预留测试;关键发现是智能体的编排策略比模型本身更重要——采用规划与执行分离的方案,成本从 10,565 美元降至 1,339 美元,差距近 8…

AMD 在 7 月 23 日的 Advancing AI 2026 大会上发布了 Instinct MI455X 加速器和 Helios 机架系统,首次将 2nm 制程引入 GPU 计算芯粒,并获得了 OpenAI、Meta、微软等关键客户的公开站台。这标志着 AMD 正式开始从“卖单卡”转向交付“机架级 A…

昆仑万维集中发布 Matrix-3.5 世界模型、Mureka V9.5/O3 音乐模型和 Riemann-1.0 机器人世界模型,明确了世界模型的两条落地路径:虚拟内容实时生成与交互,以及机器人先预测再行动。CEO 方汉将 2026 年称为“世界模型元年”,这一判断背后是模型从“生成画面”向“理解因果和持续…

本周AI行业发生多起高关注度事件:DeepSeek因内部会议纪要泄露暂停融资谈判,引发行业对投融资纪律的讨论;AI大神Karpathy疑似从Anthropic离职;美国指控Kimi K3模型蒸馏,但遭开源社区反驳;微信员工因晒317万年终奖被腾讯辞退,凸显科技公司薪资保密高压线。