通过主机卸载减少基于 JAX 的 LLM 训练中的高带宽内存瓶颈

NVIDIA 宣布,在 JAX 框架中利用主机内存卸载(Host Offloading)技术,可以将大语言模型训练中的部分中间激活数据暂存至 CPU 内存,从而缓解 GPU 高带宽内存(HBM)瓶颈。在 GB200 NVL72 系统上的测试显示,该方法可使 DeepSeek-V3 671B 模型的训练吞吐量相…

NVIDIA 宣布,在 JAX 框架中利用主机内存卸载(Host Offloading)技术,可以将大语言模型训练中的部分中间激活数据暂存至 CPU 内存,从而缓解 GPU 高带宽内存(HBM)瓶颈。在 GB200 NVL72 系统上的测试显示,该方法可使 DeepSeek-V3 671B 模型的训练吞吐量相…

Hugging Face 首席执行官 Clem Delangue 指出,越来越多的企业开始从使用昂贵的商业 API 转向拥抱开源 AI 模型,根本原因在于规模化带来的成本压力。这一趋势背后,是 AI 行业底层商业模式和竞争格局正在发生深刻变化。

OpenAI 员工 Vaibhav Srivastav 近日详细说明了 GPT-5.6 Sol 五个推理级别(Light、Low、Medium、High、xhigh)如何匹配不同任务复杂度,同时澄清该分级体系与 GPT-5.5 完全不兼容,建议用户迁移时主动降低一个级别开始使用。这一设计虽然在“控制成本”和“…

LMSYS(Chatbot Arena 团队)联合 AMD 宣布,DeepSeek-V4 Flash 的强化学习训练已成功在 AMD Instinct MI355X GPU 上运行,基于 Miles 框架实现。这解决了量化模型在线权重更新时,训练与推理引擎之间概率不一致的行业难题。

Anthropic 为 Claude Code 桌面版推出了内置浏览器功能,使 AI 能够直接读取、点击和交互网页内容,相当于把开发者的浏览行为代理给了模型。这一更新将 Claude 从纯代码助手扩展为具备联网观察力的协作工具。

GPT-5.6 Sol Ultra 通过并行调用 64 个子智能体,在不到一小时内自动生成了存在 50 年的“Cycle Double Cover 猜想”的证明,将原本可能需要一整天的推理任务压缩至单小时完成。

OpenAI 发布了旗舰模型 GPT-5.6 Sol,该模型能自主完成对小模型 Luna 的后训练,只需一段“相当模糊的提示词”即可自动配置训练参数、选择 GPU 并执行训练脚本。这标志着 AI 系统在递归自我改进能力上迈出了实质性一步。

OpenAI 于 2026 年 7 月 9 日推出 ChatGPT Work 和 Codex 两款智能体,将 ChatGPT 从对话工具升级为能跨应用执行复杂任务的自动化助手,并引入按 Token 消耗的智能体额度体系。

GitHub 为 REST API 新增了一个端点,允许企业一次性查询所有成员在多用户预算下的使用进度与限额状态,省去了过去逐人调用的繁琐流程,大幅提升了大企业预算管理的效率。

Meta 本周连续发布两款 AI 产品——图像生成模型 Muse Image 和自主智能体模型 Muse Spark 1.1,叠加自研 AI 芯片量产消息,推动股价单周大涨约 15%,收复年内全部跌幅。这轮上涨反映市场对其 AI 战略从观望转向买入。