通过主机卸载减少基于 JAX 的 LLM 训练中的高带宽内存瓶颈

NVIDIA 宣布,在 JAX 框架中利用主机内存卸载(Host Offloading)技术,可以将大语言模型训练中的部分中间激活数据暂存至 CPU 内存,从而缓解 GPU 高带宽内存(HBM)瓶颈。在 GB200 NVL72 系统上的测试显示,该方法可使 DeepSeek-V3 671B 模型的训练吞吐量相…

NVIDIA 宣布,在 JAX 框架中利用主机内存卸载(Host Offloading)技术,可以将大语言模型训练中的部分中间激活数据暂存至 CPU 内存,从而缓解 GPU 高带宽内存(HBM)瓶颈。在 GB200 NVL72 系统上的测试显示,该方法可使 DeepSeek-V3 671B 模型的训练吞吐量相…

加州大学圣地亚哥分校团队利用宇树科技G1人形机器人,成功对活体猪实施了腹腔镜胆囊切除手术,这是公开报道中首次由人形机器人独立完成的标准化微创手术。尽管仍需人工校正且未达到手术无菌标准,但G1的成本仅为达芬奇手术系统的5%,为降低手术机器人门槛提供了新思路。

GPT-5.6 Sol Ultra 通过并行调用 64 个子智能体,在不到一小时内自动生成了存在 50 年的“Cycle Double Cover 猜想”的证明,将原本可能需要一整天的推理任务压缩至单小时完成。

APEC 2026年数字和人工智能部长会议及数字周活动将于7月16日至29日在成都举行,这是中国时隔24年再次主办该级别会议,会议将聚焦AI赋能、数字包容等议题,已吸引Meta、谷歌、微软、腾讯、百度等30余家国内外企业参展。

有用户实际测试了 AMD 锐龙 AI 处理器在本地运行大模型的能力,在运行 Qwen3.6 MoE A3B 模型时可达 60-70 tokens/秒,但指出当前本地模型在编程等复杂任务上仍有局限,本地大模型的实用性取决于内存成本和模型量化进展。

NVIDIA 发表技术博客,系统阐述如何通过调整大语言模型(LLM)的宽度(hidden dimension)、层数(L)与中间投影维度(H’),在保持精度的前提下,系统性提升推理吞吐量与交互响应速度。这并非一篇单纯的研究报告,而是一份指导模型开发者在设计阶段就对齐硬件特性的实用手册。

韩国存储芯片巨头SK海力士通过美国IPO募集265亿美元,创下非美国公司在美国上市的最大规模纪录。募资将用于韩国本土的新晶圆厂与封装设施,而美国商务部长已公开呼吁其考虑在美建厂,以减少对亚洲芯片生产的过度依赖。

Thinking Machines Lab 发布博文,明确提出其使命是构建“延伸人类意志与判断”的 AI,而非追求完全自主的智能。其核心观点是当前主流 AI 训练方式过于集中和静态,未能利用人类工作中持续产生的、分散的、隐性的知识,这与其技术路线形成了鲜明对比。

Perplexity 在账户设置中新增“Computer Analytics”功能,允许用户和开发者在账户设置中追踪不同 AI 模型的信用额度消耗情况,让算力使用更透明、更可控。

GitHub 发现给 Copilot 代码审查换上更强大的通用代码探索工具后,反而导致成本上升、问题检出率下降。问题不在于工具,而在于为工具编写的指令。修改指令以匹配人类审查者的阅读习惯后,成本降低了约 20%,质量保持不变。