从GPU到Token:英伟达Vera Rubin如何重构下一代AI工厂

英伟达正将AI基础设施的竞争焦点从“单颗GPU算力”转向“Token工厂效率”,并推出Vera Rubin平台——一套整合CPU、GPU、LPU、网络和存储的异构系统,旨在以更低电力、更少GPU数量,实现更高的Token产出和更低的单位成本。

英伟达正将AI基础设施的竞争焦点从“单颗GPU算力”转向“Token工厂效率”,并推出Vera Rubin平台——一套整合CPU、GPU、LPU、网络和存储的异构系统,旨在以更低电力、更少GPU数量,实现更高的Token产出和更低的单位成本。

Anthropic 于7月17日发布 Claude Code v2.1.212,新增会话级防循环机制、后台会话和自动模式重置功能,并修复了包括 Bash 命令孤儿进程、Windows 兼容性等在内的多项关键缺陷。此次更新主要面向密集使用 Claude 的开发者和团队,提升了大模型在编程代理场景下的稳定性和可控…

AI公司为维持大模型在线服务,抢购全球约70%的高端计算机内存,导致内存价格飙升、消费级电脑涨价最多达50%。《大西洋月刊》调查指出,这场由工程低效引发的供应链危机可能持续数年,廉价电脑最早在2028年消失。

小红书联合北京大学、上海交通大学开发出 HYPIC,这是首个能在混合注意力大模型上实现位置无关缓存(PIC)的系统,将首次 token 延迟平均降低 3.25 倍。它解决了当前 RAG 和长上下文场景中,混合架构模型的缓存困境。

谷歌正在为其AI助手Gemini测试一项语音自定义功能,允许用户通过速度、活力、正式度和友好度四个滑动条来调节AI的语音风格。这项变化意味着语音助手正从固定选项走向个性化表达,可能影响日常对话和专业场景下的交互体验。

在2026年7月16日的世界人工智能大会上,百度智能云正式发布无代码平台秒哒3.5版本,核心更新包括iOS原生打包能力和多端共享后端功能。这意味着非技术用户无需Mac电脑、不写一行代码,就能将应用打包上架App Store,且不同终端(Web、App、小程序)可共用同一套后端数据库。目前该平台已服务超过350…

智谱AI以数亿元人民币收购AI Infra公司中科加禾(XCore Sigma),旨在强化其在大模型推理优化和多国产芯片适配方面的底层工程能力。这起收购直接回应了其GLM-5在爆发式调用增长下暴露出的高并发推理架构瓶颈,也表明国产大模型竞争正从模型本身转向算力软件基础设施。

面壁智能联合清华、东北大学等机构,于7月16日开源了企业数字员工平台StaffDeck。它不再只是一个对话窗口,而是试图将企业的流程、经验和规则转化为可以持续积累、不断迭代的“数字员工”,旨在解决传统AI聊天机器人无法沉淀组织知识的痛点。

自2026年6月以来,包括招商银行、农业银行、平安银行、光大银行在内的十多家银行联合银联、美国运通以及Kimi、阿里云等大模型公司,推出了AI主题银行卡。用户刷卡消费可获得大模型Token、AI会员权益、智能Agent工具等数字资产,传统积分体系正向算力和AI服务方向转型。

京东于7月17日正式上线京麦AI经营中心,一次性向商家开放22款AI工具,覆盖选品、客服、营销、店铺管理等百余个日常经营场景,旨在为平台商家提供从诊断到执行的完整AI经营服务闭环,而非单一工具堆叠。