超越VLA:World Action Models如何重塑机器人操作

NVIDIA 研究人员提出用视频世界模型替代视觉语言模型,作为机器人操作策略的骨干网络,形成“世界动作模型(WAM)”,让机器人理解物理规律而非仅模仿示范动作,从而在陌生环境中更好地泛化。

NVIDIA 研究人员提出用视频世界模型替代视觉语言模型,作为机器人操作策略的骨干网络,形成“世界动作模型(WAM)”,让机器人理解物理规律而非仅模仿示范动作,从而在陌生环境中更好地泛化。

该报错通常出现在自建 LangChain 网页抓取 Loader/Tool 时,调用 r.json() 但目标网站(如 Cloudflare 防护页面)返回了 HTML 或非 JSON 内容。优先在 r.json() 外层增加 try/except ValueError 并回退到 r.text ,同

谷歌联合 Broadcom、Morgan Stanley 等机构设计了一套复杂的融资结构,让 Anthropic 以租赁方式获得价值 350 亿美元的 TPU 算力,同时把大部分硬件负债移出谷歌资产负债表。这项安排涉及约 2000 亿美元合同,是 AI 基础设施融资历史上规模最大的操作之一。

Google Cloud API Gateway 推出模型路由功能的 Public Preview,让开发者通过一个 OpenAI 兼容接口动态调用 Gemini、Claude 和 OpenAI OSS-GPT。这意味着多模型接入正从“自己写代码适配”变成云平台的基础能力,开发者和企业切换或混用大模型的成本会…

GitHub 官方博客展示了如何用“堆叠式 Pull Request”把 AI 编码代理生成的上千行巨型代码拆成小批次、可独立审查的提交链,解决 AI 提效后代码审查跟不上的问题。

LMSYS 团队发布 SpecForge v0.3.0,将投机解码中的目标模型推理与草稿模型训练彻底解耦,并开放多种算法的草稿模型。这意味着大模型推理加速的训练门槛和资源成本有望显著下降。

GitHub 宣布其 AI 应用快速开发工具 Spark 将于 2026 年 8 月逐步在 github.com 上关停,用户须在 8 月 31 日前导出代码。这一调整本质上是将 AI 应用开发能力并入 GitHub Copilot 生态,而非彻底放弃该方向。

德克萨斯州州长 Greg Abbott 于 8 月 4 日宣布,所有新建数据中心项目须经州公用事业委员会(PUCT)和电网运营商 ERCOT 双重审计,实际相当于暂停新项目审批。这是美国最大数据中心聚集地之一首次以行政手段强制干预 AI 算力扩张。

今年普利策奖共有8位获奖者或入围者主动披露使用了AI工具,创下披露规则实施以来的最高纪录——但用途主要集中于信息检索与翻译,而非新闻写作本身。

商汤发布并开源了 SenseNova U1 模型,它能在一个统一流程里同时完成推理和图像生成,属于多模态大模型的一次技术整合,值得关注的不仅是效果,更是“开源”背后的生态意图。