NVFP4 量化会毁掉机器人策略?LatentQuant 提出两阶段方案

arXiv 上一项新研究指出,在视频 VAE 上直接做 NVFP4 量化,会让下游机器人动作策略成功率从 95.5% 跌到 10.5%;作者提出两阶段 QAT 框架 LatentQuant,在保留重建质量的同时把 LIBERO 成功率拉回 95.75%。

一句话看懂:arXiv 上一项新研究指出,在视频 VAE 上直接做 NVFP4 量化,会让下游机器人动作策略成功率从 95.5% 跌到 10.5%;作者提出两阶段 QAT 框架 LatentQuant,在保留重建质量的同时把 LIBERO 成功率拉回 95.75%。

事件核心:发生了什么

2026 年 10 月 7 日提交到 arXiv cs.AI 的论文摘要显示,近期世界动作模型(WAM)会复用预训练视频 VAE,其编码器潜变量直接作为下游动作策略的条件输入。这意味着量化不能只保住重建保真度,还要保住冻结策略所依赖的“面向策略的潜变量契约”。

作者对比了两种路径:直接 NVFP4 量化会留下未补偿的 W4A4 误差;联合量化感知训练(QAT)在 Wan2.1 上几乎追平 FP32 的 VBench-7 得分(0.7403 对 0.7409),但 LIBERO 成功率从 95.5% 崩到 10.5%。受控的仅解码器实验表明,激活的量化-反量化操作会改变重建信号和解码器 Jacobian,把梯度重定向回编码器,造成持续的潜变量漂移。为此提出的 LatentQuant 分两步:先让量化编码器与高精度版本对齐,再冻结编码器去适配解码器。

为什么重要

该结果提醒行业,低精度量化对生成式模型的影响不限于画质指标。当 VAE 潜变量被复用为机器人策略输入时,重建分数好看并不代表控制能力被保住。NVFP4 是 NVIDIA 主推的低精度格式,若在视频 VAE 和 WAM 这类链路里直接套用,可能让下游策略失效。这会影响推理成本优化、算力部署和具身智能的工程路线选择:量化方案必须把“策略面向的表示”当作一等约束,而不是只盯 VBench 之类的生成指标。

对用户/开发者/创作者的影响

对做机器人、具身智能或视频生成应用的开发者来说,如果计划在 NVIDIA B300 等硬件上用 NVFP4 加速 VAE,需要把下游任务成功率纳入量化验证流程,不能只看重建或生成分数。摘要显示,LatentQuant 在 Wan2.1 和 Wan2.2 上保持接近基线的控制与重建质量,LIBERO 成功率 95.75%、RoboTwin 68.8%;在 B300 上,NVFP4 执行相对 BF16 cuDNN 的端到端 VAE 加速为 1.17 倍到 1.26 倍。目前公开信息显示,这些是论文摘要中的实验结果,不是已上线产品或可直接调用的 API。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 LatentQuant 是否会开源实现,或在主流视频 VAE/WAM 工具链中集成;二是 NVFP4 量化在更多机器人基准和真实硬件上的稳定性,是否会出现新的潜变量漂移场景;三是 NVIDIA 及模型厂商会不会把“策略面向的潜变量一致性”写入量化工具或部署指南。上述判断均基于论文摘要,尚待同行评审和完整实验核验。

来源:arXiv cs.AI

celebrityanime
celebrityanime
文章: 27956

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注