不提前混帧:轻量视频编码器用约三分之一视觉Token追平全图路径

alphaXiv 上的一篇论文提出,视频编码不必让相邻帧在早期就交互:先用冻结的图像编码器保留逐帧证据,再用问题感知选择器统一分配少量 Token,最后对入选锚点做轻量时序修正。按其报告,结果在 13 项基准上接近“全图像 Token”路径,而视觉 Token 只用到约 28% 至 35%。

一句话看懂:alphaXiv 上的一篇论文提出,视频编码不必让相邻帧在早期就交互:先用冻结的图像编码器保留逐帧证据,再用问题感知选择器统一分配少量 Token,最后对入选锚点做轻量时序修正。按其报告,结果在 13 项基准上接近“全图像 Token”路径,而视觉 Token 只用到约 28% 至 35%。

事件核心:发生了什么

论文关注的是一个具体矛盾:原生视频通路在视觉编码阶段就让相邻帧耦合,而图像通路逐帧独立编码,能保留更细的帧级证据,却要把全部图像 Token 送进语言模型,视觉输入成本高。

作者把常被混在一起的三件事拆开:逐帧表示、跨帧 Token 分配、时序交互。流程是:冻结的图像编码器先生成各帧候选;一个冻结的、问题感知的选择器按相关性、帧内多样性和相邻帧对应关系分配固定 Token 预算;随后一个可选的学习式修正器让保留的锚点读取邻帧上下文,并只写入残差更新。选择器保持锚点数量不变,论文称其为“零扩张”,但这指的是输出接口,不代表整体没有算力开销。

素材给出的数据显示,在 Qwen3-VL-8B 上,该方法以 1,535 个视觉 Token 取得 13 项基准宏平均 62.75,全图像路径为 4,424 Token、62.58,原生 Conv3D 为 2,212 Token、59.49;在 Qwen3-VL-32B 上为 66.28,对比全图像的 66.09,并报告 2.16 倍端到端加速。需说明的是,以上为论文摘要与页面摘要信息,尚不等于已上线产品能力。

为什么重要

视频多模态的成本大头往往不是“能不能看懂”,而是要看多少帧、塞多少视觉 Token。若“先保留帧级证据、再联合分配、最后补时序上下文”的路线成立,视频理解可以在不早期混帧的前提下压缩视觉输入,这对长视频、监控回放、教育录播等需要细粒度时刻判断的场景更有价值。

它也可能改变视频编码器与图像编码器的关系:图像模型生态的复用空间变大,团队不必为视频从头训练重时序编码器,而是把重心放在选择与修正模块上。

对用户/开发者/创作者的影响

对开发者而言,这意味着视频理解应用的推理成本和上下文占用有机会下降,尤其是基于 Qwen3-VL 这类现有多模态骨干做二次开发时,选择器与可选修正器是较清晰的工程切口。对普通用户,短期内更可能体现为视频问答、内容审核或录播摘要类功能在同等算力下能处理更长素材。对创作者,若平台采用类似方案,长视频被“看懂”的单位成本可能降低,但具体画质、帧率、问题类型都会影响实际压缩效果。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是看该路径是否被更多视觉语言骨干复现,尤其是非 Qwen 系列。二是看选择器在真实长视频、多镜头切换和小区域短时变化上的稳定性。三是看推理框架与 API 侧是否把“固定视觉 Token 预算”做成可配置项,那才是从论文走向产品化的关键一步。

来源:alphaXiv

celebrityanime
celebrityanime
文章: 28008

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注