Connected Self Forcing:让视频自回归训练打通跨块梯度

alphaXiv 收录的 Connected Self Forcing(CSF)提出在自回归视频生成训练中重新连接被切断的跨块梯度,让后段预测能反过来指导前段上下文生成,且在 240 秒长视频评测中平均分高于 Self Forcing 与 SGF,但不改变推理流程。

一句话看懂:alphaXiv 收录的 Connected Self Forcing(CSF)提出在自回归视频生成训练中重新连接被切断的跨块梯度,让后段预测能反过来指导前段上下文生成,且在 240 秒长视频评测中平均分高于 Self Forcing 与 SGF,但不改变推理流程。

事件核心:发生了什么

根据论文摘要与 alphaXiv 页面信息,Self Forcing 此前通过自回放(self-rollout)在模型自己生成的历史上训练,以缓解曝光偏差,并借助 KV 缓存管理显存。但为了控制内存,历史缓存被 detached,前向依赖保留,反向梯度却断了:后段生成无法教前段如何写出更好的上下文。

CSF 的核心是重新接上这些梯度路径。梯度不仅经过历史 KV 写入,还穿过生成的 latent 回到产生它的计算中。为降低显存开销,作者提出 shortcut gradient replay,在不保留完整 rollout 计算图的情况下恢复跨块梯度。CSF 与 distribution matching distillation 结合,训练时同时考虑历史块的直接监督和它对后续生成的贡献。按摘要所述,推理过程不变,也不新增参数。

在固定 128 条 MovieGen Video Bench 提示词子集、240 秒分块生成并采用 teacher-forcing 初始化的条件下,CSF 的 VBench-Long 六项平均分为 0.8701,Self Forcing 为 0.8545,SGF 为 0.8495。不过 Dynamic Degree 一项 CSF 为 0.5539,低于 Self Forcing 的 0.7131 和 SGF 的 0.9200,作者也指出该指标表现依赖初始化方式。

为什么重要

长视频自回归生成的一个结构性矛盾是:分块生成适合流式输出,但每块都会成为下一块的上下文,误差容易沿时间轴累积。此前 Self Forcing 用自生成历史贴近推理分布,却牺牲了“后段反馈指导前段”的训练信号。CSF 把这条信号补回来,等于在训练层面承认:上下文写得好不好,不只看它当下像不像,还要看它被后来使用时有没有帮助。

对视频生成技术路线而言,它指向一种更精细的训练分工:前向可以靠 KV 缓存保持轻量,反向则通过选择性 replay 获得跨块反馈。这比简单加大模型或延长上下文更贴近工程现实,也说明自回归视频的竞争正在从“能否流式生成”转向“长时程一致性与动态质量能否兼得”。

对用户/开发者/创作者的影响

目前公开信息显示,CSF 仍是论文层面的训练方法,并非已上线产品或公开 API。对开发者而言,它的价值在于思路可复用:如果正在做自回归视频生成、流式内容生成或类似分块推理系统,可以关注“detach 历史缓存后如何补偿梯度”这一训练设计,以及 shortcut replay 能否移植到自己的训练管线。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对创作者和视频工具使用者,短期不必期待功能更新。更重要的是评测信号:CSF 在主客观平均分上占优,但 Dynamic Degree 偏低,意味着画面稳定性和运动幅度之间可能存在取舍。长视频工具若采用类似方案,需要在“不闪烁、主体一致”和“动作够不够大”之间调参或选择初始化策略。

值得关注的后续

第一,看作者是否公开代码、训练配置和完整评测细节,尤其是不同初始化下 Dynamic Degree 的波动范围。第二,看该方法能否与现有视频生成模型或开源框架结合,而不只是停留在 240 秒固定测试条件。第三,关注后续工作是否把这类跨块梯度连接扩展到音频、3D 或多模态自回归生成,以及推理成本是否真的零变化。

来源:alphaXiv

celebrityanime
celebrityanime
文章: 28708

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注