视频世界模型推理最高提速2.59×!浙大新作无需重训,不改参数

浏览14次 点赞0次 收藏0次

【导读】交互式视频世界模型正在从「一次性生成短片」走向「像游戏一样边操作边生成」。但长轨迹交互会迅速放大上下文、显存和多步去噪开销。Light Interaction不改模型参数、不重新训练,只在推理阶段把相机轨迹变成调度信号,动态选择历史上下文、在回访状态复用去噪输出,并用面向自回归生成的3D稀疏注意力降低计算。

视频世界模型想真正进入交互时代,不能只停留在一次性生成几秒视频。它需要像游戏引擎一样,根据用户前进、后退、转向、回看等操作,持续生成后续画面,并让场景在长时间探索中保持一致。

问题在于,生成链路越长,成本越难压。

以HY-WorldPlay为例,单张A100 GPU上生成约10秒视频,模型主干推理耗时超过200秒。为了保持长时一致性,模型需要维护较重的历史信息;当前片段需要参考更长上下文;每生成一个视频片段,又要经过多步去噪。

浙江大学联合NVIDIA提出Light Interaction的思路不是重新训练一个更小模型,而是让现有模型在推理时「看交互状态办事」:探索新区域时,少依赖不可靠历史;回访旧区域时,充分利用历史约束;局部动态剧烈时,减少冗余上下文;状态稳定时,则复用更多计算。


论文链接:https://arxiv.org/abs/2605.31158

项目主页:https://2843721358l-del.github.io/Light-Interaction-Project/

GitHub:https://github.com/2843721358l-del/Light-Interaction-Project

原始推理与接入Light Interaction后的长时交互生成示例。(视频中的速度数字对应本演示视频的交互动作、视频时长和统计口径;论文表格中的2.59×来自统一benchmark测试)

瓶颈在哪

传统视频生成通常给定文本或图像后,一次性生成固定长度片段;自回归视频生成则把历史片段缓存起来,按时间顺序逐块延展。交互式视频世界模型又往前走了一步:用户的相机控制会不断改变接下来要生成的视角,模型必须在流式生成中持续调用历史记忆。

一旦交互轨迹变长,系统面对的不只是「多生成几帧」,推理链路中的几类基础开销都会被放大:

  • 历史信息更重:为保持长时一致性,模型需保留足够的上下文,KV cache的显存压力难以忽略;

  • 注意力计算更重:当前生成视频片段需要参考更长历史,上下文越长,生成主干中的注意力开销越高;

  • 去噪成本更重:每生成一个视频片段,模型都需要多次运行Transformer完成逐步去噪。


图1:交互式视频世界模型的推理瓶颈。长轨迹下,模型不仅要逐段生成视频,还要持续维护历史上下文、KV缓存和多步去噪计算。

Light Interaction

这篇工作的核心观察是:交互状态决定了哪些历史信息真正有用,也决定了哪些计算可以被安全省掉。探索新区域时,检索到的空间记忆未必可靠;回访已见区域时,历史视角反而可以提供强约束。局部动态越强,固定保留长时间上下文的收益越有限;而在回访阶段,去噪过程相邻步骤更稳定,也更适合缓存复用。

基于这些观察,Light Interaction拆成三件事:自适应上下文管理、轻量级去噪缓存,以及软硬件协同的3D稀疏注意力。


图2:Light Interaction总体框架。方法在推理阶段动态选择上下文,按状态启用去噪缓存,并用软硬件协同的3D稀疏注意力加速剩余计算。

第一步:只保留真正有用的历史

交互式视频世界模型的上下文主要包括两类:近期时间上下文,用来维持短期运动连续;检索得到的空间记忆,用来在相机回访旧区域时保持几何和外观一致。

Light Interaction使用相机位姿相似度判断当前视角是否存在可靠历史参考。当最大位姿相似度低于阈值时,系统将当前状态视为探索阶段,丢弃可能误导生成的空间记忆;当相似度达到阈值时,相关历史视角才会被保留下来,作为条件参与后续生成。

时间上下文也不再使用固定窗口。方法会根据近期稳定latent的变化程度自适应调整:局部动态较大时缩短时间窗口,减少冗余历史;变化较平稳时保留更多上下文,增强连续性。

第二步:在回访状态复用去噪

去噪缓存能不能用,关键看模型输出是否稳定。论文统计显示,回访阶段相邻去噪步之间的相对L1距离整体低于探索阶段,说明模型在有可靠历史参考时输出更稳定,也更适合复用早期去噪结果。


图3:论文统计的相邻去噪步输出差异。回访阶段相对L1距离整体低于探索阶段,为只在回访状态下启用去噪复用提供依据。

因此,Light Interaction只在存在可靠历史参考的回访状态下启用去噪缓存:第一步正常计算,中间去噪步复用第一步模型输出,最后一步仍正常计算,用于校正累计误差。探索阶段则保持完整去噪流程,避免把不稳定输出反复放大。

第三步:让3D稀疏注意力真正跑起来

稀疏attention的难点在于,少算理论FLOPs不等于真实延迟一定下降。在自回归视频生成中,当前chunk、历史KV、文本token和因果布局交织在一起,Q/KV长度高度不对称。直接套用通用稀疏注意力,收益很容易被数据重排、gather/scatter、layout conversion和padding等周边开销抵消。

Light Interaction的做法更贴近自回归视频生成的实际结构:文本条件KV缓存和当前chunk始终保留稠密计算,只对历史视觉KV做3D block稀疏选择;同时通过Triton融合Q preparation、KV preparation和untile scatter等操作,减少中间张量和重复内存搬运。


图4:自回归场景下的稀疏注意力实现。Light Interaction保留文本条件和当前chunk的稠密计算,只稀疏历史视觉KV,并通过算子融合减少数据搬运。

实验结果

团队在HY-WorldPlay和Matrix-Game-3.0两个开源交互式视频世界模型上进行评估,并与Sparse VideoGen、LongCat-Video Block Sparse Attention、TeaCache等无需训练的加速基线对比。实验硬件为NVIDIA A100 80GB GPU。需要注意的是,论文中的latency指生成主干延迟,不包含近似固定的VAE解码开销。

数字最直观:在HY-WorldPlay上,生成约10秒视频,Light Interaction将生成主干延迟从228.60秒降至88.24秒,达到2.59×加速,同时峰值显存从76.57GB降至54.66GB;在Matrix-Game-3.0上生成约20秒视频,延迟从59.70秒降至37.07秒,达到1.61×加速。

质量指标上,论文报告了PSNR、SSIM、LPIPS、VBench等多维结果。整体看,Light Interaction并不是简单「拿画质换速度」:在HY-WorldPlay上,它保持了较好的视觉质量并显著降低显存;在Matrix-Game-3.0上,也在竞争性质量下取得最低延迟。


表1:HY-WorldPlay与Matrix-Game-3.0上的质量和效率对比。Light Interaction在两个模型上均取得最快延迟,并在HY-WorldPlay上显著降低峰值显存。

世界模型的推理系统正在变得「状态感知」

Light Interaction的价值不只在于某个模型上的提速,而在于它提出了一种更适合交互式生成的推理范式:交互轨迹不只是生成条件,也可以成为系统调度信号。

相机轨迹告诉系统当前是探索还是回访;局部动态告诉系统时间上下文该长还是短;历史可靠性决定空间记忆能否参与生成;去噪稳定性决定哪些计算可以复用。这让视频世界模型的推理过程从固定流程,变成了随交互状态变化的动态系统。

从工程角度看,这项工作也强调了算法稀疏与实际系统加速之间的差距。对自回归视频生成来说,稀疏策略本身不足以保证速度提升,KV布局、算子融合、访存路径和数据搬运都会直接影响实际延迟。

对于游戏模拟、虚拟场景探索、机器人和具身智能训练等应用场景,推理延迟和显存成本是能否走向实际使用的关键门槛。Light Interaction提供了一条现实路线:不重新训练模型,而是在推理阶段把交互状态用起来。

结语

如果说早期视频生成关注「生成得像不像」,交互式视频世界模型还要回答另一个问题:能不能持续、可控、低延迟地生成。

Light Interaction的答案是,让模型根据用户交互状态自适应分配计算。随着视频世界模型走向更长时序、更复杂控制和更高分辨率,这类状态感知的推理优化方法可能会成为重要方向。

作者介绍

该工作来自浙江大学与NVIDIA的合作研究。论文第一作者为浙江大学逯嘉程,通讯作者为浙江大学李渝研究员,并与NVIDIA谢恩泽研究员团队合作完成。作者团队关注视频生成模型推理优化、视频世界模型、软硬件协同加速等方向,涉及KV缓存管理、稀疏注意力、GPU算子优化等系统问题。

参考资料:

编辑:

声明:本文转载自新智元,转载目的在于传递更多信息,并不代表本社区赞同其观点和对其真实性负责,本文只提供参考并不构成任何建议,若有版权等问题,点击这里查看更多信息!本站拥有对此声明的最终解释权。如涉及作品内容、版权和其它问题,请联系我们删除,我方收到通知后第一时间删除内容。

点赞(0) 收藏(0)
0条评论
珍惜第一个评论,它往往能得到较好的回响。
评论
游客
游客
登录后再评论
  • 鸟过留鸣,人过留评。
  • 和谐社区,和谐点评。
最新资讯