Anderson 视角

看不见,不要忘记:解决AI视频生成的最大问题

mm
将 Unite.AI 添加到您在 Google 上的首选来源
Detail from the first page of the 2026年3月 paper 'Out of Sight but Not Out of Mind: Hybrid Memory for Dynamic Video World Models'. Source - https://arxiv.org/pdf/2603.25716

即使是最好的AI视频生成系统,也存在一个严重的问题——它们都有慢性健忘症,这是一个来自中国的新研究正在解决这个问题。

 

即使是最好的和最先进的AI视频生成系统,也存在一个严重的问题——它们都有慢性健忘症:如果摄像机从焦点上移开,然后再移回去,它将永远找不到最初的东西——角色将消失,外貌和/或运动方式将改变,背景也可能会改变。

这是因为基于扩散的生成系统具有有限的滚动注意力窗口,并且它总是处理当前的内容;在真正的唯我论中,视野外的东西对于生成式AI来说是不存在的——它从内存中被删除。

这在传统的CGI中从来不是一个问题,因为它可以随时参考和准确地重现一个主题,包括外貌和运动;

传统的CGI网格和位图纹理可以随时被绘制到渲染中,提供一致的外貌——这是AI方法很难实现的,因为没有等效的'平面参考'文件或相关文件集。

传统的CGI网格和位图纹理可以随时被绘制到渲染中,提供一致的外貌——这是AI方法很难实现的,因为没有等效的’平面参考’文件或相关文件集。

这是因为CGI的组成元素,例如网格和纹理(见上图),以及运动文件和其他动态行为,可以独立地存储在磁盘上,并可以随时被绘制到一个组合中。

在生成式视频AI中,没有这样的’平面仓库’;它能接近这种功能的是LoRAs——专门训练的辅助文件,可以在消费设备上训练,允许新角色和特定的服装被’强制’到视频中;

点击播放。 AI视频的唯我论问题可以通过使用LoRAs来一定程度上缓解——但结果可能会令人不知所措。

这并不是一个理想的解决方案。首先,LoRAs与特定的基础模型版本(例如Wan2+或Hunyuan Video)绑定,并且需要在每次基础模型更改时重新创建。此外,LoRAs倾向于扭曲基础模型的权重,因此LoRA的训练身份被强加于场景中的所有角色。此外,这种精细调优方法非常敏感,容易受到数据质量的影响。

准确的重现

现在,来自中国的一个新的学术/产业合作正在提供一个在我过去三年报告中尚未注意到的重大解决方案。该方法使用所谓的混合记忆来保持角色和环境在视野外时保持活跃和准确,因此当视点返回时,效果是一致的;

点击播放。来自项目网站的两个AI生成(WAN)角色退出和准确重新进入帧的示例。 来源

这并不是实现角色在不同镜头之间的一致性的同一件事,这是Runway Gen4和其他封闭源平台声称已经解决的问题;相反,它做了他们尚未成功的事情——在不需要角色始终可见的情况下保持角色和环境在内存中。

新工作包括通过Unreal Engine生成的专用数据集,以及针对混合记忆的自定义度量标准,以及在WAN之上构建的生成框架。在与现有系统的测试中,作者声称取得了最先进的结果,并评论说:

‘记忆机制已经成为推进世界模型的关键前沿,因为记忆容量决定了生成内容的空间和时间一致性。 ‘

‘特别是,它是认知锚点,允许模型在视点转换或长期推断期间保留历史背景。 ‘

‘没有强大的记忆,模拟的世界很快就会分解成不连贯、混乱的帧。’

该论文题为《看不见,不要忘记:用于动态视频世界模型的混合记忆》,由来自华中科技大学和Kuaishou Technology的Kling团队的七位研究人员共同撰写。

方法

新工作的核心是混合记忆,它实现了“视野外推断”——即保持角色和环境在视野外时保持活跃。该框架需要执行空间时间解耦,即同时关注可见的生成和视野外的角色存在。

摄像机运动的进入/退出示例。在这些实例中,是摄像机的运动导致角色退出帧,但在各种样本中,我们也可以观察到角色自己暂时将自己推出屏幕。来源 - https://arxiv.org/pdf/2603.25716

摄像机运动的进入/退出示例。在这些实例中,是摄像机的运动导致角色退出帧,但在各种样本中,我们也可以观察到角色自己暂时将自己推出屏幕。 来源

作者指出,在扩散潜在嵌入中,需要提取和使用的特征与其他特征和属性密切相关;尝试提取它们通常会导致主题“冻结”到背景中。因此,他们设计并策划了一个名为HM-World的数据集,专门用于训练混合记忆;

来自论文的HM-World数据集的四个类别样本。

来自论文的HM-World数据集的四个类别样本。

该集合沿四个维度构建:主题轨迹、摄像机轨迹、场景和主题。HM-World的合成数据包含17个场景和49个主题,包括外貌多样的角色和多种动物。这些主题通过Unreal Engine以不同的运动动画和随机选择的轨迹组合到一个场景中;

作者指出,数据集中描绘了多种退出和进入事件,包含28个不同的摄像机轨迹,每个轨迹有多个起点。最终的集合包含59,225个视频片段,每个片段由MiniCPM-V多模态大型语言模型(MLLM)进行注释。

研究人员指出,他们的集合在统计学上优于之前的数据集,如WorldScore、Context-As-Memory、Multi-Cam Video和360° Motion;

现有数据集与HM-World数据集的比较,其中'Dynamic Subject'表示移动实体的存在,'Subject Exit-Enter'表示包含角色离开和重新进入帧的片段,'Subject Pose'表示包含注释的3D姿势。

现有数据集与HM-World数据集的比较,其中’Dynamic Subject’表示移动实体的存在,’Subject Exit-Enter’表示包含角色离开和重新进入帧的片段,’Subject Pose’表示包含注释的3D姿势。

少有人走的路

假设有多个过去的帧和已知的摄像机路径,任务是预测未来视图,因为观众的视角发生变化,同时考虑到独立移动的主题可能会离开帧然后返回。这需要比保持稳定的背景更高的要求,因为模型必须保留一个关于移动主题的外貌和行为的连贯的内部记录,即使在它们不可见的期间;

作者的Hybrid Dynamic Retrieval Attention(HyDRA)方法通过引入一个专用的内存路径来解决这个问题,该路径将动态主题与静态场景表示分离,使它们能够随时间推移并在返回时保持一致的外貌和运动;

HyDRA模型的概念图。

HyDRA模型的概念图。

HyDRA是在Wan2.1-T2V-1.3B的基础上构建的,核心的扩散管道基本保持不变,同时引入了一个修改的Transformer块,该块包含动态检索注意力。这使得模型能够选择性地从过去的帧中回忆运动和外貌线索,而不是依赖于固定的或局部的上下文;

这个过程使用了一个改进的Flow Matching训练目标来代替标准的扩散损失;

为了保持场景与摄像机运动一致,摄像机轨迹被注入为一个显式的条件信号,每个帧的姿势由旋转和平移定义,然后转换为一个紧凑的表示,捕捉视点如何随时间变化;

与之前的(Kling)ReCamMaster计划一致,结果是通过摄像机编码器解析,实现为多层感知器,然后广播并添加到扩散Transformer特征中,使模型能够在摄像机移动时保持一致的物体放置。

标记化

原始扩散潜在变量混合了主题运动、外貌和背景到一个单一的相关表示中,尝试从这个空间中检索直接可能会引入不相关的上下文,或者导致移动主题“融入”到背景中;

HyDRA通过一个基于3D卷积的内存标记器来解决这个问题,该标记器同时处理空间和时间——而不是转发完整的潜在历史,它将它们压缩成紧凑、运动感知的内存标记,这些标记保留了主题的外貌和运动;

HyDRA的概述。左边,内存标记器将过去的帧转换为紧凑、运动感知的内存标记;右边,动态检索注意力评估当前查询与这些标记,检索最相关的标记,并使用它们来恢复生成帧中的一致外貌和运动。

HyDRA的概述。左边,内存标记器将过去的帧转换为紧凑、运动感知的内存标记;右边,动态检索注意力评估当前查询与这些标记,检索最相关的标记,并使用它们来恢复生成帧中的一致外貌和运动。

这些标记形成了一个结构化的混合记忆,过滤掉噪音同时保留了长距离的动态。传递给动态检索注意力模块,这些标记使得模型能够选择性地回忆视野外的主题,因此它们以一致的外貌、运动和上下文重新出现。

动态检索注意力

HyDRA的双重内存机制还使用动态检索注意力在框架中发挥着不同的但互补的作用;

内存标记化压缩了过去的潜在表示为结构化、运动感知的标记,这些标记将动态主题与静态场景内容分离,减少了通常导致主题“融入”背景的相关性。这些标记形成了一个持久的内存库,而不是一个完整的帧历史;

动态检索注意力然后在生成过程中操作这个库,评估当前查询与存储的标记,并选择性地回忆与正在演化的帧最相关的标记。这使得视野外的主题能够继续它们的潜在演化(即,当你看不到它们时,它们继续走、跑),并在返回视野时以一致的外貌和运动重新出现,而不是重置或退化。

数据和测试

在测试中,基于Wan的HyDRA系统对77个上下文帧进行了编码和下采样,然后使用3D变分自编码器(VAE)进行解析,而内存标记器使用3D卷积,核大小为2x4x4;

模型在HW-World上训练了10,000次迭代,使用32个(未指定)GPU,批量大小为32;

测试中使用了异常多的指标:除了常见的峰值信噪比(PSNR)、结构相似性指数(SSIM)和学习到的感知相似性度量(LPIPS)外,作者还使用了VBench套件中的主题一致性和背景一致性来评估帧级别的一致性;

此外,他们设计了一个名为动态主题一致性(DSC)的自定义指标,该指标使用YOLO V11的边界框来创建移动主题的裁剪区域,从中提取语义特征,然后计算它们的相似性;

HyDRA被与扩散强制Transformer(DFoT)和上下文作为记忆(Context-As-Memory)进行比较,所有模型都在HW-World上训练,并使用WorldPlay作为二级测试集合;

在初步的定量比较中,HyDRA在所有基准测试中都取得了最好的结果,将PSNR从18.696提高到20.357,将SSIM从0.517提高到0.606;

与之前方法的初步定量比较结果。

与之前方法的初步定量比较结果。

DFoT达到17.693的PSNR,Context-As-Memory达到18.921,增益归因于内存标记化与动态检索注意力的组合;

将HyDRA与当前最先进的方法进行的定量比较。

将HyDRA与当前最先进的方法进行的定量比较。

关于对WorldPlay的测试,作者指出:

‘我们的方法在所有指标上都优于WorldPlay,PSNR差距显著,达到5.502。虽然WorldPlay在基于真实参考的指标(例如PSNR为14.855,DSCGT为0.832)上表现较低,这是由于域分布差异和缺乏特定的微调,但它在上下文参考指标上表现出令人印象深刻的鲁棒性,DSCctx达到0.822。’

‘这一观察不仅证实了大量训练的模型具有公平的混合一致性,也间接验证了我们提出的DSC指标的合理性,反映了动态主题的一致性。 ‘

‘最终,这些令人印象深刻的结果凸显了我们模型的卓越能力,甚至优于已建立的商业模型。’

该论文提供了对所进行的定性比较的静态表示:

在摄像机运动下的退出和重新进入的定性比较。作者断言HyDRA在角色离开和返回帧时保持了角色身份、姿势和运动连续性,紧密匹配了真实参考,而竞争方法则表现出漂移、不连贯的运动或角色退化,在红色中突出显示(一致的恢复用绿色标记)。

在摄像机运动下的退出和重新进入的定性比较。作者断言HyDRA在角色离开和返回帧时保持了角色身份、姿势和运动连续性,紧密匹配了真实参考,而竞争方法则表现出漂移、不连贯的运动或角色退化,在红色中突出显示(一致的恢复用绿色标记)。

关于这些结果,作者评论说:

‘在复杂的退出和进入事件中,基线和上下文作为记忆表现出严重的主题失真和运动不连贯。DFoT无法保持主题的完整性,导致主题完全消失。虽然WorldPlay能够保持主题外貌的一致性,但它遭受了运动的卡顿和不自然的动作。 ‘

‘相比之下,我们的方法成功地保持了混合一致性,保持了主题的身份和运动连贯性,当主题重新进入帧时。’

更多结果可以在补充网站中看到,其中前四个示例已被我们汇总到下面的视频中:

点击播放。 项目网站上六个测试结果中的前四个。 来源

结论

虽然任何尝试解决AI视频生成的最大缺陷都是受欢迎的,但我认为解决这种退出/重新进入问题的最佳解决方案将与CGI一样,是以离散的参考材料的形式出现,这些材料可以被离散地编辑并带入一个组合空间。

试图以一种临时和即兴的方式保持嵌入式内容的活力似乎是一项艰巨的任务,也没有明确的前进方向,尤其是考虑到Runway和其他黑盒平台已经提供的镜头间的一致性;

如果后续镜头需要访问前一镜头的潜在空间,为什么不让两个实例都放置一个离散和独立的角色嵌入呢?

 

* 没有人给它命名,讨论也很困难,没有共同的术语。

** 目前报告为“即将推出”,在项目页面上。

首次发布于2026年3月27日

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai