Anderson 视角

向全身深度伪造视频生成的永续之路

mm
将 Unite.AI 添加到您在 Google 上的首选来源
An enlargement from a test video wherein the dance movements of a stick figure inform and drive the motion of a single identity. Source - https://liveanimate.github.io/

在一个需要耐心的领域中,一个新的系统让我们更接近于实时的人类模拟,而不需要令人沮丧的渲染循环。

 

全身人类模拟的最新进展自2022年全身深度伪造的可能性首次出现以来已经有了很大的进步。到目前为止,我们已经习惯了开源系统(如Wan-Animate)和闭源系统(如Grok)将单个或多个图像转换为一致且常常具有变革性的视频表现的强大且常常具有争议的能力:

点击播放如果必要. WanAnimate-2.2的替换人例子。请参考源代码以获得更好的分辨率。 源代码

此外,较旧的基于自动编码器的实时面部深度伪造框架DeepFaceLive已经被更先进的框架如Deep-Live-Cam所取代,后者利用LivePortrait迭代的编排以及传统的GAN和InsightFace模块来创建一个有效的实时继任者:

点击播放:埃隆·马斯克在Deep-Live-Cam的实时视频会话中被深度伪造。请参考源代码以获得更好的分辨率。 源代码

然而,虽然像Deep-Live-Cam这样的框架可以无限运行和伪造,但结果仍然受到分辨率和能力的限制:您可以获得特定的面部/身份,并且它可以做很多事情,例如令人信服的面部表情和唇部同步 – 但它基本上是一个一招鲜的马戏团演员。

稍后回来…

当前的人工智能人类模拟系统大多数也是受到限制和/或“专业化”的。一个特定的、反复出现的限制是,最好的人类模拟/模仿系统是离线的 – 这意味着它们太耗资源,无法实时运行,需要离开、计算解决方案,然后稍后将结果呈现给用户。

显然,这样的系统不适合实时人工智能转换,例如转换一系列身体运动,例如舞蹈,在实时流媒体中。

最近的一个例子是开源的Wan2.2 Animate,它在爱好者社区和专业转售商中很受欢迎 – 但同样,它是一个“生成和等待”的场景:

点击播放。 2025年,Wan2.2-Animate的令人印象深刻的能力示例 – 如果您可以稍等一下。请参考源代码以获得更好的分辨率。 源代码

所以,目前您可以选择其中两个:非常好,多功能,或者马上拥有 – 选择两个。

实时动画

一种新的中国产品有效地将Wan2.2 Animate转变为一个实时驱动的动画框架,目前以近20fps的速度运行,结果令人印象深刻:

点击播放: 来自项目网站的LiveAnimate将驱动姿势跨舞蹈、户外全身和特写肖像场景,复制全身、手和面部运动. 请参考源代码以获得更好的分辨率。 源代码

新工作通过改变视频的生成方式将原始系统扩展为实时版本:不是同时处理过去和未来的帧,而是随着动作的展开,生成每个新段,而只使用几个步骤,同时保留选定的早期姿势以保持长时间会话中主体的一致外观。

实际上,该系统保留早期帧作为一种持久的内存来引用,当视频开发时,以便保持身份的一致性 – 这与旧的CGI系统引用纹理图的方式并不完全不同。

虽然LoRA参与了处理阶段,但LiveAnimate不仅仅是另一个LoRA系统 – 其流媒体生成、姿势内存/缓存系统、三步推理和GPU优化代表了额外的机制,除了其多样化的其他技术(其中一些令人惊讶地古老)之外。

新系统不仅可以应对全身驱动场景,如上面的示例,还可以应对上身运动,例如采访场景:

点击播放。 ‘微妙的头部和手部运动在静态办公室场景中’。

为了公平起见,该论文承认,在测试中,两个对比框架在某些特定情况下略微保留了身份;然而,没有一个对手是在线系统,而不是离线系统,新工作的作者显然正在以合理和乐观的方式推动界限。

此外,值得注意的是,推理需要两个H100 NVIDIA GPU,总共160GB的VRAM*。

论文指出:

‘LiveAnimate在前30秒到最后一分钟内保持几乎恒定的感知质量和身份,而之前的系统在很大程度上恶化或需要几个小时的离线计算才能达到同样的展开。 ‘

‘这些结果在质量、延迟和持续时间方面为交互式全身动画建立了一个新的运行点。’

新论文题为LiveAnimate:实时稳定长期流式人类动画,来自香港中文大学、阿里巴巴应用商业集团和Liblib AI的九位作者。项目网站也可用,代码“即将推出”,权重… 谁知道?

方法

LiveAnimate构成了一个两阶段的训练过程,旨在使Wan2.2-Animate连续和快速生成,然后是一个记忆系统,检索有用的早期姿势,因为每个新视频块被生成:

LiveAnimate管道概述,显示其两阶段训练过程和实时生成过程,其中传入的姿势与存储的早期姿势匹配并与最近的帧组合以生成每个新视频块。来源 - https://www.unite.ai/what-is-a-generative-adversarial-network-gan/

LiveAnimate管道概述,显示其两阶段训练过程和实时生成过程,其中传入的姿势与存储的早期姿势匹配并与最近的帧组合以生成每个新视频块。 来源

原始的Wan2.2-Animate旨在考虑整个序列,而不是生成无限延长的视频。因此,为了使其适应,作者将训练视频分成连续的块,每个块使用早期块作为上下文/基准来生成。这最初教会模型从可靠的早期材料继续,然后处理从其自身输出中积累的错误。

不要忘记我

在此过程中,原始参考图像通过“Ref Sink”永久可用,提供对该人的身份和外观的固定提醒。一旦块被完成,“Clean KV Update”将从中获得的信息转换为后续块的历史上下文(尽管这不会修复现有的错误)。

第一阶段训练仍然需要每块50个去噪步骤,使实时操作不切实际。因此,第二阶段将该过程浓缩为三步,同时将模型暴露在其自身生成的历史中,因为部署需要每个新段依赖于不完美的早期输出:

用于部署LiveAnimate的两个训练阶段,首先从干净的前视频块学习,然后将生成减少到三步,同时在模型的自身不完美输出上训练。

用于部署LiveAnimate的两个训练阶段,首先从干净的前视频块学习,然后将生成减少到三步,同时在模型的自身不完美输出上训练。

训练对这些自动生成的序列提出了另一个问题,因为保留整个视频的计算历史将非常昂贵。相反,进行一次完整的练习,然后一个接一个地重温每个块进行训练。每个块可以在不保持整个序列计算“活跃”的情况下接收更新:

结合LoRA适应,这使得14亿参数模型可以在一个节点上进行提取,该节点包含八个80GB的H100 GPU(注意,这个集群是用于训练,而不是运行时推理)。

不要停止现在

为了无限生成,LiveAnimate还必须决定什么是值得记住的。保留一切会使处理需求失控;但只保留最近的帧可能会丢弃有用的早期视图。

因此,姿势检索Sink注意力(PR-Sink)通过保留第一个生成的块作为一个永久的“静态Sink”来解决这个问题 – 一个相关的早期姿势,作为一个可替换的“动态Sink”,以及一个滚动窗口,包含当前块和前两个块。参考图像通过Ref Sink单独可用,而固定存储大小防止成本随着视频长度的增加而增长。

块战争

为了选择这些有限内存中的旧姿势,ViTPose将三个帧中的身体和手部位置减少到一个紧凑的表示。内存库中有五个这样的代表性姿势,并在前20个块中填充,偏爱多样化的姿势而不是近似副本。

在生成过程中,传入的姿势与这些代表性姿势进行比较,并检索出最接近的匹配项,提供了早期该人在类似位置的外观证据。然而,直接前面的块被排除,因为它已经存在于滚动窗口中,留下动态Sink自由检索来自更远处的信息。

最后,运行时通过将注意力处理分布在两个H100 GPU上,重叠通信与计算,并在可能的情况下重用缓存信息来优化速度。

数据和测试

LiveAnimate在40,000个来自AVSpeech的说话视频和20,000个来自TikTok数据集HumanVid的人体运动视频上进行了训练,支持480×480、384×672和672×384像素的分辨率。

训练从Wan2.2-Animate-14B基准开始,使用LoRA,秩为128,在八个NVIDIA H100 GPU上进行了10,000步的第一阶段训练和20,000步的第二阶段训练。

视频以三个潜在帧(模型的压缩内部表示)为块生成,相当于12个RGB帧,而推理是在两个H100上执行的。

评估将LiveAnimate与现有的基于姿势的人类动画方法进行了比较,使用参考图像和驱动姿势在一致的设置中,生成了短序列和长序列。长序列测试将生成扩展到三分钟,以检查质量和身份是否随时间保持稳定。

测试的框架包括EverAnimateOne-to-AllSCAIL††UniAnimate-DiT和Wan2.2-Animate。

使用的指标涵盖了视觉质量、身份一致性、分布质量和时间表示错误。 美观度(ASE)和无参考图像质量评估(IQA)衡量了帧级别的视觉质量;DINO、相似度(DINO-S)和外观一致性与参考身份;Fréchet Inception Distance(FID),分布质量;以及VideoMAE特征距离(V-MAE),生成的视频在时间上如何保留运动:

在三分钟连续生成中,关于质量和身份的测试结果,LiveAnimate在所有五个指标中保持相对稳定,而其他一些方法随着序列的推进而表现出更大的恶化。更高的读数对于IQA、ASE和DINO-S更好,而FID和V-MAE的读数越低越好。

在三分钟连续生成中,关于质量和身份的测试结果,LiveAnimate在所有五个指标中保持相对稳定,而其他一些方法随着序列的推进而表现出更大的恶化。更高的读数对于IQA、ASE和DINO-S更好,而FID和V-MAE的读数越低越好。

如上图所示,LiveAnimate在前30秒内实现了最高的初始ASE(2.823)和IQA(4.047)。作者声称,这表明三步骤的蒸馏保留了感知质量,尽管推理预算减少了。

更重要的是,LiveAnimate在三分钟的连续生成中显示出很少的恶化,其视觉质量和身份一致性得分几乎没有变化。

相反,One-to-All随着时间的推移而显著恶化,视觉质量和身份一致性较低,分布错误更高;而基础Wan2.2-Animate也显示出一些身份一致性的丧失。

作者指出:

‘这些趋势支持我们关于显式管理长期上下文对于流媒体动画至关重要的中心主张。’

LiveAnimate的缩放效率也在GPU上进行了测试。如下图所示,在一个H100上实现了12.41 FPS;两个H100上实现了19.63 FPS;四个H100上实现了22.13 FPS,收益越来越受到通信开销的限制。因此,选择了两个H100作为首选配置:

在一个、两个和四个H100 GPU上,480×480分辨率的缩放效率,显示延迟、帧率、加速和效率。两个GPU实现了19.63 FPS,而进一步扩展到四个GPU只产生了22.13 FPS的适度增加。

在一个、两个和四个H100 GPU上,480×480分辨率的缩放效率,显示延迟、帧率、加速和效率。两个GPU实现了19.63 FPS,而进一步扩展到四个GPU只产生了22.13 FPS的适度增加。

在19.63 FPS下,每个12帧块在0.611秒内生成。相比之下,竞争系统需要大约2-5小时来生成相同的三分钟序列。

定性测试显示出类似的差异:在下面的全身测试中,One-to-All显示出严重的恶化;UniAnimate-DiT和SCAIL产生了闪烁;Wan-Animate和EverAnimate后来显示出颜色或背景漂移:

比较三分钟内全身动画的测试结果。每20秒采样一帧,红色注释突出了竞争方法的长期恶化。基线需要大约2-5小时来生成序列,而LiveAnimate需要大约四分钟。请参考源代码以获得更好的分辨率。

比较三分钟内全身动画的测试结果。每20秒采样一帧,红色注释突出了竞争方法的长期恶化。基线需要大约2-5小时来生成序列,而LiveAnimate需要大约四分钟。请参考源代码以获得更好的分辨率。

LiveAnimate在整个三分钟序列中保持了主体的外观和周围场景。 在下面的上身测试中,EverAnimate和LiveAnimate也实现了可比的长期稳定性(尽管只有LiveAnimate提供了实时生成):

比较三分钟内上身动画的测试结果。每20秒采样一帧,显示LiveAnimate比竞争方法更好地保持了主体的身份、服装和黑色背景。

比较三分钟内上身动画的测试结果。每20秒采样一帧,显示LiveAnimate比竞争方法更好地保持了主体的身份、服装和黑色背景。

作者总结道:

‘在三分钟基准测试中,LiveAnimate在两个H100 GPU上以19.63 FPS的速度保持几乎恒定的感知质量和身份,内存和延迟独立于流媒体持续时间,而离线基线要么可见地恶化,要么需要几个小时的计算。 ‘

‘这些结果使十亿规模的视频扩散模型进入交互式应用的范围,例如实时流媒体、远程存在和虚拟化身。’

结论

看到一个驱动生成框架以新颖的方式解决困扰生成视频的记忆和身份问题是令人鼓舞的。已经有很多生成框架可以引用用户提供的固定图像,而不需要将参考图像“粘贴”到基本的图像到视频内容中。

然而,这只解决了生成单个视频片段的一些问题,例如在有人重新进入帧、暂时被遮挡,然后再次出现时保持其身份(包括服装和发型)。到目前为止,只有LoRA方法在这些问题上取得了一些进展,尽管进展有限且暂时的。

对于视频,事实上,对于当前的整个人工智能革命,开发有效的持久内存是一个至关重要的、生死攸关的问题 – 这可能是区分AGI的出现和第三次人工智能冬天的关键因素。

 

* 这是否仍然是一个“陷阱”?当前的想法是,小型专用模型最终可能会在本地运行,免租金,而更高端的需求将由竞争激烈、希望分裂的GPU租赁市场提供服务。这假设前沿公司不会EEE 竞争,并且大量GPU计算资源无论如何都可用。基于此,我不再认为过度的GPU要求是一个缺点,但希望访问变得越来越民主,并且后续的优化降低了最初的资源需求。

由人工智能生成和检查的我自己。

†† 对于长视频测试,SCAIL和UniAnimate-DiT使用相同的无需训练的滑动窗口程序进行了扩展,因为它们本身不支持长期生成。EverAnimate和One-to-All使用了自己的长视频生成方法进行评估。

 

首次发布于2026年8月13日星期四

机器学习作家,人类图像合成领域专家。曾任Metaphysic.ai研究内容负责人,直至其解散并并入DNEG的Brahma.ai。
Portfolio site:martinanderson.ai
Contact:martin@martinanderson.ai