Anderson 视角
人工智能驱动视频的显著进步

注意:该项目的页面包含33个自动播放的高分辨率视频,总大小约为半个吉字节,这导致我的系统在加载时不稳定。因此,我不会直接链接到该页面。读者可以在论文的摘要或PDF中找到URL,如果他们愿意的话。
当前视频合成研究的一个主要目标是从单个图像生成完整的AI驱动视频性能。这周,字节跳动智能创作发布了一篇新论文,概述了迄今为止最全面的这种系统,能够产生全身和半身动画,结合了富有表情的面部细节和准确的大规模运动,同时也实现了改进的身份一致性——这是一个即使领先的商业系统也经常缺乏的领域。
在下面的例子中,我们看到一个由演员(左上)驱动的性能和从单个图像(右上)派生的性能,提供了一个令人惊讶的灵活和多才多艺的渲染,没有通常的问题,关于创建大运动或“猜测”关于遮挡区域(即,必须从单个源照片推断或发明的服装和面部角度):
音频内容。点击播放。一个性能是从两个来源生成的,包括唇部同步,这通常是专用辅助系统的保留领域。这是从源站点减少的版本(见文章开始的注意 – 适用于此处的所有其他嵌入式视频)。
虽然我们可以看到一些关于身份持续性的残留挑战,因为每个片段继续,但这是我见过的第一个系统,通常(尽管并不总是)在没有使用LoRAs的情况下维持ID一段时间:
音频内容。点击播放。来自DreamActor项目的进一步示例。
新系统,称为DreamActor,使用一个三部分混合控制系统,专门关注面部表情、头部旋转和核心骨骼设计,从而实现AI驱动的性能,既不会损害面部也不会损害身体——这是一个罕见的、可能是未知的能力,类似系统中。
下面我们看到其中一个方面,头部旋转,在行动。右边每个缩略图中的彩色球表示一个虚拟的云台,独立于面部运动和表情定义头部方向,这里由演员(左下)驱动。
点击播放。这里可视化的多色球代表了头部的旋转轴,而表达是由单独的模块驱动的,并由演员的性能(如下左)提供信息。
该项目最有趣的功能之一,它甚至没有在论文的测试中得到适当的体现,是其直接从音频中推导出唇部运动的能力——这种能力即使没有驱动演员视频也能非常好地发挥作用。
研究人员已经挑战了这一领域的最佳现有系统,包括备受赞誉的Runway Act-One和LivePortrait,并报告说DreamActor能够实现更好的量化结果。
由于研究人员可以设置自己的标准,量化结果并不是一个客观标准;但随附的定性测试似乎支持作者的结论。
不幸的是,该系统不打算公开发布,社区唯一可能的价值来自于在论文中概述的方法的潜在重现(就像2022年对同样闭源的Google Dreambooth所做的那样)。
该论文指出*:
‘人像动画可能存在社会风险,例如被滥用来制作假视频。所提出的技术可以用来创建假视频,但现有的检测工具[Demamba,Dormant]可以发现这些假视频。
‘为了减少这些风险,需要明确的道德规则和负责任的使用指南。我们将严格限制对核心模型和代码的访问,以防止滥用。’
自然地,这样的道德考虑从商业角度来看是方便的,因为它为API访问模型提供了一个理由,这可以被货币化。字节跳动已经在2025年这样做过一次,将备受赞誉的OmniHuman以付费积分的形式在Dreamina网站上提供。因此,由于DreamActor可能是一个更强大的产品,这似乎是最可能的结果。仍然需要看到的是,论文中解释的原理如何能够帮助开源社区。
新论文题为DreamActor-M1:整体、富有表现力和强大的人像动画与混合引导,来自六位字节跳动研究人员。
方法
论文中提出的DreamActor系统旨在从参考图像和驱动视频生成人像动画,使用扩散变换器(DiT)框架,适用于潜在空间(显然是一种2022年标志性发布)。
与依赖外部模块来处理参考条件相比,作者直接在DiT骨架内合并外观和运动特征,允许通过注意力在空间和时间上进行交互:

新系统的模式:DreamActor将姿势、面部运动和外观编码为单独的潜在变量,结合了3D VAE生成的噪声视频潜在变量。这些信号在具有共享权重的分支上的扩散变换器中使用自注意力和交叉注意力进行融合。模型通过比较去噪输出和清洁视频潜在变量来进行监督。来源:https://arxiv.org/pdf/2504.01724
为此,模型使用预训练的3D变分自编码器来编码输入视频和参考图像。这些潜在变量被分块、连接,并输入DiT,它共同处理它们。
这种架构偏离了附加一个用于参考注入的次要网络的常见做法,这是Animate Anyone和Animate Anyone 2项目的方法。
相反,DreamActor将融合构建到主模型本身中,简化了设计,同时增强了外观和运动线索之间的信息流。然后使用流匹配训练模型,而不是标准的扩散目标(流匹配通过直接预测数据和噪声之间的速度场来训练扩散模型,跳过评分估计)。
混合运动引导
混合运动引导方法指导神经渲染,结合了从3D人体骨骼和头部球体派生的姿势令牌;从预训练的面部编码器中提取的隐式面部表示;以及从源图像中采样的参考外观令牌。
这些元素在扩散变换器中使用不同的注意力机制进行集成,允许系统在整个生成过程中协调全局运动、面部表情和视觉身份。
对于这些元素中的第一个,DreamActor使用隐式面部表示来引导表情生成,显然可以实现对面部动态的更细粒度的控制,同时将身份和头部姿势与表情分离。
为了创建这些表示,管道首先检测和裁剪驱动视频中每一帧的面部区域,调整大小为224×224。裁剪的面部被预训练的面部运动编码器处理,该编码器是在PD-FGC数据集上预训练的,然后由一个MLP层条件化。

PD-FGC,在DreamActor中使用,生成一个从参考图像中具有解耦的唇部同步(来自音频)、头部姿势、眼球运动和表情(来自单独的视频)的说话头。允许每个方面进行精确、独立的操作。来源:https://arxiv.org/pdf/2211.14506
结果是面部运动令牌的序列,这些令牌通过交叉注意力层注入到扩散变换器中。
该框架还支持一个音频驱动变体,其中一个单独的编码器被训练以直接将语音输入映射到面部运动令牌。这样可以生成同步的面部动画,包括唇部运动——无需驱动视频。
音频内容。点击播放。纯粹从音频中推导出的唇部同步,没有驱动演员视频。唯一的角色输入是上右的静态照片。
第二,为了独立于面部表情控制头部姿势,该系统引入了一个3D头部球体表示(见前面嵌入的视频),它将面部动态与全局头部运动分离,提高了动画过程中的精度和灵活性。
头部球体是通过从驱动视频中使用FaceVerse跟踪方法提取3D面部参数(如旋转和相机姿势)来生成的。

FaceVerse项目的模式。来源:https://www.liuyebin.com/faceverse/faceverse.html
这些参数用于渲染一个在2D图像平面上投影的彩色球体,空间上与驱动头部对齐。球体的大小与参考头部相匹配,其颜色反映了头部的方向。这种抽象简化了学习3D头部运动的复杂性,有助于在动画角色中保留风格化或夸张的头部形状。

控制球体影响头部方向的可视化。
最后,为了引导全身运动,该系统使用具有自适应骨骼长度归一化的3D人体骨骼。身体和手部参数使用4DHumans和手部专注的HaMeR估计,两者都在SMPL-X身体模型上运行。

SMPL-X在图像中的整个人体上应用参数网格,与估计的姿势和表情对齐,以使用网格作为体积引导来实现姿势感知操作。来源:https://arxiv.org/pdf/1904.05866
从这些输出中,选择关键关节,投影到2D,并连接成基于线的骨骼图。与渲染全身网格的方法(如Champ)不同,这种方法避免了施加预定义的形状先验,并且通过仅依赖骨骼结构,模型被鼓励直接从参考图像中推断身体形状和外观,减少了对固定身体类型的偏见,并提高了对各种姿势和体型的泛化能力。
在训练期间,3D人体骨骼与头部球体连接,并通过姿势编码器传递,输出特征,然后与噪声视频潜在变量合并以产生扩散变换器使用的噪声令牌。
在推理时,系统通过归一化骨骼长度来考虑不同主体之间的骨骼差异。预训练的SeedEdit图像编辑模型将参考图像和驱动图像转换为标准规范配置。然后使用RTMPose提取骨骼比例,这些比例用于调整驱动骨骼以匹配参考主体的解剖结构。

推理管道概述。可以生成伪参考来丰富外观线索,而混合控制信号——隐式面部运动和来自头部球体和身体骨骼的显式姿势——从驱动视频中提取。然后将这些信号输入DiT模型以产生动画输出,面部运动与身体姿势分离,允许使用音频作为驱动。
外观引导
为了增强外观保真度,特别是在遮挡或很少可见的区域,该系统通过从输入视频中采样的伪参考来补充主要参考图像。
点击播放。该系统预测需要准确和一致地渲染遮挡区域。这种方法与CGI风格的位图纹理方法非常接近,我在这个项目中见过的最接近的方法。
这些额外的帧是使用RTMPose根据姿势多样性选择的,并使用基于CLIP的相似性进行过滤,以确保它们与主体的身份保持一致。
所有参考帧(主要和伪)都由相同的视觉编码器编码,并通过自注意力机制融合,允许模型访问互补的外观线索。这种设置可以改善对细节的覆盖,例如侧面视图或肢体纹理。伪参考始终在训练期间使用,并且可以在推理期间使用。
训练
DreamActor在三个阶段进行训练,以逐渐引入复杂性并提高稳定性。
在第一个阶段,只使用3D人体骨骼和3D头部球体作为控制信号,排除了面部表示。这样可以让从MMDiT初始化的基础视频生成模型适应人体动画,而不会被细粒度的控制所淹没。
在第二阶段,添加了隐式面部表示,但其他所有参数都冻结。仅在此时训练面部运动编码器和面部注意力层,使模型能够在隔离中学习表达细节。
在最后阶段,所有参数都解冻,以便在外观、姿势和面部动态上进行联合优化。
数据和测试
在测试阶段,模型从预训练的图像到视频DiT检查点初始化,并在三个阶段进行训练:每个阶段20,000步,最后一个阶段30,000步。
为了提高不同持续时间和分辨率下的泛化能力,视频片段的长度在25到121帧之间随机采样。然后将它们调整到960x640px,同时保持宽高比。
训练是在八个(中国专用)NVIDIA H20 GPU上进行的,每个GPU具有96GB的VRAM,使用AdamW优化器,学习率为5e−6(可以忍受的高)。
在推理时,每个视频段包含73帧。为了保持跨段的一致性,一个段的最终潜在变量被重用为下一个段的初始潜在变量,这将任务上下文化为顺序图像到视频生成。
无分类器引导被应用,权重为2.5,适用于参考图像和运动控制信号。
作者构建了一个训练数据集(论文中没有提到来源),包含来自多个领域的500小时视频,包括舞蹈、体育、电影和公共演讲。数据集旨在捕捉广泛的人体运动和表情,包括全身和半身镜头的均匀分布。
为了提高面部合成质量,Nersemble被纳入数据准备过程中。

Nersemble数据集的示例,用于增强DreamActor的数据。来源:https://www.youtube.com/watch?v=a-OAWqBzldU
为了评估,研究人员使用他们的数据集作为基准来评估在各种场景下的泛化能力。
模型的性能使用来自先前工作的标准指标来衡量:Fréchet Inception Distance(FID);结构相似性指数(SSIM);学习的感知图像补丁相似性(LPIPS);以及峰值信噪比(PSNR)用于帧级质量。用于评估时间一致性和整体视频保真度的Fréchet视频距离(FVD)。
作者在使用单个(目标)参考图像的身体动画和肖像动画任务上进行了实验。
对于身体动画,DreamActor-M1被比较了与Animate Anyone;Champ;MimicMotion;和DisPose。

与对手框架的量化比较。
虽然PDF提供了静态图像作为视觉比较,但项目网站上的一个视频可能更清楚地突出了差异:
音频内容。 点击播放。一个视觉比较,横跨挑战者框架。驱动视频位于左上角,作者得出DreamActor产生最佳结果的结论似乎是合理的。
对于肖像动画测试,模型被评估与LivePortrait;X-Portrait;SkyReels-A1;和Act-One。

肖像动画的量化比较。
作者指出,他们的方法在量化测试中胜出,并声称它也在定性上更好。
音频内容。点击播放。肖像动画比较的示例。
可以说,上面视频中显示的第三个也是最后一个片段,展现了一个不太令人信服的唇部同步,相比之下,有几个对手框架表现得更好,尽管总体质量非常高。
结论
预测由单个目标图像驱动的这些重建中所需的纹理,但实际上并不存在,字节跳动解决了面向扩散的视频生成面临的最大挑战之一——一致的、持续的纹理。这种方法的下一个合乎逻辑的步骤将是在初始生成的剪辑中创建一个参考图谱,然后应用于后续的不同生成,以保持外观而无需LoRAs。
虽然这种方法将仍然是外部参考,但这与传统的CGI技术中的纹理映射并无不同,而且这种方法的真实性和可信度远远高于旧方法可以获得的。
说到这,DreamActor最令人印象深刻的方面是其组合的三部分引导系统,以巧妙的方式弥合了传统的人体合成面向面部和面向身体的分歧。
只剩下一个问题,即这些核心原理是否可以在更易用的产品中发挥作用;就目前而言,DreamActor似乎注定要成为又一个合成即服务的产品,严重受到使用限制的约束,并且由于商业架构的不可行性,无法进行广泛的实验。
* 我为作者添加的超链接;内联引用
† 如前所述,尚不清楚该项目中使用了哪种Stable Diffusion风味。
首次发布于2025年4月4日星期五












