Anderson 视角
人元视频深度伪造技术的崛起

由于本文讨论的部分内容性质特殊,本文将包含较少的参考链接和插图。
目前,人工智能合成社区正在发生一些值得注意的事情,尽管其意义可能需要一段时间才能变得明显。爱好者们正在训练生成式人工智能视频模型,以使用基于视频的LoRAs在腾讯最近发布的开源人元视频框架上复制人的外貌。
点击播放。 来自Civit社区的多样化结果,基于人元的LoRA定制。通过训练低秩适应模型(LoRAs),可以显著减少人工智能视频生成中长期存在的时间一致性问题。 来源:civit.ai
在上面的视频中,女演员娜塔莉·波特曼、克里斯蒂娜·亨德里克斯和斯嘉丽·约翰逊,以及科技领袖埃隆·马斯克的外貌被训练成相对较小的添加文件,用于人元生成视频系统,可以在用户的计算机上安装无内容过滤(例如NSFW过滤)。
上述克里斯蒂娜·亨德里克斯LoRA的创作者表示,只需要来自《广告狂人》电视剧的16张图像即可开发该模型(该模型仅为307mb下载);Reddit和Discord上的多个帖子确认,这类LoRAs通常不需要大量训练数据或长时间的训练。
点击播放。 阿诺德·施瓦辛格被带入一个人元视频LoRA,可以在Civit下载。请参阅https://www.youtube.com/watch?v=1D7B9g9rY68以获取更多阿诺例子,由人工智能爱好者鲍勃·道尔提供。
人元LoRAs可以在静态图像或视频上进行训练,尽管在视频上进行训练需要更强大的硬件资源和更长的训练时间。
人元视频模型具有13亿个参数,超过了索拉的12亿个参数,并远远超过了2024年夏季发布的开源人元-DiT模型,该模型仅有1.5亿个参数。
就像2017年末深度伪造技术出现时一样,人元LoRA的意义可能不容易被人理解,尤其对于那些随意关注生成式人工智能的人来说。让我们回顾一下人元LoRAs和之前的身份基于人工智能视频生成方法之间的一些关键差异。
有什么新鲜事?
由于“深度伪造”一词的演变性质,以及公众对生成式人工智能视频合成框架局限性的有限理解,人元LoRA的意义可能不容易被理解。让我们回顾一下人元LoRAs和之前的身份基于人工智能视频生成方法之间的一些关键差异。
1:无限制的本地安装
人元视频最重要的方面是,它可以下载并安装在本地,而且它将一个非常强大和无审查的人工智能视频生成系统交给了普通用户和视觉特效社区(在许可证允许的范围内)。
上一次这种情况发生是在2022年夏天,Stable Diffusion模型发布时。那个时候,OpenAI的DALL-E2已经吸引了公众的想象力,尽管DALLE-2是一个带有显著限制的付费服务,这些限制随着时间的推移而增加。
当Stable Diffusion变得可用时,低秩适应使得可以生成任何人(无论是名人还是非名人)的图像,这有助于Stable Diffusion在受欢迎程度上超过DALLE-2,尽管后者是一个更强大的系统,但其审查例程被许多用户视为繁琐,而且无法自定义。
可以说,同样的情况现在也适用于索拉和人元——或者更准确地说,适用于索拉级别的专有生成式视频系统和开源对手,其中人元是第一个——但可能不是最后一个(这里可以考虑Flux最终将在Stable Diffusion上获得显著进展)。
2:无需“主机”视频和高强度努力
当深度伪造技术在2017年末出现时,匿名发布的代码将演变成主流分支DeepFaceLab和FaceSwap(以及DeepFaceLive实时深度伪造系统)。
这种方法需要对每个身份的成千上万张面部图像进行精心策划;在此阶段投入的努力越少,模型的效果就会越差。另外,训练时间根据可用的硬件不同而有所不同,长期会给即使是强大的系统带来压力。
当模型终于准备好时,它只能将面部置入现有视频中,通常需要一个“目标”(即真实)身份,其外貌与被叠加的身份相似。
最近,ROOP、LivePortrait和许多类似的框架提供了类似的功能,需要的努力较少,结果往往更好——但它们无法生成准确的全身深度伪造,或除面部以外的任何其他元素。
3:大大提高的时间一致性
时间一致性已经成为多年来的圣杯。使用LoRA和适当的提示,可以为人元视频生成提供一个恒定的身份参考。理论上(这些都是早期),可以训练多个特定身份的LoRAs,每个LoRA都穿着特定的服装。
在这种情况下,服装不太可能在视频生成过程中“突变”(因为生成系统基于有限的前几帧来生成下一帧)。
4:进入“人类实验”
正如我最近观察到的,专有和FAANG级别的生成式人工智能领域现在似乎如此害怕其项目的人类合成能力的潜在批评,以至于实际的人很少出现在主要公告和发布的项目页面中。相反,相关的宣传材料越来越多地显示“可爱”和其他“无害”的主题在合成结果中。
有了人元LoRAs,社区第一次有机会在一个非常强大的(而不是边缘的)系统中推动基于LDM的人类视频合成的边界,并全面探索我们大多数人最感兴趣的主题——人。
影响
由于在Civit社区中搜索“人元”主要显示名人LoRAs和“硬核”LoRAs,人元LoRAs的出现最主要的影响是,它们将被用来创建人工智能色情(或其他诽谤性的)视频,内容为真实人物——无论是名人还是普通人。
为了符合规定,创建人元LoRAs并在各种Discord服务器上实验的爱好者们会小心地禁止在服务器上发布真实人物的例子。然而,即使是基于图像的深度伪造技术已经被严重滥用;添加真正逼真的视频可能最终会证明媒体在过去七年中反复提出的恐惧是合理的,并且已经引发了新的法规。
驱动力
如往常一样,色情仍然是技术进步的驱动力。无论我们如何看待这种使用方式,这种不懈的动力都推动了最先进技术的进步,这些进步最终可以惠及更主流的采用。
在这种情况下,代价可能会更高,因为超现实视频创作的开源化对犯罪、政治和道德滥用有明显的影响。
一个专门用于人工智能生成NSFW视频内容的Reddit群组(我不会在这里提及)拥有一个相关的开放Discord服务器,用户在那里改进ComfyUI工作流,以用于人元视频色情生成。每天,用户都会发布NSFW片段的例子,其中许多可以合理地被称为“极端”,或至少可以说是“紧张”的,限制在论坛规则中。
VFX
人元视频LoRAs提供的时间一致性的大幅提高,对于非常依赖开源软件的AI视觉特效行业来说是一个显而易见的福音。
虽然人元视频LoRA方法会生成整个帧和环境,但视觉特效公司几乎可以肯定已经开始尝试使用这种方法获得时间一致的面部,以便将面部叠加或集成到真实世界的源视频中。
像爱好者社区一样,视觉特效公司必须等待人元视频的图像到视频和视频到视频功能,这可能是最有用的桥梁,连接LoRA驱动的、基于身份的“深度伪造”内容;或者即兴发挥,利用间隔时间来探索框架和潜在适应性的外部能力,甚至是视觉特效公司内部的专有分支。
结论
由于深度伪造视频已经存在很长时间了,很容易低估人元视频LoRA作为身份合成和深度伪造方法的重要性;并且假设目前在Civit社区、相关Discord服务器和子版块中表现出来的努力只是朝着真正可控的人类视频合成迈出的一小步。
更有可能的是,当前的努力仅代表了人元视频创造完全令人信服的全身和全环境深度伪造的潜力的一小部分;一旦图像到视频组件发布(据传将在本月发布),一种更细致的生成能力将变得可用,供爱好者和专业人士使用。
当Stability.ai在2022年发布Stable Diffusion时,许多观察者无法确定为什么该公司会放弃当时如此有价值和强大的生成系统。对于人元视频,利润动机直接建立在许可证中——尽管腾讯可能会发现很难确定何时触发利润分享计划。
无论如何,结果都是一样的,就像2022年一样:在发布后,专门的开发社区立即形成,并以极大的热情投入其中。这些努力将在接下来的12个月内走过的道路中,肯定会引发新的头条新闻。
随着人元视频LoRAs的出现,社区第一次有机会在一个非常强大的(而不是边缘的)系统中推动基于LDM的人类视频合成的边界,并全面探索我们大多数人最感兴趣的主题——人。












