Anderson 视角
AI视频完善猫自拍

AI视频生成器通常会给出接近但不完全符合预期的结果,尤其是在处理文本提示时。但是一种新的高级修复方法可以带来显著的改善。
生成式视频系统通常难以制作出真正富有创意或奇幻的视频,且常常无法满足用户的文本提示的期望。
其中一个原因是纠缠,即视觉/语言模型必须在训练数据的长度上做出妥协。训练时间太短,概念就不够完整;训练时间太长,概念就不够灵活,无法整合到新的组合中。
您可以从下面的视频中了解这一点。在左边是许多AI系统在面对要求很高的提示时会产生的妥协结果(提示在视频的顶部),要求一些元素的组合太过奇幻,无法成为真实的训练示例。在右边是AI输出,更好地符合了提示:
点击播放(无音频)。在右边,我们看到“分解”的WAN 2.2真正实现了提示,而“香草”WAN 2.2在左边的解释则很模糊。请参考源视频文件以获取更好的分辨率和更多示例,尽管这些策划版本在项目网站上不存在,并且是为本文编制的。源
尽管我们必须原谅拍手的鸭子的人类手(!),但很明显,右边的示例比左边的示例更好地符合原始文本提示。
有趣的是,两个特征的架构基本上是相同的,即流行且功能强大的Wan 2.2,这是一个在今年的开源和爱好者社区中获得了显著关注的中国版本。
区别在于第二个生成管道是分解的,这意味着一个大型语言模型(LLM)被用来重新解释视频的第一帧(种子帧),以便系统更容易地生成用户想要的内容。
这种“视觉锚定”涉及将从LLM增强的提示中制作的图像注入生成管道中作为“起始帧”,并使用LoRA解释模型来帮助将“入侵者”帧整合到视频创建过程中。
结果在提示忠实度方面相当显著,尤其是对于一个看起来很优雅的解决方案:
点击播放(无音频)。进一步展示“分解”视频生成真正按照剧本进行的示例。请参考源视频文件以获取更好的分辨率和更多示例,尽管这些策划版本在项目网站上不存在,并且是为本文编制的。
该解决方案以新论文的形式出现,题为《分解视频生成:在文本到视频扩散模型中分离场景构建和时间合成》及其附带的项目网站。
虽然许多当前系统尝试通过使用语言模型重写模糊或不明确的文本来提高提示准确性,但这项新工作认为这种策略仍然会导致模型的内部场景表示有缺陷时失败。
即使有详细的重写提示,文本到视频模型也经常错误地组合关键元素或生成不兼容的初始状态,从而破坏动画的逻辑。只要第一帧无法反映提示的内容,生成的视频就无法恢复,无论运动模型有多好。
论文指出*:
‘[文本到视频]模型经常生成分布偏移的帧,但仍然可以达到与I2V模型相当的[评估分数],这表明它们的运动建模在场景保真度较差的情况下仍然相当自然。 ‘
‘[图像到视频]模型表现出相反的行为,具有准确的初始场景和较弱的时间连贯性,而I2V+文本平衡了这两个方面。 ‘
‘这种对比表明当前T2V模型存在结构性缺陷:场景接地和时间合成可以从不同的归纳偏差中受益,但现有的架构试图在单个模型中同时学习这两者。 ‘
对生成模式的诊断比较发现,没有显式场景锚定的模型在运动方面得分很高,但经常在场景布局方面妥协,而图像条件方法则表现出相反的模式:

在两个数据集上比较视频生成模式,显示I2V+文本在帧质量(FID)和时间连贯性(FVD)方面实现了最好的性能,突出了分离场景构建和运动的好处。 来源
这些发现表明,当前模型试图同时学习场景布局和动画,尽管这两个任务需要不同的归纳偏差,并且可以分开处理。
也许最有趣的是,这个“技巧”可以应用于Wan 2.1和2.2等模型的本地安装,以及Hunyuan Video等类似的视频扩散模型。根据传闻,比较业余爱好者输出和商业生成门户(如Kling和Runway)后,发现大多数主要的API提供商正在使用LoRAs改进开源产品,如WAN,并且似乎也使用了这种新论文中看到的“技巧”。因此,这种方法可能代表了开源社区的赶上机会。
对该方法进行的测试表明,这种简单且模块化的方法在T2V-CompBench基准测试中提供了新的最先进的性能,并且显著改进了所有测试模型。作者在结论中指出,虽然他们的系统在保真度方面有了显著的改进,但它并没有解决(也没有被设计来解决)身份漂移,这是当前生成式AI研究的主要挑战。
这篇新论文来自瑞士洛桑联邦理工学院(EPFL)的四位研究人员。
方法和数据
新技术的核心主张是,文本到视频(T2V)扩散模型需要“锚定”到符合所需文本提示的起始帧。
为了确保模型尊重起始帧,新方法通过在扩散过程的时间步0处注入来自锚定图像的干净潜在变量,取代了通常的噪声输入。这种陌生的输入最初会让模型感到困惑,但经过最小的LoRA微调,它会学会将注入的帧视为固定视觉锚点,而不是噪声轨迹的一部分:

使用轻量级LoRA对模型进行微调的两阶段方法,以将注入的干净潜在变量视为固定场景约束。右边,提示被分成第一帧的字幕,该字幕用于生成引导视频的锚定图像。
在推理时,方法重写提示以仅描述第一帧,使用LLM提取一个合理的初始场景状态,专注于布局和外观。
重写的提示被传递给图像生成器以生成候选锚定帧(可以选择由用户改进)。选定的帧被编码为潜在变量并注入到扩散过程中,取代了第一时间步,允许模型在锚定到初始场景的同时生成视频的其余部分——这是一个不需要更改底层架构就可以工作的过程。
该过程通过为Wan2.2-14B、Wan2.1-1B和CogVideo1.5-5B创建LoRAs进行了测试。LoRA训练在UltraVideo集合中随机采样的5000个剪辑上进行,采用256的秩,并持续6000步,需要Wan-1B和CogVideo-5B 48个GPU小时,Wan-14B需要96个GPU小时。作者指出,Wan-5B本地支持文本和图像条件(在这种情况下被强加于较旧的框架),因此不需要任何微调。
测试
在为该过程运行的实验中,每个文本提示最初使用Qwen2.5-7B-Instruct进行了改进,该模型使用结果生成了一个包含整个场景描述的详细“种子图像”字幕。然后将其传递给QwenImage,该模型的任务是生成要插入到扩散过程中的“魔术帧”。
用于评估系统的基准包括上述T2V-CompBench,用于测试模型在场景中保留对象、属性和操作方面的组合理解能力;以及VBench 2.0,用于评估更广泛的推理和一致性,共有18个指标,分为创造力、常识推理、可控性、人类保真度和物理:

在T2V-CompBench的所有七个评估类别中,分解的T2V方法在每个测试模型中都优于标准和上采样T2V基准,最高增益达到53.25%。最高评分的变体通常与专有的PixVerse-V3基准相匹配或超过。
关于这轮测试,作者指出*:
‘在所有模型中,添加锚定图像一致地提高了组合性能。所有较小的分解模型(CogVideo 5B、Wan 5B和Wan 1B)都优于更大的Wan 14B T2V模型。 ‘
‘我们的分解Wan 5B也优于商业PixVerse-V3基准,这是基准测试中报告的最佳模型。这表明视觉接地显著增强了场景和操作理解,甚至在较小容量的模型中也是如此。 ‘
‘在每个模型家族中,分解版本都优于原始模型。值得注意的是,我们在WAN 14B上使用轻量级锚定LoRA实现的性能与其预训练的I2V 14B变体(0.661 vs. 0.666)相当,尽管它不需要进行完整的重新训练。’
接着是VBench2.0轮:

分解的T2V方法在VBench 2.0的组合、常识推理、可控性和物理方面的一致性上取得了显著的改进,某些增益超过60%——尽管人类保真度仍然低于专有的Veo 3基准。
在所有架构中,分解方法都提高了VBench的每个类别的评分,除了人类保真度,它稍微下降了,即使在提示上采样后也是如此。WAN 5B优于更大的WAN 14B,强化了早期的T2V-CompBench结果,即视觉接地比规模更重要。
虽然VBench的增益是一致的,但它们比在T2V-CompBench上看到的增益要小,作者将其归因于VBench的更严格的二元评分制度。
对于定性测试,论文提供了静态图像,但我们建议读者参考本文中嵌入的合成视频,以更好地了解,需要注意的是源视频更丰富、更具多样性,并且具有更高的分辨率和细节。可以在这里找到它们。关于定性结果,论文指出:
‘锚定视频一致地表现出更准确的场景组合、更强的对象-属性绑定和更清晰的时间进展。’
分解方法即使在将扩散步骤从50减少到15时也保持稳定,几乎没有在T2V-CompBench上的性能损失。相比之下,文本和上采样基准在相同条件下急剧恶化。
虽然减少步骤理论上可以将速度提高三倍,但由于锚定图像生成的固定成本,完整的生成管道在实践中仅变得2.1倍更快。然而,结果表明,锚定不仅提高了样本质量,还有助于稳定扩散过程,支持更快、更高效的生成而不会损失准确性。
项目网站提供了上采样与新方法生成的示例,我们在这里提供了一些(较低分辨率)编辑示例:
点击播放(无音频)。上采样起始源与作者的分解方法。
作者总结道:
‘我们的结果表明,改进的接地,而不是仅仅增加容量,可能同样重要。最近在T2V扩散方面的进展严重依赖于增加模型大小和训练数据,但即使是大型模型也经常难以仅从文本中推断出一个连贯的初始场景。 ‘
‘这与图像扩散形成对比,在图像扩散中,扩大规模相对简单;在视频模型中,每个架构改进都必须在额外的时间维度上运行,使扩大规模变得更加耗费资源。 ‘
‘我们的发现表明,改进的接地可以通过解决不同的瓶颈来补充规模:在运动合成开始之前建立正确的场景。 ‘
‘通过将视频生成分解为场景组合和时间建模,我们缓解了几个常见的故障模式,而无需更大的模型。我们认为这是一个可以指导未来架构走向更可靠和结构化视频合成的补充设计原则。’
结论
尽管纠缠问题是非常真实的,可能需要专门的解决方案(例如改进的策划和分发评估),但观看分解“解开”几个顽固和“卡住”的概念提示序列以生成更准确的渲染,仅需中等程度的LoRA条件和显著改进的起始/种子图像,这是一个令人开眼界的过程。
本地爱好者推理和商业解决方案之间的资源差距可能没有想象中那么大,因为几乎所有提供商都试图将大量的GPU资源合理分配给消费者。
根据传闻,当前的许多生成式视频提供商似乎都在使用经过改进的中国开源模型的品牌和一般版本。这些“中间人”系统似乎拥有的主要“护城河”是,他们已经训练了LoRAs,或者以更大的成本和稍微更大的回报进行了模型权重的完整微调††。
这些见解可以帮助进一步弥合这一差距,尤其是在一个发布场景中,中国人似乎决心(不一定是出于利他或理想主义的原因)民主化生成式AI,而西方的商业利益可能更愿意让模型规模的增加和法规最终将真正好的模型藏在API和多层内容过滤器之后。
* 作者的强调,而不是我的。
† 论文没有指定所选的GPU或使用的数量。
†† 虽然LoRA路线更有可能实现,既有经济上的易用性,也因为全权重而不是量化权重并不总是可用。
首次发布于2025年12月19日星期五












