Anderson 视角
使用用户导向数据重塑视频 AI 训练

用户可能希望使用诸如 Flux 或 Hunyuan Video 等生成模型创建的内容可能并不总是容易获得,即使内容请求相当通用,人们可能会猜测生成器可以处理它。
一个例子,如新论文中所述,我们将在本文中讨论,表明日益被 OpenAI Sora 模型所掩盖的模型在渲染解剖学上正确的萤火虫方面存在一些困难,使用提示 ‘萤火虫在夏夜的草叶上发光’:

OpenAI 的 Sora 对萤火虫解剖学有稍微错误的理解。 来源:https://arxiv.org/pdf/2503.01739
由于我很少照字面理解研究声明,我今天在 Sora 上测试了相同的提示,结果稍微好了一点。然而,Sora 仍然无法正确渲染光芒——而不是在萤火虫尾部发光,它将光芒误放在了昆虫的脚附近:

我在 Sora 上测试研究人员的提示,结果显示 Sora 不理解萤火虫的光来自哪里。
讽刺的是,Adobe Firefly 生成扩散引擎经过公司的版权保护的股票照片和视频训练,只能以 1/3 的成功率处理这个问题,当我在 Photoshop 的生成 AI 功能中尝试相同的提示时:

仅在 Adobe Firefly 中(2025 年 3 月)尝试的三个生成的提示中,最后一个产生了光芒,尽管光芒位于昆虫解剖学的正确部分。
这个例子被研究人员强调,以说明用于告知流行基础模型的训练集的分布、强调和覆盖范围可能不符合用户的需求,即使用户没有提出特别具有挑战性的请求——这是一个话题,涉及将大规模训练数据集适应其最有效和高性能的结果作为生成模型的挑战。
作者指出:
‘[Sora] 未能捕捉到萤火虫发光的概念,同时成功生成草和夏夜。从数据角度来看,我们推断这是因为 [Sora] 没有在与萤火虫相关的主题上进行训练,而它已经在草和夜上进行了训练。另外,如果 [Sora] 看到了上面图像中的视频,它将了解萤火虫发光应该是什么样子。’
他们介绍了一份新策划的数据集,并提出他们的方法可以在未来的工作中改进,以创建比许多现有模型更好地符合用户期望的数据集。
为用户而设计的数据
基本上,他们的提议表明了一种数据策划方法,它介于为模型类型(如 LoRA)的自定义数据(这种方法对于一般使用来说过于具体)和广泛且相对不加区别的高容量集合(如 LAION 数据集,用于稳定扩散)之间。这些集合并不特定于任何最终使用场景。
新方法,既是一种方法论,也是一种新数据集,名为 用户焦点在文本到视频,或 VideoUFO。VideoUFO 数据集包含 190 万个视频片段,涵盖 1291 个用户焦点话题。这些话题本身是从现有的视频数据集中精心开发的,并通过多种语言模型和自然语言处理(NLP)技术进行了解析:

新论文中呈现的提炼话题的示例。
VideoUFO 数据集具有大量新颖的 YouTube 视频——“新颖”是指这些视频不在当前文献中流行的视频数据集中,也不在从中策划的许多子集中(并且其中许多视频实际上是在创建旧数据集之后上传的)。
实际上,作者声称与现有视频数据集只有 0.29% 的重叠——这是新颖性的一个令人印象深刻的展示。
其中一个原因可能是作者只接受具有创意共用许可的 YouTube 视频,这种许可不太可能在以后阻碍用户:可能这种类别的视频在以前的 YouTube 和其他高容量平台的扫描中没有被优先考虑。
其次,视频是根据预估的用户需求请求的,而不是不加区别地抓取。这些因素的结合可能导致了如此新颖的集合。另外,研究人员检查了为 VideoUFO 集合做出贡献的视频的 YouTube ID,与现有集合中出现的 ID 进行了比较,这使得他们的说法更可信。
尽管新论文并非所有内容都那么令人信服,但它是一篇有趣的文章,强调了我们仍然在多大程度上受限于数据集中的不均匀分布,以及研究场景经常面临的数据集策划中的障碍。
新工作的标题为 VideoUFO:一个面向文本到视频生成的用户焦点的大规模数据集,来自澳大利亚悉尼科技大学和中国浙江大学的两位研究人员。

从最终获得的数据集中选择的示例。
AI 数据的“个人购物助手”
互联网图像和视频中呈现的主题和概念并不一定反映平均最终用户可能会从生成系统中请求的内容;即使内容和需求 确实 碰撞(如色情内容,它在互联网上 丰富可用,并且对许多 gen AI 用户 非常感兴趣),这可能不符合开发人员的意图和新生成系统的标准。
除了每天上传的大量不适宜儿童的内容外,网络上可用的内容中很大一部分可能来自广告商和试图 操纵 SEO 的人。这种商业自利使得主题的分布远远不公平;更糟糕的是,开发能够应对这个问题的 AI 基础过滤系统很困难,因为从有意义的大规模数据中开发的算法和模型可能本身反映了源数据的趋势和优先级。
因此,新工作的作者通过逆转命题来解决这个问题,通过确定用户可能想要什么,并获取符合这些需求的视频。
表面上,这种方法似乎同样可能引发语义竞争,而不是实现平衡的维基百科式中立性。将数据策划校准到用户需求上,可能会放大最低共同点的偏好,同时边缘化小众用户,因为多数利益必然会带来更大的权重。
尽管如此,让我们来看看这篇论文如何处理这个挑战。
谨慎提炼概念
研究人员使用 2024 年的 VidProM 数据集作为后来将告知项目的网络抓取的主题分析的来源。
作者选择了这个数据集,因为它是唯一一个由“真正的用户”编写的 100 万+ 公开数据集——应该说明这个数据集本身是由这篇新论文的两位作者策划的。
论文解释道*:
‘首先,我们使用 SentenceTransformers 将 VidProM 中的 167 万个提示嵌入到 384 维向量中。接下来,我们使用 K-means 对这些向量进行聚类。注意,我们预先设置了聚类的数量为一个相对较大的值,即 2000,并在下一步中合并相似的聚类。 ‘
‘最后,对于每个聚类,我们要求 GPT-4o 得出一个主题(一个或两个词)。’
作者指出,某些概念是不同的但明显相邻,例如 教堂 和 大教堂。对于这种情况,过于细致的标准会导致对每个狗品种的概念嵌入(例如),而不是“狗”这个词;而过于宽泛的标准会将过多的子概念纳入一个单一的过度拥挤的概念;因此,论文指出,需要一种平衡的方法来评估这种情况。
单数和复数形式被合并,动词被还原为其基础(不定式)形式。过于宽泛的术语——例如 动画、场景、电影 和 运动 ——被删除。
因此,获得了 1291 个主题(完整的列表可在源论文的补充部分找到)。
选择网络抓取
接下来,研究人员使用官方 YouTube API 根据从 2024 年数据集中提炼出的标准来寻找视频,旨在为每个主题获取 500 个视频。除了必要的创意共用许可外,每个视频必须具有 720p 或更高的分辨率,并且必须短于四分钟。
通过这种方式,从 YouTube 中抓取了 586,490 个视频。
作者将下载的视频的 YouTube ID 与几个流行的数据集进行了比较:OpenVid-1M;HD-VILA-100M;Intern-Vid;Koala-36M;LVD-2M;MiraData;Panda-70M;VidGen-1M;和 WebVid-10M。
他们发现,只有 1675 个 ID(即前面提到的 0.29%)的 VideoUFO 剪辑出现在这些旧集合中,它必须被承认,虽然数据集比较列表并不详尽,但它包括了生成视频场景中最大的和最有影响力的参与者。
拆分和评估
获得的视频随后被分割成多个剪辑,按照上面引用的 Panda-70M 论文中概述的方法。估计了镜头边界,组装了拼接,并将连接的视频分割成单个剪辑,并提供了简要和详细的字幕。

VideoUFO 数据集中的每个数据条目都包含一个剪辑、一个 ID、开始和结束时间以及一个简要和详细的字幕。
简要字幕由 Panda-70M 方法处理,详细视频字幕由 Qwen2-VL-7B 处理,按照 Open-Sora-Plan 中建立的指南。在剪辑没有成功体现预期目标概念的情况下,每个剪辑的详细字幕被输入到 GPT-4o mini 中,以确定它是否真正适合该主题。虽然作者更愿意通过 GPT-4o 进行评估,但这对于数百万个视频剪辑来说将过于昂贵。
视频质量评估使用了 VBench 项目中的六种方法。
比较
作者在前面提到的先前数据集上重复了主题提取过程。为此,需要根据语义将 VideoUFO 中派生的类别与其他集合中的不同类别进行匹配;必须承认,这种过程只提供了近似的等效类别,因此可能过于主观,无法保证经验比较的有效性。
尽管如此,在下面的图像中,我们看到研究人员使用此方法获得的结果:

跨 VideoUFO 和先前数据集提取的基本属性的比较。
研究人员承认,他们的分析依赖于每个数据集中提供的现有字幕和描述。他们承认,使用与 VideoUFO 相同的方法重新字幕旧数据集可能会提供更直接的比较。然而,考虑到数据点的庞大数量,他们得出这样的结论:这种方法将过于昂贵,这似乎是合理的。
生成
作者开发了一个基准来评估文本到视频模型在用户焦点概念上的性能,称为 BenchUFO。这涉及从 VideoUFO 中的 1291 个提炼出的用户主题中选择 791 个名词。对于每个选定的主题,从 VidProM 中随机选择了 10 个文本提示。
每个提示都传递给了一个文本到视频模型,使用前面提到的 Qwen2-VL-7B字幕器来评估生成的结果。所有生成的视频都被字幕化后,使用 SentenceTransformers 计算了输入提示和输出(推断)描述的余弦相似度。

BenchUFO 流程的模式。
评估的生成模型包括:Mira;Show-1;LTX-Video;Open-Sora-Plan;Open Sora;TF-T2V;Mochi-1;HiGen;Pika;RepVideo;T2V-Zero;CogVideoX;Latte-1;Hunyuan Video;LaVie;和 Pyramidal。
除了 VideoUFO 外,MVDiT-VidGen 和 MVDit-OpenVid 是替代的训练数据集。
结果考虑了在架构和数据集上表现最差和最好的 10 个主题。

在 BenchUFO 上公用 T2V 模型与作者训练模型的性能结果。
作者在这里评论:
‘当前的文本到视频模型在所有用户焦点主题上并不一致地表现良好。特别是,顶级 10 个主题和低 10 个主题之间的得分差异范围从 0.233 到 0.314。这些模型可能无法有效地理解诸如“巨型鱿鱼”、“动物细胞”、“凡高”和“古埃及”等主题,因为它们在这些视频上没有得到充分的训练。’
‘当前的文本到视频模型在其最佳表现主题上表现出一定的连贯性。我们发现,大多数文本到视频模型都擅长生成与动物相关的视频,例如“海鸥”、“熊猫”、“海豚”、“骆驼”和“猫头鹰”。我们推断,这部分是由于当前视频数据集偏向于动物。’
结论
VideoUFO 是一个杰出的贡献,如果仅仅是因为它提供了新鲜的数据。如果没有对 YouTube ID 的评估和消除错误,并且如果数据集包含如此多新的研究内容,那么它是一个罕见且可能有价值的提议。
缺点是需要相信核心方法论的可信度;如果你不相信用户需求应该告知网络抓取公式,你将会购买一个带有自身一套令人担忧的偏见的数据集。
此外,提炼主题的有用性取决于所使用的提炼方法的可靠性(通常受到预算约束的限制),以及 2024 年数据集的制定方法,该数据集提供了源材料。
话虽如此,VideoUFO 确实值得进一步调查——并且它可以在 Hugging Face 上找到。
* 我用超链接替换了作者的引用。
首次发表于 2025 年 3 月 5 日星期三












