Anderson 视角
视频字幕挑战:每秒超过1帧

机器学习系统识别视频内部事件的能力对于基于AI的视频生成的未来至关重要,因为视频数据集需要准确的字幕来生成符合用户请求的模型,并且不至于过度 产生幻觉。

谷歌的VidReCap项目的字幕模式示例。来源:https://sites.google.com/view/vidrecap
手动字幕化大量视频以创建有效的训练数据集是一个不可能完成的任务。虽然可以训练AI系统自动字幕化视频,但仍然需要大量的人工生成的示例作为基准,以确保多样性和覆盖范围。
更重要的是,几乎所有当前的AI-based视频字幕模型 以1fps运行,这对于识别许多场景中的变化来说,捕获率还不够高:情感识别系统中的微表情变化;高速度运动中的快速事件,如篮球;剧烈的动作;戏剧电影中的快速剪辑,其中系统如 PySceneDetect 可能无法识别它们(或未被使用);以及许多其他需要更密集注意力的场景。
点击播放。 在世界上最慢的运动之一中,亚历克斯·希金斯在1982年击败雷·雷尔顿赢得世界冠军的快速而改变命运的动作。来源:https://www.youtube.com/watch?v=_1PuqKno_Ok[/span]
快速移动,打破逻辑
这种低速率是由于各种后勤原因而成为标准。首先,视频字幕化是一项资源密集的活动,无论系统是逐帧顺序处理还是使用各种方法将一系列帧语义地凝聚成可解释的字幕序列。在这两种情况下, 上下文窗口 都受到硬件约束的限制。
1fps成为当前标准的另一个原因是,视频通常不充满快速事件;因此,对300帧静态台球桌给予与赢得冠军的那一瞬间相同的关注是多余的(见上面的示例)。
可以使用更广泛的次要线索来识别体育视频中的关键时刻,例如篮球比赛中快速扣篮的持续人群反应。然而,这些线索可能出于其他原因(例如意外的球员受伤),并且不能依赖它们。这是视频数据集可能被错误标记并导致生成的视频模型产生幻觉或误解指令的另一个例子,即模型可能显示球员受伤,而不是扣篮(因为“次要线索”人群激动并非特定事件的专有特征)。
这是一个“预算”问题,也是一个程序问题。迄今为止,框架都基于这样的原则:稀疏的关键帧可以有效地捕捉基本信息,但这更适合于确定视频的类型和其他方面,而不是捕捉特定事件的证据。
F-16
一篇来自中国的新论文提出了一个解决方案,提出了一种多模态大型语言模型(MLLM或简单的LLM),可以以 16fps 的速度分析视频,而不是标准的1fps,同时避免了增加分析速率的主要缺陷。
在测试中,作者声称该新系统,称为 F-16 ,在与专有状态最先进模型(如GPT-4o和谷歌的Gemini-1.5 Pro)进行比较时,表现出色。虽然其他当前模型在试验中能够匹配或超过F-16的结果,但竞争模型更大、更笨重。
虽然F-16是在一些严重的硬件上训练的(正如我们稍后将要看到的),但推理通常比训练要少得多。因此,我们可以希望代码(承诺在不久的将来发布)将能够在中档或高端的家用GPU上运行。
对于爱好者圈(以及大多数时候的专业VFX圈)来说,需要一种可以在消费者系统上运行的视频字幕模型,可能是 量化 的,以便整个生成视频场景不会迁移到基于API的商业系统,或者迫使消费者将本地框架连接到商业在线GPU服务。
超越扩大规模
作者观察到,这种方法是扩大数据集的实际替代方案。也可以推断,如果要向问题中添加更多数据,这种方法仍然是可取的,因为新系统以更细粒度的方式区分事件。
他们指出:
‘低帧率采样可能会导致关键视觉信息丢失,特别是在视频中有快速变化的场景、复杂细节或快速运动。另外,如果关键帧丢失,但模型是训练在依赖关键帧信息的标签上,它可能难以使其预测与预期内容保持一致,可能导致幻觉和性能下降…
‘… F-16在类似规模的模型中实现了最先进的视频问答性能,并在高帧率视频理解中表现出明显优势,超过了商业模型,如GPT-4o。这项工作为多模态LLM研究中的高帧率视频理解开辟了新的途径。’
这篇题为 提高LLM视频理解能力,使用每秒16帧 的新论文来自清华大学和字节跳动的八位作者。
方法
由于连续帧通常包含冗余信息,F-16应用了一种高帧率对齐器来压缩和编码关键运动细节,同时保留视觉语义。每个帧首先由预训练的图像编码器处理,提取特征表示,然后传递给基于 高斯误差线性单元(GELUs) 的对齐器。

F-16的架构以16 FPS处理视频,捕获比传统低帧率模型更多的帧,其高帧率对齐器在不添加额外视觉令牌的情况下保留视觉语义并高效地编码运动动态。来源:https://arxiv.org/pdf/2503.13956
为了高效处理增加的帧数,F-16将帧分成小的处理窗口,使用三层 多层感知器(MLP) 合并视觉特征,帮助保留最相关的运动细节,并减少不必要的重复,同时保留操作的时间流。空间 最大池化 层进一步压缩令牌计数,保持计算成本在可控范围内。
处理后的视频令牌然后被输入到 Qwen2-7B LLM中,根据提取的视觉特征和给定的用户提示生成文本响应。
通过以这种方式结构化视频输入,F-16实现了更精确的事件识别,在动态场景中,同时仍然保持效率。
简短版本
F-16扩展了预训练的图像LLM, LLaVA-OneVision ,以处理视频,通过转换其视觉输入管道。虽然标准图像LLM处理单个帧,但F-16的高帧率对齐器将多个帧重新格式化为模型可以更高效地处理的形式;这避免了用冗余信息淹没系统,同时保留了准确视频理解所需的关键运动提示。
为了确保与其图像基础的兼容性,F-16通过重新构造其对齐器为子矩阵来重用预训练参数。这使得它能够将单帧模型的知识整合到序列视频输入中。
对齐器首先将帧序列压缩成优化的LLM格式,保留最具信息量的特征,同时丢弃不必要的细节。架构设计使系统能够处理高帧率视频,同时保持计算需求在可控范围内,作者认为这是扩大规模不是视频字幕的唯一(或最佳)途径的证据。
变化的节奏
由于以16 FPS处理视频可以提高运动理解,但也会增加计算成本,特别是在推理期间,F-16引入了一种 可变帧率解码 方法,允许它在不重新训练的情况下动态调整帧率。

F-16可用的单帧和高帧率对齐器。
这种灵活性使模型能够在不降低精度的情况下以较低的FPS高效运行,并降低计算开销。
在测试时,当选择较低的帧率时,F-16通过重复输入帧来匹配预期的维度来重用之前训练的对齐器参数。这确保模型仍然可以在不修改其架构的情况下有效地处理视频。
与简单地降采样(即简单地删除帧)不同,这种方法会丢失关键运动细节,F-16的方法保留了对齐器的学习运动表示,同时保持了操作的时间流。对于一般的视频理解,较低的FPS设置可以加快推理速度,而不会明显损失性能,而高速运动分析仍然可以利用16 FPS的全部能力。
数据和测试
F-16建立在Qwen2-7B之上,使用 SigLIP 作为图像编码器。视频帧以16 FPS采样,可以从每个视频中获得多达1,760帧。对于较长的视频,帧被统一采样(即更为稀疏地)。
为了训练,F-16使用了与 LLaVA-Video 相同的通用视频数据集,包括 LLaVA-Video-178K 、 NExT-QA 、 ActivityNet-QA 和 PerceptionTest 。
F-16还在高速度运动数据集 FineGym 、 Diving48 和 SoccerNet 上进行了微调。作者还策划了一组276场NBA比赛,比赛时间为2024年11月13日至11月25日,重点关注球是否投篮成功(这需要高帧率处理),使用NSVA测试集进行评估,评估指标为F1得分。
模型使用 NSVA测试集 进行评估,性能通过 F1得分 进行衡量。
体操和跳水模型根据事件识别准确率进行评估,而足球和篮球模型则跟踪传球和投篮结果。
模型经过1个 epoch 的训练,使用 128 台NVIDIA H100 GPU(每个GPU的标准VRAM为80GB,这意味着使用了10.24TB的GPU内存;即使按照当前标准,这也是我在跟踪计算机视觉研究文献时遇到的最高配的GPU集群)。训练过程中使用了2×10⁻⁵的 学习率 。
此外,对体育数据进行了LoRA的微调,使用了64个GPU,训练了5个epoch。在这里,只训练了LLM,而图像编码器保持 冻结 状态。
与初始轮次中进行比较的对手框架包括GPT-4o;Gemini-1.5-Pro;Qwen2-VL-7B; VideoLLaMA2-7B ; VideoChat2 -HD-7B; LLaVA-OV-7B ; MiniCPM-V2.6-8B ; LLaVA-Video-7B ;以及 NVILA-7B 。
模型在 Video-MME ; VideoVista ; TemporalBench ; MotionBench ;Next-QA; MLVU ;以及 LongVideoBench 上进行了评估。

跨模型的视频问答结果比较,显示FPS限制和多个基准测试的性能。F-16在7B模型中实现了Video-MME、NQA、TPB和MB上的最先进性能,媲美专有模型,如GPT-4o和Gemini-1.5-Pro。
作者指出:
‘在Video-MME Short、Medium和NeXT-QA数据集上——每个数据集都针对短视频理解——我们的模型在准确率上超过了之前的7B SOTA模型3.2%、1.0%和0.9%。这突出了它在短视频上的强大性能。 ‘
‘对于评估长视频理解的基准,例如Video-MME Long、LongVideoBench和MLVU,挑战更大,因为帧采样更为稀疏,导致处理窗口内的帧表现出更显著的变化。 ‘
‘这增加了模态对齐器有效编码处理窗口内时间变化的难度。因此,F-16在这些基准上相比 LLaVA-Video-7B 有轻微的性能下降。 ‘
F-16的高帧率处理还导致了在TemporalBench上13.5%的改进和在MotionBench上2.5%的改进,相比现有的7B模型,并且在与专有模型(如GPT-4o和Gemini-1.5-Pro)相比时,表现出色。
高速运动视频理解
F-16被测试在FineGym、Diving48、SoccerNet和NBA数据集上,以评估其理解高速运动的能力。
使用10,000个手动注释的NBA剪辑,训练集中注重球的移动和球员的动作,以及模型是否能够正确确定投篮是否成功,使用NSVA测试集进行评估,评估指标为F1得分。

高速运动视频分析结果。F-16在所有运动任务中都优于其低帧率对应物。GPT-4o和Gemini-1.5-Pro也在NBA和SoccerNet QA上进行了评估,在这些任务中不需要领域内训练知识。
在FineGym上,F-16在体操动作识别方面比之前的7B SOTA模型表现出13.8%的改进,表明其对细粒度运动的理解能力有所提高。
对于Diving48,需要识别复杂的运动序列,如起跳、 翻转 、 扭转 和 飞行 阶段,F-16在识别这些过渡方面表现出更高的准确率。
对于SoccerNet,模型分析了10秒的剪辑,识别了球的传递,结果显示F-16在跟踪小的快速运动方面比现有的7B模型有所改进,表明更高的FPS有助于跟踪快速运动。
在NBA数据集中,F-16确定投篮结果的能力接近了更大型专有模型(如GPT-4o和Gemini-1.5-Pro)的准确率,进一步表明更高的帧率提高了其处理动态运动的能力。
可变帧率
F-16被测试在不同的帧率下,以衡量其适应性。与其重新训练,F-16通过重复帧来匹配对齐器的输入结构来处理较低的FPS。这种方法比简单地删除帧(容易导致准确率损失)保留了更多的性能。
结果表明,虽然降低FPS对运动识别有一些影响,但F-16仍然优于低帧率模型,并且即使在16 FPS以下也保持了良好的性能。

左侧,F-16模块在Video-MME Long集上的推理期间的时间消耗,测试FPS和序列长度不同。右侧,比较模型在不同FPS训练和测试时的Video-MME性能。实线表示模型在相同FPS上训练和测试,而虚线表示模型在16 FPS上训练,在较低帧率下测试。
F-16的高帧率处理增加了计算需求,尽管其对齐器有助于通过压缩冗余视觉令牌来管理这些成本。
该模型每个视频的FLOPs需求比低FPS模型更高,但也实现了更好的每个令牌的准确率,表明其帧选择和令牌压缩策略有助于抵消增加的计算。
结论
很难夸大这种特定研究线索的重要性或挑战,尤其是在这个年份——这将是 生成视频 的突破性年份,突出了视频数据集策划和字幕质量的缺陷,并且 有时会让人感到困惑 。
也应该强调,内部视频细节的准确描述的挑战不能仅通过向问题中添加VRAM、时间或磁盘空间来解决。事件从长而枯燥的视频轨道中被隔离/提取的方法(例如高尔夫或台球视频片段)将从当前的语义方法和机制中受益,这些方法和机制目前主导着最先进的解决方案——因为其中一些限制是在资源匮乏的时代建立的。
(顺便提一下,即使16fps对于2025年来说似乎是一个非常低的帧率,但有趣的是,这也是极为流行的 Wan 2.1 生成视频模型的原生训练速度,也是它运作最少问题的速度。希望研究界会密切关注这里可能存在的“标准熵”;有时,过时的约束可能会延续未来的标准)
首次发表于2025年3月19日星期三












