Ángulo de Anderson
El desafío de subtítular videos a más de 1fps

La capacidad de los sistemas de aprendizaje automático para reconocer los eventos que ocurren dentro de un video es crucial para el futuro de la generación de video basada en IA, ya que los conjuntos de datos de video requieren subtítulos precisos para producir modelos que se ajusten a una solicitud del usuario y no exageren la información.

Un ejemplo de esquema de subtítulos del proyecto VidReCap de Google. Fuente: https://sites.google.com/view/vidrecap
Subtítular manualmente la cantidad de videos necesarios para conjuntos de datos de entrenamiento efectivos es una perspectiva inconcebible. Aunque es posible entrenar sistemas de IA para subtítular videos de forma automática, todavía se necesitan muchos ejemplos generados por humanos como verdad fundamental, para variedad y cobertura.
Más importante aún, casi todos los actuales modelos de subtítulos de video basados en IA operan a 1fps, lo que no es una tasa de captura lo suficientemente densa como para discernir variaciones en muchos escenarios: cambios microexpresivos repentinos para sistemas de reconocimiento de emociones; eventos rápidos en deportes de alto rendimiento como el baloncesto; movimientos violentos; cortes rápidos en películas dramáticas, donde sistemas como PySceneDetect pueden no detectarlos (o no se utilizan); y muchos otros escenarios en los que la ventana de atención claramente necesita ser más intensa.
Haz clic para reproducir. Acción rápida pero que cambia la vida en lo que de otra manera puede ser uno de los deportes más lentos del mundo, mientras Alex Higgins gana el campeonato mundial contra Ray Reardon en 1982. Fuente: https://www.youtube.com/watch?v=_1PuqKno_Ok
Moverse rápido y romper la lógica
Esta tasa baja es el estándar por varias razones logísticas. Por un lado, la subtítulación de video es una actividad intensiva en recursos, ya sea que el sistema esté estudiando un marco secuencial a la vez o utilizando varios métodos para cohesionar semánticamente una cadena de marcos en una secuencia de subtítulos interpretable. En cualquier caso, la ventana de contexto está inevitablemente limitada por las limitaciones del hardware.
Otra razón por la que 1fps es el estándar actual es que los videos no suelen estar llenos de eventos rápidos; por lo tanto, es redundante dar a 300 marcos de una mesa de snooker estática la misma atención que el segundo dividido en el que una bola negra se mete y gana el campeonato (ver ejemplo anterior).
Es posible utilizar pistas secundarias más amplias para identificar momentos cruciales en un video deportivo, como la reacción sostenida del público a un mate rápido en un partido de baloncesto. Sin embargo, tales pistas pueden ocurrir por otras razones (como lesiones de jugadores inesperadas), y no se pueden confiar en ellas. Esto es un ejemplo de cómo un conjunto de datos de video mal etiquetado puede llevar a un modelo de video generativo que alucina o malinterpreta las instrucciones, es decir, porque el modelo puede mostrar una lesión de jugador cuando se le pidió que generara un mate (porque la ‘pista secundaria’ de agitación del público no era exclusiva de un tipo específico de evento).
Esto es en muchos sentidos un problema “presupuestario”, y en otros sentidos un problema de procedimiento. Los marcos de trabajo hasta la fecha han operado sobre el principio de que los fotogramas clave espaciados pueden capturar efectivamente la información esencial, pero esto es más efectivo para establecer el género y otros aspectos del tema del video, ya que la evidencia, en ese caso, persiste en varios marcos.
F-16
Un nuevo artículo de China ofrece una solución, en la forma del primer modelo de lenguaje grande multimodal (MLLM, o simplemente LLM) que puede analizar video a 16fps en lugar del estándar de 1fps, evitando al mismo tiempo las grandes desventajas de aumentar la tasa de análisis.
En las pruebas, los autores afirman que el nuevo sistema, titulado F-16, supera a los modelos propietarios de estado del arte como GPT-4o y Google’s Gemini-1.5 pro. Aunque otros modelos actuales pudieron igualar o superar los resultados de F-16 en las pruebas, los modelos competidores eran mucho más grandes y más difíciles de manejar.
Aunque F-16 se entrenó en algunos equipos serios (como veremos a continuación), la inferencia suele ser mucho menos exigente que el entrenamiento. Por lo tanto, podemos esperar que el código (prometido para una versión cercana) sea capaz de ejecutarse en GPUs domésticas de nivel medio o alto.
Lo que se necesita para la vitalidad de la escena de los aficionados (y eso incluye la escena profesional de los efectos visuales, la mayoría de las veces) es un modelo de subtítulos de video de este tipo que pueda operar, quizás cuantificado, en sistemas de consumo, para que toda la escena de video generativo no migre a sistemas comerciales basados en API, o fuerce a los consumidores a conectar marcos locales a servicios de GPU en línea comerciales.
Más allá de escalar
Los autores observan que este tipo de enfoque es una alternativa práctica a escalar los conjuntos de datos. También se puede inferir que si se fuera a lanzar más datos al problema, este es aún el tipo de enfoque que podría ser preferible, porque el nuevo sistema distingue eventos de una manera más granular.
Afirman:
‘La muestra de tasa de cuadros baja puede resultar en una pérdida de información visual crítica, particularmente en videos con escenas que cambian rápidamente, detalles intrincados o movimiento rápido. Además, si se pierden los fotogramas clave, pero el modelo se entrena en etiquetas que dependen de la información de los fotogramas clave, puede luchar por alinear sus predicciones con el contenido esperado, lo que potencialmente conduce a alucinaciones y un rendimiento degradado…
‘… F-16 logra un rendimiento SOTA en la comprensión general de video entre modelos de tamaño similar y demuestra una ventaja clara en la comprensión de video de alta velocidad, superando a modelos comerciales como GPT-4o. Este trabajo abre nuevas direcciones para avanzar en la comprensión de video de alta velocidad en la investigación de MLLM.’
El nuevo artículo se titula Mejorar la comprensión de video LLM con 16 cuadros por segundo, y proviene de ocho autores de la Universidad de Tsinghua y ByteDance.
Método
Dado que los fotogramas consecutivos a menudo contienen información redundante, F-16 aplica un alineador de alta velocidad de cuadros para comprimir y codificar detalles de movimiento clave mientras retiene la semántica visual. Cada fotograma se procesa primero mediante un codificador de imagen preentrenado, extrayendo representaciones de características antes de pasar a un alineador basado en Unidades de error gaussiano lineal (GELUs).

La arquitectura de F-16 procesa video a 16 FPS, capturando más fotogramas que los modelos de baja tasa de cuadros tradicionales, y su alineador de alta velocidad de cuadros preserva la semántica visual mientras codifica eficientemente la dinámica del movimiento sin agregar tokens visuales extraños. Fuente: https://arxiv.org/pdf/2503.13956
Para manejar la cuenta de fotogramas aumentada de manera eficiente, F-16 agrupa los fotogramas en ventanas de procesamiento pequeñas, fusionando las características visuales mediante una Red neuronal multicapa (MLP) de tres capas, lo que ayuda a retener solo los detalles de movimiento más relevantes, y reduce la duplicación innecesaria, mientras preserva el flujo temporal de las acciones. Una capa de max-pooling espacial comprime aún más la cuenta de tokens, manteniendo los costos computacionales dentro de los límites.
Los tokens de video procesados se alimentan luego en el Qwen2-7B LLM, que genera respuestas textuales basadas en las características visuales extraídas y una solicitud de usuario dada.
Al estructurar la entrada de video de esta manera, F-16 permite, según los autores, un reconocimiento de eventos más preciso en escenas dinámicas, mientras mantiene la eficiencia.
La versión corta
F-16 extiende un modelo de lenguaje de imagen preentrenado, LLaVA-OneVision, para procesar video transformando su tubería de entrada visual. Mientras que los modelos de lenguaje de imagen estándar manejan fotogramas aislados, el alineador de alta velocidad de cuadros de F-16 reformatea múltiples fotogramas en una forma que el modelo puede procesar de manera más eficiente; esto evita abrumar al sistema con información redundante mientras preserva las pistas de movimiento clave necesarias para una comprensión de video precisa.
Para garantizar la compatibilidad con su base de imagen, F-16 reutiliza parámetros preentrenados reestructurando su alineador en submatrices. Este enfoque le permite integrar conocimientos de modelos de un solo fotograma mientras se adapta a la entrada de video secuencial.
El alineador primero comprime las secuencias de fotogramas en un formato optimizado para el LLM, preservando las características más informativas mientras descarta los detalles innecesarios. El diseño de la arquitectura permite que el sistema procese video de alta velocidad mientras mantiene los requisitos computacionales bajo control, lo que los autores consideran como evidencia de que escalar no es la única (o la mejor) forma de avanzar en la subtítulación de video.
Variando el ritmo
Dado que procesar video a 16 FPS mejora la comprensión del movimiento pero aumenta el costo computacional, particularmente durante la inferencia, F-16 introduce un método de decodificación de velocidad de cuadros variable, que le permite ajustar la velocidad de cuadros de forma dinámica sin necesidad de volver a entrenar.

Los alineadores de un solo fotograma y de alta velocidad de cuadros disponibles para F-16.
Esta flexibilidad permite que el modelo opere de manera eficiente a velocidades de cuadros más bajas cuando no se requiere una precisión alta, y reduce la sobrecarga computacional.
En el momento de la prueba, cuando se selecciona una velocidad de cuadros más baja, F-16 reutiliza los parámetros del alineador preentrenado repitiendo los fotogramas de entrada para coincidir con las dimensiones esperadas. Esto garantiza que el modelo aún pueda procesar video de manera efectiva sin modificar su arquitectura.
A diferencia de la muestreo simple (es decir, simplemente eliminar fotogramas), que arriesga perder detalles de movimiento críticos, este método preserva las representaciones de movimiento aprendidas por el alineador, manteniendo la precisión incluso a velocidades de cuadros reducidas. Para la comprensión general de video, una configuración de velocidad de cuadros más baja puede acelerar la inferencia sin una pérdida de rendimiento significativa, mientras que el análisis de movimiento de alta velocidad aún puede aprovechar la capacidad de 16 FPS completa.
Datos y pruebas
Construido sobre Qwen2-7B, FP-16 extiende LLaVA-OneVision utilizando SigLIP como codificador de imagen. Con los fotogramas de video muestreados a 16 FPS, se pueden obtener hasta 1,760 fotogramas de cada video. Para clips de video más largos, los fotogramas se muestrearon de manera uniforme (es decir, más espaciada).
Para el entrenamiento, F-16 utilizó los mismos conjuntos de datos de video generales que LLaVA-Video, incluyendo LLaVA-Video-178K, NExT-QA, ActivityNet-QA, y PerceptionTest.
F-16 también se ajustó finamente en los conjuntos de datos de deportes de alta velocidad FineGym, Diving48, y SoccerNet. Los autores también curaron una colección de 276 juegos de la NBA jugados entre el 13 y el 25 de noviembre de 2024, centrados en si un tiro fue exitoso (una tarea que requiere procesamiento de alta velocidad de cuadros).
El modelo se evaluó utilizando el conjunto de pruebas NSVA, con el rendimiento medido por puntuación F1.
Los modelos de gimnasia y natación se evaluaron según la precisión del reconocimiento de eventos, mientras que los modelos de fútbol y baloncesto rastrearon pases y resultados de tiros.
El modelo se entrenó durante 1 época utilizando 128 NVIDIA H100 GPUs (y con 80GB de VRAM por GPU, esto implicó el uso de 10,24 terabytes de memoria de GPU; incluso según los estándares recientes, esta es la configuración de GPU más potente con la que me he encontrado al seguir la literatura de investigación en visión por computadora). Una tasa de aprendizaje de 2×10⁻⁵ se utilizó durante el entrenamiento.
Además, un LoRA se ajustó finamente en los datos deportivos utilizando adaptadores LoRA con 64 GPUs durante 5 épocas. Aquí, solo se entrenó el LLM, dejando al codificador de imagen congelado.
Los marcos de trabajo opuestos que se probaron en la ronda inicial para la ‘comprensión general de video’ fueron GPT-4o; Gemini-1.5-Pro; Qwen2-VL-7B; VideoLLaMA2-7B; VideoChat2-HD-7B; LLaVA-OV-7B; MiniCPM-V2.6-8B; LLaVA-Video-7B; y NVILA-7B;
Los modelos se evaluaron en Video-MME; VideoVista; TemporalBench; MotionBench; Next-QA; MLVU; y LongVideoBench.

Comparación de resultados de preguntas y respuestas de video entre modelos, mostrando límites de FPS y rendimiento en varios benchmarks. F-16 logra SOTA entre los modelos de 7B en Video-MME, NQA, TPB y MB, rivalizando con modelos propietarios como GPT-4o y Gemini-1.5-Pro.
De estos resultados, los autores afirman:
‘En los conjuntos de datos Video-MME Corto, Medio y NeXT-QA—cada uno diseñado para la comprensión de video corto—nuestro modelo supera al modelo SOTA anterior de 7B por 3.2%, 1.0% y 0.9% en precisión, destacando su sólido rendimiento en videos cortos.
‘Para los benchmarks que evalúan la comprensión de video largo, como Video-MME Largo, LongVideoBench y MLVU, el desafío es mayor debido a la muestra de fotogramas más espaciada, lo que hace que los fotogramas dentro de la ventana de procesamiento muestren variaciones más significativas.
‘Esto aumenta la dificultad para que el alineador de modalidad codifique eficazmente los cambios temporales dentro de la representación de tokens limitada. Como resultado, F-16 experimenta una ligera caída en el rendimiento en comparación con [LLaVA-Video-7B], que se entrenó en el mismo conjunto de datos de video.’
El procesamiento de alta velocidad de cuadros de F-16, continúan los autores, también resultó en una mejora del 13.5% en TemporalBench y una ganancia del 2.5% en MotionBench, en comparación con los modelos de 7B existentes, y se desempeñó a un nivel similar al de los modelos comerciales como GPT-4o y Gemini-1.5-Pro.
Comprensión de video deportivo de alta velocidad
F-16 se probó en FineGym, Diving48, SoccerNet y conjuntos de datos de la NBA para evaluar su capacidad para comprender acciones deportivas de alta velocidad.
Utilizando los 10,000 clips de la NBA etiquetados manualmente, el entrenamiento se centró en el movimiento de la pelota y las acciones de los jugadores, y en si los modelos podían determinar correctamente si un tiro fue exitoso, utilizando el conjunto de pruebas NSVA evaluado con puntuación F1.

Resultados del análisis de video deportivo de alta velocidad. F-16 con el alineador de alta velocidad de cuadros se desempeñó mejor que su contraparte de baja velocidad de cuadros en todas las tareas deportivas. GPT-4o y Gemini-1.5-Pro también se evaluaron en NBA y SoccerNet QA, donde no se requirió conocimiento de entrenamiento en el dominio.
En FineGym, que mide el reconocimiento de acciones de gimnasia, F-16 se desempeñó un 13.8% mejor que el modelo SOTA anterior de 7B, demostrando una mejor comprensión del movimiento fino.
Diving48 requirió identificar secuencias de movimiento complejas como fases de despegue, salto, giro y vuelo, y F-16 mostró una mayor precisión al reconocer estas transiciones.
Para SoccerNet, el modelo analizó clips de 10 segundos, identificando pases de balón, y los resultados mostraron una mejora sobre los modelos de 7B existentes, lo que indica que una mayor velocidad de cuadros contribuye a rastrear movimientos pequeños y rápidos.
En el conjunto de datos de la NBA, la capacidad de F-16 para determinar los resultados de los tiros se acercó a la precisión de los modelos propietarios más grandes como GPT-4o y Gemini-1.5-Pro, lo que sugiere que una mayor velocidad de cuadros mejora su capacidad para procesar movimiento dinámico.
Velocidades de cuadros variables
F-16 se probó a diferentes velocidades de cuadros para medir su adaptabilidad. En lugar de volver a entrenar, manejó velocidades de cuadros más bajas repitiendo fotogramas para coincidir con la estructura de entrada del alineador. Este enfoque retuvo más rendimiento que simplemente eliminar fotogramas (propenso a causar pérdida de precisión).
Los resultados indican que aunque reducir la velocidad de cuadros tuvo algún impacto en el reconocimiento de movimiento, F-16 aún superó a los modelos de baja velocidad de cuadros y mantuvo resultados sólidos incluso por debajo de 16 FPS.

Izquierda, el tiempo de consumo de los diferentes módulos de F-16 durante la inferencia, medido en 300 videos del conjunto de datos Video-MME Largo a diferentes velocidades de cuadros de prueba y longitudes de secuencia. Derecha, una comparación entre el rendimiento de Video-MME para modelos entrenados y probados a diferentes velocidades de cuadros. La línea sólida representa modelos entrenados y probados a la misma velocidad de cuadros, mientras que la línea discontinua muestra el rendimiento cuando un modelo entrenado a 16 FPS se prueba a una velocidad de cuadros más baja.
El procesamiento de alta velocidad de cuadros de F-16 aumentó los requisitos computacionales, aunque su alineador ayudó a gestionar estos costos al comprimir tokens visuales redundantes.
El modelo requirió más FLOPs por video que los modelos de baja velocidad de cuadros, pero también logró una mayor precisión por token, lo que sugiere que sus estrategias de selección de fotogramas y compresión de tokens ayudaron a compensar la computación adicional.
Conclusión
Es difícil exagerar tanto la importancia como los desafíos de esta particular rama de la investigación, especialmente este año, que está a punto de ser el año de avance para el video generativo, lo que pone de relieve las deficiencias en la curación de conjuntos de datos de video y la calidad de los subtítulos de manera destacada.
Debe enfatizarse que los desafíos involucrados en obtener descripciones precisas de los detalles internos del video no pueden resolverse exclusivamente arrojando VRAM, tiempo o espacio en disco al problema. El método por el cual los eventos se aíslan/extraen de tramos de video largos y tediosos (como clips de golf o snooker, por ejemplo) se beneficiará de una reevaluación de los enfoques semánticos y mecanismos que actualmente dominan las soluciones SOTA, porque algunas de estas limitaciones se establecieron en tiempos con recursos más limitados.
(incidentalmente, incluso si 16fps parece una velocidad de cuadros muy baja para 2025, es interesante destacar que esta también es la velocidad de entrenamiento nativa de los clips de video utilizados en el popular modelo de video generativo Wan 2.1, y la velocidad a la que opera con menos problemas. Esperemos que la escena de investigación mantenga un ojo en la posible ‘entropía de estándares’ aquí; a veces, las limitaciones obsoletas pueden perpetuar futuros estándares)
Publicado por primera vez el miércoles 19 de marzo de 2025












