Ángulo de Anderson
La IA prefiere leer el libro que ver la película

Es sorprendentemente difícil lograr que los modelos de IA analicen y comenten contenido de video real, incluso si están diseñados para esta tarea. Están más interesados en la palabra escrita.
Si alguna vez ha intentado subir un clip de video a ChatGPT o a un modelo de visión/lenguaje similar, es posible que se haya sorprendido al darse cuenta de que no pueden analizar video. Aunque modelos como ChatGPT-4o+ pueden analizar individualmente los fotogramas (en forma de imágenes, como JPEG y PNG), prefieren que el usuario extraiga sus propios fotogramas y los suba como imágenes (que están preparados para comentar).
En el caso de la serie GPT de OpenAI, se puede, con bastante trabajo, extraer una secuencia completa de fotogramas de un clip de video y alimentarlos a ChatGPT, para fines como generar una pista de narrativa creada por IA para el video:
![Imágenes y código de un tutorial de OpenAI sobre el análisis de múltiples fotogramas extraídos con el fin de desarrollar un comentario generado por IA para un clip de video. [ Fuente ] https://cookbook.openai.com/examples/gpt_with_vision_for_video_understanding](https://www.unite.ai/wp-content/uploads/2025/10/openai-gpt-frame-parsing.jpg)
Imágenes y código de un tutorial de OpenAI sobre el análisis de múltiples fotogramas extraídos con el fin de desarrollar un comentario generado por IA para un clip de video. Fuente
Pero corresponde al usuario realizar la conversión de video a fotogramas, ya sea llamando a funciones en una rutina más grande, como en el ejemplo anterior, o extrayendo los fotogramas con FFMPEG o varias soluciones de edición de video gratuitas o de pago.
Hasta cierto punto, quizás incluso en gran medida, las limitaciones en el análisis de video en productos de gran escala como ChatGPT dependen del uso de recursos: equipar una sola instancia de IA con una selección de los codecs de video más populares y comprometer recursos de cómputo con el proceso de extracción, que es intensivo en disco y CPU, no es una consideración menor, si cientos de millones de usuarios deciden comenzar a utilizar estas facilidades todos los días.
Además, el análisis temporal puede pintar un cuadro muy diferente que un solo fotograma (imagina a alguien que entra en una casa con buen humor y luego descubre un cuerpo); por lo tanto, considerar la totalidad de la ‘huella temporal’ de incluso un clip de video corto es una tarea exigente y que requiere muchos recursos, así como un área especializada de la literatura de investigación, por ejemplo, con el desarrollo continuo de marcos como Optical Flow –que básicamente ‘despliega’ una longitud de video para que pueda ser considerado y actuado como si fuera un documento estático–:

Los diagramas de flujo óptico resaltan cómo se rastrea el movimiento a través de los fotogramas en una secuencia de video, con vectores verdes que muestran la dirección y la intensidad del movimiento. Estos mapeos proporcionan la continuidad temporal necesaria para los VLM y también pueden servir como guías estructurales en flujos de trabajo de VFX. Fuente
Conformándose con el resumen de Cliff
Sin embargo, como los modelos como Google’s Notebook LM y las entradas más recientes de ChatGPT pueden leer metadatos asociados (es decir, contenido de texto incrustado que contextualiza el video de alguna manera), no prohíben la subida de archivos de video; y a veces, incluso intentarán interpretar un video que no tiene dichos datos.
En el siguiente caso, subí un clip aleatorio de 6 segundos de la película italiana La mano de Dios (2021) a NotebookLM, asegurándome de que el clip no contenía texto útil, ni en los metadatos ni en el nombre del archivo.
NotebookLM entonces procedió a elaborar material totalmente ajeno al video*, completo con un podcast de cinco minutos de diálogo cara a cara sin sentido:

Un momento cotidiano en un clip de seis segundos de una película italiana es interpretado de manera salvaje por NotebookLM. Fuente: Google NotebookLM
Aunque Notebook, al igual que ChatGPT, aceptará un video de YouTube como entrada, solo lo hará si el video cuenta con una capa de texto interpretable y/o subtítulos (no subtítulos rasterizados que se hayan quemado en el video).
De esta manera, el trabajo arduo de realmente mirar y escuchar el contenido del video y realizar una interpretación semántica del mismo (una necesidad legal para YouTube, debido a sus medidas de protección de derechos de autor, y su sistema de protección de identidad en espera), se ha realizado con anticipación después de la subida del usuario, y según sea posible, cuando el clip pueda ser asignado los recursos de procesamiento necesarios.
La interpretación real de video es costosa y agotadora, y resulta que incluso los modelos que han sido entrenados específicamente para realizar esta tarea preferirían leer texto que realmente mirar video.
TL;DW
Esto, según un nuevo artículo del Reino Unido de la Universidad de Bristol, titulado Un video no vale mil palabras, en el que los dos autores concluyen que los actuales modelos de visión y lenguaje de vanguardia (VLM) –modelos diseñados específicamente para analizar video de una manera más esforzada y participar en preguntas y respuestas de video (VQA)– también recurren a la información basada en texto siempre que puedan.
Cuando se les dio tanto imágenes en movimiento como preguntas y respuestas de múltiple opción, los autores del artículo encontraron que los modelos generalmente basaban sus elecciones en patrones en el texto, en lugar de lo que sucedía en la pantalla –en muchos casos, actuando igual de bien incluso cuando la pregunta se eliminaba por completo.
En lo que parece ser una forma habitual de atajo o engaño, lo que más importaba a la mayoría de los modelos era detectar patrones en las posibles respuestas; solo cuando la tarea se hizo más difícil, al agregar más opciones de respuesta, los IA comenzaron a prestar más atención al video.
Los autores sometieron a los modelos a pruebas de VQA bajo una variedad de condiciones; y encontraron que los resultados indicaban la dependencia de los modelos en el texto sobre el contenido del video.

Ejemplo del estudio que muestra cómo un modelo de análisis de video pondera lo que ve versus lo que lee. El clip muestra a una persona tejiendo bambú, pero el modelo asigna mucha más importancia al texto de la pregunta y la respuesta que a los fotogramas del video en sí. Los destacados en azul marcan elementos que respaldan la respuesta elegida, mientras que los destacados en rojo marcan aquellos que la alejan en la dirección opuesta, ilustrando cómo la razonamiento del modelo se centra en la redacción en lugar de en las imágenes en movimiento. Fuente
Método
Para comprender cuánto contribuye cada entrada a la decisión de un modelo, el nuevo trabajo utiliza un método de la teoría de juegos llamado Valores de Shapley. Originalmente diseñado para dividir una ganancia entre jugadores en una coalición, los Valores de Shapley asignan crédito a cada ‘jugador’ en función de su impacto individual.
En efecto, los ‘jugadores’ en este escenario son los fotogramas del video o los componentes de texto (anotaciones, subtítulos, etc.) de una tarea de VQA; y la ‘ganancia’ es la respuesta final del modelo. Al probar sistemáticamente qué sucede cuando cada parte se agrega o elimina, la técnica revela cuánto importaba ese elemento para llegar a la respuesta elegida.
En el caso del nuevo proyecto, para extender el método a través de varios tipos de datos, los Valores de Shapley se adaptaron para manejar modalidades mixtas, con componentes de video y texto tratados por separado, y su influencia variable en las salidas del modelo se midió, lo que reveló si el contenido del video se estaba interpretando realmente o si se estaban utilizando pistas escritas como atajos.
Métricas
Se definieron dos métricas simples para comparar cuánto contribuía cada modalidad (es decir, video, pregunta o respuesta) a la decisión del modelo: Contribución de modalidad mide cuánto de la explicación total provino de cada tipo de entrada; aquí, todos los valores de Shapley disponibles se suman, y la participación que pertenece a cada modalidad se calcula como un porcentaje del total.
En segundo lugar, Contribución por función corrige el hecho de que algunas modalidades, como el video, contienen muchas más características que otras. En cambio, se calcula el valor de Shapley promedio para cada característica, y esas medias se comparan para determinar qué modalidad tiene una influencia dominante.
Datos y pruebas
Los autores probaron el enfoque en seis VLM con diversas características diseñadas para garantizar que los principios de las pruebas fueran ampliamente aplicables y generalizables. Por lo tanto, los modelos se seleccionaron por diferentes longitudes de contexto, diferentes edades (es decir, cuánto tiempo ha pasado desde que se lanzó el marco) y diferentes configuraciones de arquitectura.
Los contendientes fueron FrozenBiLM; InternVideo; VideoLLaMA2; VideoLLaMA3; LLaVa-Video (que aprovecha Qwen2); y LongVA (que también utiliza Qwen2).
Con el mismo objetivo de diversidad, los cuatro conjuntos de datos objetivo seleccionados fueron EgoSchema, un conjunto de datos de VQA diseñado para ser imposible de completar sin ver completamente los videos asociados; HD-EPIC, un conjunto de datos centrado en la cocina que presenta algunos videos inusualmente largos; MVBench, un conjunto de datos curado de contribuciones de otros conjuntos de datos; y LVBench, que plantea preguntas de VQA para videos muy largos.
De estos, los autores idearon 60 preguntas –diez de cada tipo de pregunta.
Las métricas de contribución hicieron claro que la mayoría de los modelos se basaban menos en el video que en el texto, especialmente cuando se juzgaba fotograma por fotograma. Incluso donde el video mostraba una contribución razonable en la contribución general, su influencia por función era a menudo mínima, lo que sugiere que aunque el modelo podría estar utilizando el video en conjunto, estaba prestando poca atención a los fotogramas individuales. VideoLLaMA3 fue la principal excepción aquí, con una dependencia visual más pesada, especialmente en las secuencias más largas en LVBench:

Puntuaciones de Contribución de modalidad (MC) y Contribución por función (PFC) en varios modelos y conjuntos de datos, que muestran el peso relativo de las entradas de video (V), pregunta (Q) y respuesta (A). Los colores más fríos indican contribuciones más fuertes; los colores más cálidos indican influencia más débil o insignificante. En la mayoría de los ajustes, el lenguaje es claramente dominante, y el video a menudo se margina –especialmente en la influencia por fotograma.
En cuanto al texto, la pregunta tendía a importar más que la respuesta, particularmente en los modelos más fuertes. Esto fue más obvio en conjuntos de datos como EgoSchema, donde las preguntas eran más largas y naturalistas, mientras que las respuestas eran cortas y a veces esquemáticas. MVBench invirtió esto un poco, ya que su estructura de respuesta binaria infla la importancia aparente de los tokens de respuesta.
A través de todos los modelos y conjuntos de datos, sin embargo, la visión se marginó consistentemente, y el lenguaje hizo la mayor parte del trabajo pesado.
El artículo establece:
‘[Para] los modelos de contexto largo, el video muestra contribuciones vastamente reducidas, lo que significa que los valores de Shapley por fotograma son mucho más pequeños que sus contrapartes de características de texto.
‘El video como una modalidad en su conjunto es claramente aún muy relevante, pero esto es evidencia de que los valores de Shapley de sus fotogramas individuales están más centrados alrededor de cero, y que la atención del modelo a ellos es mucho menos guiada que para el texto.’
Para probar cómo cada parte de la entrada (video, texto, etc.) contribuye a la precisión del modelo, los investigadores realizaron pruebas adicionales utilizando enmascaramiento –ocultando deliberadamente una o más partes de la entrada y viendo cuánto cambia la precisión del modelo como resultado.
Si el rendimiento disminuye bruscamente cuando se elimina una entrada en particular, esa entrada probablemente es importante; si el modelo actúa más o menos de la misma manera, sugiere que la pieza faltante no se utilizó en gran medida. En este sentido, las pruebas de enmascaramiento son una especie de estudio de ablación iterativo.

Impacto del rendimiento de enmascaramiento de video, pregunta o respuesta en cuatro benchmarks de VQA. Las puntuaciones muestran el cambio desde la línea de base sin enmascaramiento. El rojo significa menor precisión, el verde mayor. Los modelos a menudo conservaron puntuaciones altas sin video, pero perdieron más cuando se eliminó la respuesta (texto).
Los resultados (visualizados arriba) indican que las respuestas (respuestas de texto en los datos de múltiple opción) llevan el peso más pesado en todas partes. Enmascarar la respuesta generalmente causó la mayor caída en la precisión, a menudo reduciendo los modelos a un rendimiento casi aleatorio.
Sin embargo, enmascarar la pregunta generalmente tuvo mucho menos efecto, lo que respalda el hallazgo anterior de que los modelos a menudo subestiman la pregunta.
En algunos casos, la precisión incluso mejoró cuando se eliminó la pregunta, lo que implica que los modelos a veces simplemente estaban emparejando respuestas con pistas visuales o textuales en lugar de evaluar adecuadamente la pregunta.
Los modelos también variaron en su dependencia del video: algunos mantuvieron una precisión razonable sin él, lo que confirmó aún más la contribución limitada de las características de video en muchos entornos actuales.
Los autores probaron posteriormente si los modelos podían ser obligados a confiar en el video agregando respuestas incorrectas adicionales a las opciones de múltiple opción.
Cuando los distractores eran fáciles y reciclados de otras preguntas, el rendimiento mejoró, ya que los modelos emparejaban patrones de texto sin mucha razón. Pero con diez o más respuestas no relacionadas, comenzaron a depender más del video y la pregunta:

Contribución por función y precisión para las entradas de video, pregunta y respuesta, a medida que se agregan respuestas incorrectas adicionales a cada prueba de VQA, mostrando que aumentar la cantidad de distractores reduce la dominancia del texto y aumenta la influencia relativa de las características visuales y de pregunta.
Para VideoLLaMA3, enmascarar el video redujo la precisión en un 40% en EgoSchema y un 15% en LVBench, lo que indica que un simple aumento en el recuento de respuestas puede alejar a los modelos de los atajos de texto y hacia una razón multimodal genuina.
Los investigadores también exploraron cómo se distribuye la atribución a través de las entradas, y a continuación vemos mapas de calor de valores de Shapley para cada entrada del modelo:

Mapas de calor de valores de Shapley para cuatro conjuntos de datos, donde cada fila muestra una tupla de VQA, y cada columna una característica individual. Las características de video aparecen a la izquierda, seguidas del texto. Los valores mucho más fuertes en las regiones de texto (rojo) confirman que los modelos confían mucho más en el lenguaje que en el video.
Al comentar los resultados anteriores, los autores declaran:
‘La magnitud de los valores de Shapley es mucho mayor hacia el lado derecho de cada mapa de calor, que representa las atribuciones de la pregunta y la respuesta. Este límite claro es donde terminan los fotogramas del video y comienzan las características del texto, demostrando que la contribución de la modalidad de video es mucho menor que la pregunta/respuesta. ‘
En resumen, en todos los conjuntos de datos, los valores son mucho más fuertes hacia el extremo del texto del espectro, lo que indica firmemente que los modelos confían mucho más en el lenguaje que en las pistas visuales. Incluso cuando el video se utiliza, la contribución se distribuye finamente a través de muchos fotogramas, a menudo sin un patrón coherente.
Debajo vemos un ejemplo anotado de EgoSchema. Se seleccionaron los 16 fotogramas más ‘importantes’ utilizando valores de Shapley y se colorearon según su influencia, con azul que indica una contribución positiva y rojo una negativa:

Atribuciones de Shapley para un ejemplo individual de EgoSchema, que muestra los 16 fotogramas más influyentes y todas las entradas de texto. Las contribuciones de video son mínimas en comparación con el texto, que domina el razonamiento del modelo. El azul y el rojo indican influencia positiva y negativa en la respuesta seleccionada.
El resultado es que casi todos los fotogramas tienen solo una influencia débil en comparación con las palabras en la pregunta y las respuestas. Las pistas visuales son escasas e inconsistentes, mientras que los sustantivos como ‘silla’ y ‘cerca’ dirigen al modelo hacia la elección correcta –o lejos de ella, dependiendo del contexto.
Conclusión
Cualquiera que haya participado en edición de video o análisis de video ya sabrá lo intensivo en recursos que son estos procesos, y entenderá por qué las empresas que analizan millones de solicitudes de IA al día no pueden permitirse permitir procesos de edición y análisis de video ad hoc e interpretativos que se ejecuten por parte de los usuarios.
Una cosa que recordar en este sentido es que casi cualquier interfaz de API de IA que intente (con la posible excepción de un demo nuevo y de corta duración en apoyo de una nueva investigación científica) está tratando de cumplir los deseos de los usuarios al nivel más bajo posible de gasto de recursos.
Eso significa confiar en los metadatos existentes de los datos suministrados por el usuario o recuperaciones de RAG, si es posible; y extraer (si es absolutamente necesario) metadatos para formatos más procesables como PDF, documentos y imágenes individuales.
Lo que no está en la mesa es ejecutar el video subido a través de CLIP o la última versión de YOLO, o a través de cualquier VLM que consuma mucha energía y tiempo, y que realmente pueda identificar qué hay en los fotogramas y comprender qué está sucediendo en el video suministrado, teniendo en cuenta la temporalidad.
Sin embargo, esto no significa que los fenómenos que documenta el artículo actual procedan necesariamente de enfoques arquitectónicos parsimoniosos. Los autores observan que el texto domina los paradigmas de entrenamiento multimodal de vanguardia en cualquier caso, lo que indica que el ‘lenguaje visual’ es menos desarrollado, menos importante o informativo dentro de un contexto multimodal, o (al menos por ahora) menos bien entendido,
* Interesantemente, el material que NotebookLM generó parece ser completamente original o totally no indexado por Google, ya que no puedo encontrar resultados que hayan podido infiltrarse en los datos de entrenamiento y provocar esta salida.
Publicado por primera vez el viernes 31 de octubre de 2025; editado a las 14:20 para el formato












