Ángulo de Anderson

En busca de un IA que pueda seguir una película completa

mm
AÃąade Unite.AI a tus fuentes preferidas en Google
AI-generated illustration (GPT-1.5) depicting a POV of a Steenbeck flatbed editing table as robot hands examine celluloid footage of a love scene from an old movie.

Los modelos de IA aÚn pierden la pista de quiÃĐn es quiÃĐn y quÃĐ estÃĄ sucediendo en una película. Un nuevo sistema orquesta el reconocimiento facial y la resumen de escenas, manteniendo a los personajes rectos y las tramas coherentes a lo largo de películas de larga duraciÃģn.

 

Lograr que la inteligencia artificial vea y comprenda películas al estilo de Hollywood puede parecer una tarea marginal o menor; pero un sistema que pueda ver una película de larga duraciÃģn desde el principio hasta el final, seguir el progreso de todos los personajes y mantenerse al tanto de la trama, ha hecho posible una serie de aplicaciones directas que podrían beneficiarse de dichas capacidades, así como algunos desafíos perifÃĐricos o no relacionados, en diferentes dominios.

La fruta fÃĄcil para los modelos de IA que ven películas es los sistemas de recomendaciÃģn, en plataformas de streaming como Netflix, Amazon Prime y HBO Max. Una comprensiÃģn detallada de los desarrollos de la trama y las acciones de los personajes permite una coincidencia mÃĄs cercana con las (a menudo especiosas) preferencias y entusiasmos de los espectadores.

AdemÃĄs, una comprensiÃģn mÃĄs profunda de una película permite la generaciÃģn de palabras clave y una categorizaciÃģn mÃĄs precisa, en lugar de perpetuar descripciones de películas que pueden haber sido escritas dÃĐcadas atrÃĄs. Estas ideas tambiÃĐn podrían destacar la presencia de temas “adultos” en una película que no sean obvios por el diÃĄlogo o las imÃĄgenes.

AdemÃĄs, las películas mÃĄs antiguas en un catÃĄlogo pueden tener calificaciones y resÚmenes obsoletos; por ejemplo, el lenguaje y los modismos que se normalizaron en una película de los aÃąos 50 podrían requerir mucha mÃĄs atenciÃģn ahora. Pero sin una comprensiÃģn general del contexto, obtenida de seguir realmente una narrativa de película larga, dichos incidentes podrían ser sobreestimados o subestimados.

MÃĄs ampliamente, los enfoques mejorados de anÃĄlisis de películas podrían contribuir en gran medida al problema mÃĄs amplio del reconocimiento de eventos, que es vitalmente necesario para innovaciones en la monitorizaciÃģn de seguridad, los comentarios deportivos automatizados y los resÚmenes de todo tipo, en una amplia gama de medios.

Por lo tanto, ‘la visualizaciÃģn de películas basada en IA’ es un gÃĐnero sorprendentemente bien suscrito en la literatura de VisiÃģn por Computadora.

Viendo el panorama general

El Último entrante se titula MovieTeller – una colaboraciÃģn acadÃĐmica-industrial de China que hace nuevos avances al dividir las diversas subtareas del desafío en varias aplicaciones de IA que se adaptan a estos desafíos, en lugar de – como suele ser el caso – intentar entrenar modelos discretos y encapsulados que puedan realizar todas las tareas necesarias desde un espacio latente Único.

Los autores observan que los modelos de VisiÃģn-Lenguaje anteriores (VLM) que se enfrentaron a la misma tarea no han podido avanzar mucho mÃĄs allÃĄ del anÃĄlisis de un solo marco; y que su falta de contexto hace que sea difícil para dichos modelos identificar persistentemente a los personajes – quizÃĄs la característica mÃĄs esencial de dicho sistema:

El nuevo sistema, MovieTeller, puede identificar persistentemente a las personas en escenas, gracias al uso de un sistema de reconocimiento facial dedicado; pero es la dedicaciÃģn mÃĄs general al contexto lo que permite al marco mantenerse al tanto de los desarrollos de la trama. Fuente - https://arxiv.org/pdf/2602.23228

El nuevo sistema, MovieTeller, puede identificar persistentemente a las personas en escenas, gracias al uso de un sistema de reconocimiento facial dedicado; pero es la dedicaciÃģn mÃĄs general al contexto lo que permite al marco mantenerse al tanto de los desarrollos de la trama. Fuente

Los autores afirman:

‘Los modelos de VisiÃģn-Lenguaje de propÃģsito general a menudo luchan por reconocer y rastrear consistentemente a personajes específicos a lo largo de una narrativa larga. Pueden describir a un protagonista clave como “un hombre” en una escena y “una persona” en otra, sin vincular la representaciÃģn visual a una identidad consistente.’

Los autores seÃąalan que, dado que el mecanismo de autoatenciÃģn de Transformers utiliza complejidad cuadrÃĄtica, procesar cada fotograma de una película de larga duraciÃģn al mismo tiempo se vuelve demasiado costoso en tÃĐrminos computacionales. Como resultado, los enfoques que dependen de la muestra de fotogramas uniforme o la concatenaciÃģn simple tienden a romper el flujo de la historia, produciendo resÚmenes fragmentados en lugar de una narrativa coherente.

En cambio, el nuevo sistema comprende una tubería de entrenamiento libre orquestada, con herramientas dedicadas para abordar el reconocimiento facial y la persistencia de la memoria (a medida que los personajes dejan y reingresan en la narrativa de una película).

MovieTeller se probÃģ contra enfoques anteriores utilizando 60 películas de larga duraciÃģn, equivalentes a 10.000 minutos de metraje. En pruebas de ablation cuantitativas y estudios humanos, los autores informan que su enfoque fue capaz de mejorar notablemente los entornos y suposiciones utilizados por sistemas anteriores.

El nuevo documento se titula MovieTeller: Resumen de película con progresiva abstracciÃģn y consistencia de ID, y proviene de cinco autores de la Universidad de Zhejiang en Hangzhou, el grupo de medios estatales de China y Watch AI Group* (los dos Últimos con sede en Pekín).

MÃĐtodo

El esquema de MovieTeller comprende tres etapas: segmentaciÃģn de escenas y extracciÃģn de fotogramas clave, que se manejan a travÃĐs del proyecto PySceneDetect; generaciÃģn de descripciones de escenas basadas en hechos a travÃĐs de la personalizaciÃģn del modelo VLM Qwen2.5-VL-7B-Instruct; y abstracciÃģn progresiva, que condensa las descripciones detalladas de las escenas en resÚmenes de capítulos y luego en un resumen coherente final – y esto tambiÃĐn se realiza mediante el modelo Qwen2.5:

VisiÃģn general del marco de MovieTeller: una película de larga duraciÃģn se segmenta primero en escenas y se destila en fotogramas clave de alta calidad; luego, una herramienta de reconocimiento facial externa inyecta fundamentos basados en hechos, vinculando nombres de personajes a cuadros delimitadores, que guían un modelo de VisiÃģn-Lenguaje para producir descripciones de escenas consistentes con la ID. Estas descripciones se abstraen luego progresivamente en resÚmenes de capítulos y se integran en un resumen coherente de la película.

VisiÃģn general del marco de MovieTeller: una película de larga duraciÃģn se segmenta primero en escenas y se destila en fotogramas clave de alta calidad; luego, una herramienta de reconocimiento facial externa inyecta fundamentos basados en hechos, vinculando nombres de personajes a cuadros delimitadores, que guían un modelo de VisiÃģn-Lenguaje para producir descripciones de escenas consistentes con la ID. Estas descripciones se abstraen luego progresivamente en resÚmenes de capítulos y se integran en un resumen coherente de la película.

La etapa inicial utiliza PySceneDetect para dividir la película en escenas discretas, basadas en cambios visuales claros, con cada escena representada por un solo fotograma clave.

Sin embargo, no todos los fotogramas son adecuados para un resumen de imagen, ya que los momentos de transiciÃģn, los desvanecimientos y los fotogramas oscuros pueden confundir el anÃĄlisis posterior. Por lo tanto, se realiza una verificaciÃģn de calidad simple en los fotogramas candidatos, midiendo el brillo y la variaciÃģn visual, asegurando que solo se seleccionen imÃĄgenes ricas en informaciÃģn para la descripciÃģn.

Colocando la cara

Se creÃģ una base de datos de caras a partir de informaciÃģn de reparto pÚblica†, almacenando el nombre de cada personaje principal junto con una incrustaciÃģn facial numÃĐrica. Cuando una cara aparece en un fotograma clave, su incrustaciÃģn se compara con la base de datos, y se acepta el resultado mÃĄs cercano si supera un umbral de confianza. Esto crea ‘fundamentos basados en hechos’, vinculando nombres a cuadros delimitadores específicos.

Para estos fines, se utiliza InsightFace, aprovechando una cabeza de reconocimiento ArcFace basada en pÃĐrdida:

Dos caras familiares bien recordadas por la iniciativa Additive Angular Margin Loss (ArcFace), utilizada de manera muy similar para el proyecto MovieTeller. Fuente - https://www.youtube.com/watch?v=y-D1tReryGA&t=80s

Dos caras familiares bien recordadas por la iniciativa Additive Angular Margin Loss (ArcFace), utilizada de manera muy similar para el proyecto MovieTeller. Fuente

Los fotogramas clave anotados se pasan luego al modelo Qwen con una llamada que enumera los personajes detectados y sus posiciones.:

Como los modelos de VisiÃģn-Lenguaje no pueden absorber una película de larga duraciÃģn de una sola vez, MovieTeller divide inicialmente el material en descripciones de escenas. Estas se agrupan en bloques consecutivos, similares a capítulos, que se pasan luego al modelo Qwen2.5, que resume cada capítulo, comprimiendo los desarrollos de la trama, las motivaciones de los personajes y los puntos de inflexiÃģn, mientras retiene los nombres de personajes verificados previamente.

Esos resÚmenes de capítulos comprimidos se concatenan y se devuelven al modelo con una nueva llamada que solicita un resumen completo:

Un modelo de llamada de ejemplo utilizado para generar descripciones de escenas, inyectando explícitamente nombres de personajes verificados y cuadros delimitadores para limitar el modelo de VisiÃģn-Lenguaje y hacer cumplir la narraciÃģn consistente con la ID.

Similar a la llamada que solicita un resumen completo, este modelo se utiliza para generar descripciones de escenas, inyectando explícitamente nombres de personajes verificados y cuadros delimitadores para limitar el modelo de VisiÃģn-Lenguaje y hacer cumplir la narraciÃģn consistente con la ID.

Asumiendo que el proceso ha tenido ÃĐxito, la salida final debería reflejar coherentemente el arco narrativo de la película. Esto es una tarea particularmente difícil en aprendizaje automÃĄtico, ya que la variedad de resÚmenes de trama posibles y el estilo en que podrían presentarse, junto con la longitud necesaria de estos puntos de datos, hace que sea casi imposible adoptar los enfoques habituales basados en la verdad fundamental.

Datos y pruebas

Para probar el sistema, los autores curaron un conjunto de datos personalizado (y no atribuido a una fuente) de 100 películas de larga duraciÃģn, equivalentes a aproximadamente 166 horas de tiempo de ejecuciÃģn. Las películas incluyeron Hombre de Hierro 3, AdiÃģs, mi concubina, Comer, beber, hombre, mujer y Las CrÃģnicas de Narnia. Los investigadores exigieron que todas las películas incluidas tuvieran una calificaciÃģn superior a 5,0 en IMDB:

ComposiciÃģn del conjunto de datos a lo largo de 100 películas, mostrando una cobertura temporal equilibrada desde 1992 hasta 2025, una ligera mayoría de títulos no en inglÃĐs y una amplia distribuciÃģn de gÃĐneros liderada por Drama y AcciÃģn, con representaciÃģn en Ciencia FicciÃģn, Terror, Comedia, Romance y Historia.

ComposiciÃģn del conjunto de datos a lo largo de 100 películas, mostrando una cobertura temporal equilibrada desde 1992 hasta 2025, una ligera mayoría de títulos no en inglÃĐs y una amplia distribuciÃģn de gÃĐneros liderada por Drama y AcciÃģn, con representaciÃģn en Ciencia FicciÃģn, Terror, Comedia, Romance y Historia.

El amplio rango de gÃĐneros abordados (ver grÃĄfico anterior) se diseÃąÃģ para evitar sesgos hacia algÚn gÃĐnero en particular.

El conjunto de datos de caras para cada película consistiÃģ en dos imÃĄgenes de actores principales – una de una imagen fija de la película y otra de una fotografía publicitaria relacionada.

Implementado en Python, las pruebas se ejecutaron en cuatro GPU NVIDIA A40, cada una con 48 GB de VRAM, y con la variante Qwen2.5 mencionada anteriormente como el modelo VLM central. TambiÃĐn se realizaron estudios de ablation†† con modelos alternativos de Última generaciÃģn InternVL3-8B y WeThink-Qwen2.5VL-7B.

El nuevo marco se probÃģ contra dos variantes de ablation††: una base sin pistas donde el modelo de VisiÃģn-Lenguaje generÃģ descripciones de escenas solo a partir del fotograma clave, sin pistas textuales sobre identidades de personajes; y una configuraciÃģn con nombres de personajes donde el modelo recibiÃģ los nombres de personajes detectados, pero no sus cuadros delimitadores, lo que permitiÃģ a los autores aislar la contribuciÃģn específica de la fundamentaciÃģn espacial a la coherencia de la identidad y la narrativa:

En cuanto a las mÃĐtricas, considerando la dificultad de aplicar mÃĐtodos de verdad fundamental a resÚmenes de trama largos, se evitaron las mÃĐtricas de superposiciÃģn de n-gramas estÃĄndar como ROUGE y BLEU en favor de BERTScore con puntuaciÃģn F1, para medir la similitud semÃĄntica contra un resumen de referencia extraído de ‘una enciclopedia pÚblica’.

AdemÃĄs, se utilizÃģ Gemini 2.5 Flash para puntuar cada resumen por su fidelidad factual; coherencia y completitud de la identidad; coherencia y flujo de la narrativa; y concisiÃģn, con puntuaciones promediadas en todas las dimensiones.

Finalmente, se realizÃģ una evaluaciÃģn humana de 50 resÚmenes muestreados aleatoriamente, donde los participantes vieron tres resÚmenes a la vez y se les pidiÃģ que seleccionaran el mejor:

Tasas de preferencia humana en una evaluaciÃģn de elecciÃģn forzada de tres vías, mostrando que los resÚmenes completamente fundamentados de MovieTeller se seleccionan con mÃĄs frecuencia en todos los modelos base, superando significativamente a las variantes sin pistas y con nombres de personajes.

Tasas de preferencia humana en una evaluaciÃģn de elecciÃģn forzada de tres vías, mostrando que los resÚmenes completamente fundamentados de MovieTeller se seleccionan con mÃĄs frecuencia en todos los modelos base, superando significativamente a las variantes sin pistas y con nombres de personajes.

Finalmente, se realizÃģ una prueba cualitativa en la película La bala desaparece (2012):

No podemos reproducir la totalidad de esta figura del documento original, ya que es muy alta y densa en texto. Por favor, refiÃĐrase al documento de origen en su lugar.

No podemos reproducir la totalidad de esta figura del documento original, ya que es muy alta y densa en texto. Por favor, refiÃĐrase al documento de origen en su lugar.

Aquí, la base sin pistas produce un resumen vago que se refiere a personajes en tÃĐrminos genÃĐricos y borra sus roles, haciendo que la cadena de eventos sea mÃĄs difícil de seguir. Proporcionar nombres solamente mejora la memoria superficial, pero la narrativa todavía se desvía, con las relaciones y motivaciones de los personajes descritas de manera bastante ‘aplanada’.

Por el contrario, la versiÃģn completamente fundamentada de MovieTeller mantiene las identidades estables a lo largo del resumen y vincula las acciones a los personajes correctos, permitiendo que la trama de investigaciÃģn se desarrolle con una estructura causal mÃĄs clara. Las tensiones y dinÃĄmicas de roles específicas se conservan en lugar de ser abstractas, lo que da como resultado un resumen que se lee menos como un esquema desconectado y mÃĄs como una narraciÃģn coherente del arco central de la película:

Parte de la comparaciÃģn final, que no podemos reproducir en su totalidad aquí, mostrando un resumen de MovieTeller ablatado y completo. Por favor, refiÃĐrase al documento de origen en su lugar.

Parte de la comparaciÃģn final, que no podemos reproducir en su totalidad aquí, mostrando un resumen de MovieTeller ablatado y completo. Por favor, refiÃĐrase al documento de origen en su lugar.

ConclusiÃģn

Aunque la mayoría de los nuevos proyectos de este tipo terminan en la literatura de VisiÃģn por Computadora, la generaciÃģn de resÚmenes de películas basada en IA abarca muchas otras disciplinas y dominios en la investigaciÃģn de aprendizaje automÃĄtico – y es difícil decir cuÃĄl de estos contribuirÃĄ inadvertidamente con la pieza que falta del rompecabezas; aunque MovieTeller da un paso en la direcciÃģn correcta al dividir las tareas en mÃģdulos apropiados en lugar de intentar resolverlo todo discretamente en el espacio latente, conserva la sensaciÃģn de ‘armado’ que tiende a preceder a una soluciÃģn mÃĄs elegante posterior.

 

* No puedo identificar esta instituciÃģn, incluso despuÃĐs de buscar un poco.

† Uno supondría algo como IMDB o OMDB, pero la fuente no se especifica.

†† Por favor, refiÃĐrase al documento de origen para una ablation completa, ya que solo cubrimos la ablation completa en casos excepcionales. Quiero seÃąalar que los estudios de ablation no tratados mencionados aquí no socavan los hallazgos generales del documento.

Publicado por primera vez el viernes 27 de febrero de 2026

Escritor sobre aprendizaje automÃĄtico, especialista en síntesis de imÃĄgenes humanas. Antiguo jefe de contenido de investigaciÃģn en Metaphysic.ai, hasta su disoluciÃģn en DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]