Ângulo de Anderson

Em Busca de um AI que Possa Seguir um Filme Inteiro

mm
Adicione Unite.AI às suas fontes preferidas no Google
AI-generated illustration (GPT-1.5) depicting a POV of a Steenbeck flatbed editing table as robot hands examine celluloid footage of a love scene from an old movie.

Os modelos de IA ainda perdem o rastreamento de quem é quem e o que está acontecendo em um filme. Um novo sistema orquestra o reconhecimento facial e a sumarização encenada, mantendo os personagens retos e as tramas coerentes em filmes de longa-metragem.

 

Obter inteligência artificial para assistir e entender filmes de estilo de Hollywood pode parecer uma busca marginal ou periférica; mas um sistema que possa assistir a um filme de longa-metragem do início ao fim, rastrear o progresso de todos os personagens e manter a trama, não apenas tornou possível uma série de aplicações diretas que poderiam se beneficiar dessas capacidades, mas também uma série de desafios periféricos ou não relacionados, em diferentes domínios.

O fruto mais fácil para os modelos de IA que assistem a filmes é o sistema de recomendação, em plataformas de streaming como Netflix, Amazon Prime e HBO Max. Uma compreensão granular do desenvolvimento da trama e das ações dos personagens permite uma correspondência mais próxima às preferências e entusiasmos dos espectadores.

Além disso, uma compreensão mais profunda de um filme permite a geração de palavras-chave e uma categorização mais precisa, em vez de perpetuar descrições de filmes frequentemente copiadas que podem ter sido escritas décadas atrás. Essas informações também podem revelar a presença de temas “adultos” em um filme que podem não ser óbvios a partir do diálogo ou das imagens.

Além disso, filmes mais antigos em um catálogo podem ter classificações e visões gerais desatualizadas; por exemplo, linguagem e expressões que eram normais em um filme de 1950 poderiam merecer mais atenção agora. Mas sem uma compreensão geral do contexto, extraída de uma narrativa de filme de longa-metragem, esses incidentes poderiam ser super ou subestimados.

De forma mais ampla, abordagens melhoradas de análise de filmes poderiam contribuir muito para o problema mais amplo do reconhecimento de eventos, que é vitalmente necessário para inovações em monitoramento de segurança, comentários esportivos automatizados e resumos de todos os tipos, em uma ampla gama de mídias.

Portanto, a “visualização de filmes baseada em IA” é um gênero surpreendentemente bem-assinado na literatura de Visão Computacional.

Vendo o Quadro Geral

O último entrante é intitulado MovieTeller – uma colaboração acadêmica/industrial da China que faz um novo progresso dividindo as tarefas em desafios específicos em aplicações de IA que atendem a esses desafios, em vez de – como é frequentemente o caso – tentar treinar modelos discretos e encapsulados que possam realizar todas as tarefas necessárias a partir de um espaço latente.

Os autores observam que os modelos de Visão-Linguagem anteriores (VLMs) que enfrentaram a mesma tarefa não conseguiram progredir muito além da análise de um único quadro; e que a falta de contexto torna difícil para esses modelos identificar persistentemente os personagens – talvez a característica mais essencial de um sistema:

O novo sistema, MovieTeller, é capaz de identificar persistentemente as pessoas em cenas, graças ao uso de um sistema de reconhecimento facial dedicado; mas é a dedicação mais abrangente ao contexto que permite que o framework mantenha a trama coerente. Fonte - https://arxiv.org/pdf/2602.23228

O novo sistema, MovieTeller, é capaz de identificar persistentemente as pessoas em cenas, graças ao uso de um sistema de reconhecimento facial dedicado; mas é a dedicação mais abrangente ao contexto que permite que o framework mantenha a trama coerente. Fonte

Os autores afirmam:

‘Os VLMs de propósito geral frequentemente lutam para reconhecer e rastrear consistentemente personagens específicos ao longo de uma narrativa longa. Eles podem descrever um protagonista-chave como “um homem” em uma cena e “uma pessoa” em outra, falhando em vincular a representação visual a uma identidade consistente.’

Os autores notam que, porque o mecanismo de auto-atendimento dos Transformers usa complexidade quadrática, processar todos os quadros de um filme de longa-metragem de uma vez se torna computacionalmente caro. Como resultado, as abordagens que dependem de amostragem de quadros uniforme ou concatenação simples tendem a quebrar o fluxo da história, produzindo resumos fragmentados em vez de uma narrativa coerente.

Em vez disso, o novo sistema compreende um pipeline de treinamento livre, com ferramentas dedicadas para abordar o reconhecimento facial e a persistência da memória (à medida que os personagens entram e saem da narrativa de um filme).

O MovieTeller foi testado contra abordagens anteriores usando 60 filmes de longa-metragem, equivalentes a 10.000 minutos de footage. Nos testes quantitativos de ablação e estudos humanos, os autores relatam que sua abordagem foi capaz de melhorar notavelmente os ambientes e suposições padrão usados por sistemas anteriores.

O novo artigo é intitulado MovieTeller: Ferramenta-aumentada de Sinopse de Filme com Abstração Progressiva Consistente com ID, e vem de cinco autores da Universidade de Zhejiang, em Hangzhou, o grupo de mídia estatal China Media Group e o Watch AI Group* (os dois últimos com sede em Pequim).

Método

O esquema do MovieTeller compreende três estágios: segmentação de cenas e extração de keyframes, que são tratados pelo PySceneDetect project; Geração de Descrição de Cena Baseada em Fatos via personalização do Qwen2.5-VL-7B-Instruct VLM; e abstração progressiva, que condensa descrições de cenas detalhadas em resumos de capítulos e, em seguida, em uma sinopse final coerente – e isso também é realizado pelo modelo Qwen2.5:

Visão geral do framework do MovieTeller: um filme de longa-metragem é primeiro segmentado em cenas e destilado em keyframes de alta qualidade; em seguida, uma ferramenta de reconhecimento facial externa injeta fundamentos factuais, vinculando nomes de personagens a caixas delimitadoras, que guiam um Modelo de Visão-Linguagem na produção de descrições de cenas consistentes com ID. Essas descrições são então progressivamente abstraidas em resumos de capítulos e integradas em uma sinopse final coerente do filme.

Visão geral do framework do MovieTeller: um filme de longa-metragem é primeiro segmentado em cenas e destilado em keyframes de alta qualidade; em seguida, uma ferramenta de reconhecimento facial externa injeta fundamentos factuais, vinculando nomes de personagens a caixas delimitadoras, que guiam um Modelo de Visão-Linguagem na produção de descrições de cenas consistentes com ID. Essas descrições são então progressivamente abstraidas em resumos de capítulos e integradas em uma sinopse final coerente do filme.

A etapa inicial usa o PySceneDetect para dividir o filme em cenas discretas, com base em mudanças visuais claras, com cada cena representada por um keyframe único.

No entanto, nem todos os quadros fazem uma boa imagem de resumo, pois momentos de transição, fade-outs e quadros escuros podem confundir a análise posterior. Portanto, uma verificação de qualidade simples executa uma execução de filtro em quadros candidatos, medindo a luminosidade e a variação visual, garantindo que apenas imagens ricas em informações sejam selecionadas para descrição.

Colocando o Rosto

Um banco de dados de rostos foi construído a partir de informações de elenco públicas, armazenando o nome de cada personagem principal ao lado de uma incrustação facial numérica. Quando um rosto aparece em um keyframe, sua incrustação é comparada com o banco de dados e o resultado mais próximo é aceito se ele atende a um limiar de confiança. Isso cria “fundamentações factuais”, vinculando nomes a caixas delimitadoras específicas.

Para esses fins, o InsightFace é usado, aproveitando uma cabeça de reconhecimento ArcFace baseada em perda:

Dois rostos familiares bem lembrados pela iniciativa Additive Angular Margin Loss (ArcFace), usada de uma maneira muito semelhante para o projeto MovieTeller. Fonte - https://www.youtube.com/watch?v=y-D1tReryGA&t=80s

Dois rostos familiares bem lembrados pela iniciativa Additive Angular Margin Loss (ArcFace), usada de uma maneira muito semelhante para o projeto MovieTeller. Fonte

Os keyframes anotados são então passados para o modelo Qwen com um prompt que lista os personagens detectados e suas posições.:

Como os Modelos de Visão-Linguagem não podem absorver um filme de longa-metragem em uma única passada, o MovieTeller inicialmente divide o material em descrições de cenas. Essas descrições são agrupadas em blocos consecutivos, semelhantes a capítulos, que são subsequentemente passados para o Qwen2.5, que resume cada capítulo, comprimindo desenvolvimentos da trama, motivações de personagens e pontos de inflexão, enquanto retém os nomes de personagens previamente verificados.

Esses resumos de capítulos comprimidos são então concatenados e devolvidos ao modelo com um novo prompt que solicita uma sinopse completa:

Um modelo de prompt usado para gerar descrições de cenas, injetando explicitamente nomes de personagens verificados e caixas delimitadoras para restringir o Modelo de Visão-Linguagem e impor uma narração consistente com ID.

Um modelo de prompt usado para gerar descrições de cenas, injetando explicitamente nomes de personagens verificados e caixas delimitadoras para restringir o Modelo de Visão-Linguagem e impor uma narração consistente com ID.

Supondo que o processo tenha sido bem-sucedido, a saída final deve refletir de forma coesa a narrativa do filme. Isso é uma tarefa particularmente difícil em aprendizado de máquina, pois a variedade de resumos de trama possíveis e o estilo em que eles podem ser apresentados, juntamente com o comprimento necessário desses pontos de dados, torna quase impossível adotar as abordagens comuns baseadas em ground truth.

Dados e Testes

Para testar o sistema, os autores criaram um conjunto de dados personalizado (e não atribuído) de 100 filmes de longa-metragem, equivalentes a cerca de 166 horas de tempo de execução. Os filmes incluíam Homem de Ferro 3, Adeus, Minha Concubina, Comer, Beber, Homem, Mulher e As Crônicas de Gelo e Fogo. Os pesquisadores exigiram que todos os filmes incluídos tivessem uma classificação acima de 5,0 no IMDB:

Composição do conjunto de dados em 100 filmes, mostrando cobertura temporal balanceada de 1992 a 2025, uma maioria ligeira de títulos não em inglês e uma ampla gama de gêneros liderada por Drama e Ação, com representação em Ficção Científica, Terror, Comédia, Romance e História.

Composição do conjunto de dados em 100 filmes, mostrando cobertura temporal balanceada de 1992 a 2025, uma maioria ligeira de títulos não em inglês e uma ampla gama de gêneros liderada por Drama e Ação, com representação em Ficção Científica, Terror, Comédia, Romance e História.

A ampla gama de gêneros abordados (ver gráfico acima) foi projetada para evitar viés em direção a um gênero específico.

O conjunto de dados de rostos para cada filme consistia em duas fotos de atores principais – uma de uma foto de filme e outra de uma foto de publicidade relacionada.

Implementado em Python, os testes foram executados em quatro GPUs NVIDIA A40, cada uma com 48GB de VRAM, e com o modelo Qwen2.5 como o VLM central. Estudos de ablação†† também foram realizados com modelos de estado da arte alternativos InternVL3-8B e WeThink-Qwen2.5VL-7B.

O novo framework foi testado contra duas variantes de ablação††: uma linha de base Sem Dica, na qual o Modelo de Visão-Linguagem gerou descrições de cenas a partir do keyframe apenas, sem quaisquer dicas textuais sobre identidades de personagens; e uma configuração Dica de Nome Somente, na qual o modelo foi dado os nomes de personagens detectados, mas não as caixas delimitadoras, permitindo que os autores isolassem a contribuição específica do aterramento espacial para a consistência de identidade e a coerência da narrativa

Em relação às métricas, considerando a dificuldade de aplicar métodos baseados em ground truth a resumos de trama longos, as métricas de sobreposição de n-grama padrão, como ROUGE e BLEU, foram evitadas em favor da BERTScore com F1 score, para medir a semelhança semântica contra uma sinopse de referência extraída de ‘uma enciclopédia pública’.

Além disso, o Gemini 2.5 Flash foi usado para pontuar cada sinopse para fidelidade factual; consistência e completude de ID; coerência e fluxo da narrativa; e concisão, com pontuações médias em todas as dimensões.

Finalmente, uma avaliação humana de 50 resumos aleatoriamente amostrados foi realizada usando comparação por pares, fornecendo uma verificação prática das avaliações automatizadas.

Abaixo, vemos os resultados da BERTScore (F1) para os três modelos de backbone: Qwen2.5-VL, InternVL3 e WeThink. Cada um é testado em três configurações: Sem Dica, Dica de Nome Somente e o sistema MovieTeller completo:

Comparações da BERTScore (F1) em três Modelos de Visão-Linguagem de base e três configurações experimentais, mostrando ganhos consistentes ao adicionar nomes de personagens e melhorias adicionais quando o aterramento espacial é incluído, com o MovieTeller alcançando as pontuações mais altas em todos os casos.

Comparações da BERTScore (F1) em três Modelos de Visão-Linguagem de base e três configurações experimentais, mostrando ganhos consistentes ao adicionar nomes de personagens e melhorias adicionais quando o aterramento espacial é incluído, com o MovieTeller alcançando as pontuações mais altas em todos os casos.

Os autores observam que o padrão é consistente em todos os três modelos de backbone: usar apenas o keyframe bruto produz o desempenho mais fraco; adicionar nomes de personagens produz uma melhoria modesta; e combinar nomes com caixas delimitadoras entrega os resultados mais fortes. Embora os ganhos sejam incrementais em vez de dramáticos, a configuração totalmente aterrada alcança a maior alinhamento semântico com a sinopse de referência, em todos os cenários.

Em relação à avaliação de qualidade de narrativa baseada em LLM: como vemos nos resultados abaixo, a linha de base Sem Dica luta mais com a consistência de identidade, o que puxa para baixo sua pontuação geral; mas fornecer nomes apenas produz um aumento notável, particularmente em dimensões relacionadas à identidade. No entanto, a configuração MovieTeller completa novamente ocupa o primeiro lugar em todos os três modelos de backbone:

Avaliação do LLM como juiz (escala de 1 a 5) em três modelos de base, mostrando que adicionar nomes de personagens melhora a consistência de identidade e a qualidade geral, enquanto o framework MovieTeller completo alcança as pontuações mais altas em fidelidade factual, coerência, concisão e classificação final.

Avaliação do LLM como juiz (escala de 1 a 5) em três modelos de base, mostrando que adicionar nomes de personagens melhora a consistência de identidade e a qualidade geral, enquanto o framework MovieTeller completo alcança as pontuações mais altas em fidelidade factual, coerência, concisão e classificação final.

Os ganhos mais fortes aparecem na consistência de ID e na pontuação final média, sugerindo que o aterramento espacial ajuda o modelo a manter a clareza sobre quem está fazendo o quê à medida que a trama se desenrola.

Na avaliação humana de 50 resumos aleatoriamente amostrados, os participantes foram mostrados três resumos de cada vez e solicitados a selecionar o melhor:

Taxas de preferência humana em uma avaliação por comparação forçada de três vias, mostrando que os resumos MovieTeller completamente aterrados são selecionados com mais frequência em todos os três modelos de base, superando significativamente as variantes Sem Dica e Dica de Nome Somente.

Taxas de preferência humana em uma avaliação por comparação forçada de três vias, mostrando que os resumos MovieTeller completamente aterrados são selecionados com mais frequência em todos os três modelos de base, superando significativamente as variantes Sem Dica e Dica de Nome Somente.

Finalmente, um teste qualitativo foi realizado no filme O Desaparecimento da Bala (2012):

Não podemos reproduzir a totalidade dessa figura do artigo original, pois é muito alta e densa em texto. Por favor, consulte o artigo original em vez disso.

Não podemos reproduzir a totalidade dessa figura do artigo original, pois é muito alta e densa em texto. Por favor, consulte o artigo original em vez disso.

Aqui, a linha de base Sem Dica produz uma sinopse vaga que se refere a personagens em termos genéricos e confunde seus papéis, tornando a cadeia de eventos mais difícil de seguir. Fornecer nomes apenas melhora a lembrança superficial, mas a narrativa ainda se desvia, com as relações e motivações dos personagens descritas de uma maneira mais “achatada”.

Por outro lado, a versão MovieTeller completamente aterrada mantém as identidades estáveis ao longo da sinopse e vincula ações aos personagens certos, permitindo que a trama de investigação se desenrole com uma estrutura causal mais clara. Tensões e dinâmicas de papéis específicas são preservadas em vez de abstraídas, resultando em um resumo que lê menos como um esboço desconectado e mais como uma recontagem coerente do arco central do filme:

Parte da comparação final, que não podemos reproduzir aqui em sua totalidade, mostrando uma sinopse abalada e uma sinopse MovieTeller completa. Por favor, consulte o artigo original em vez disso.

Parte da comparação final, que não podemos reproduzir aqui em sua totalidade, mostrando uma sinopse abalada e uma sinopse MovieTeller completa. Por favor, consulte o artigo original em vez disso.

Conclusão

Embora a maioria dos novos projetos desse tipo termine na literatura de Visão Computacional, a geração de resumos de filmes baseada em IA abrange muitas outras disciplinas e domínios em pesquisa de aprendizado de máquina – e é difícil dizer qual delas contribuirá involuntariamente com a peça que falta do quebra-cabeça; embora o MovieTeller dê um passo na direção certa, dividindo as tarefas em módulos apropriados em vez de tentar resolver tudo discretamente no espaço latente, ele retém o sentimento de “montado” que tende a preceder uma solução mais elegante posterior.

 

* Não consigo identificar essa instituição, mesmo após alguma busca.

Algo como o IMDB ou OMDB, mas a fonte não é especificada.

†† Por favor, consulte o artigo original para uma ablação abrangente, pois apenas cobrimos a ablação completa em casos excepcionais. Observo que os estudos de ablação não tratados mencionados aqui não comprometem as descobertas gerais do artigo.

Publicado pela primeira vez na sexta-feira, 27 de fevereiro de 2026

Escritor em aprendizado de máquina, especialista em síntese de imagem humana. Antigo chefe de conteúdo de pesquisa da Metaphysic.ai, até sua dissolução na Brahma.ai da DNEG.
Portfolio site: martinanderson.ai
Contato: martin@martinanderson.ai