Andersons vinkel

PÃĨ leting etter en AI som kan fÃļlge en hel film

mm
Legg til Unite.AI blant dine foretrukne kilder pÃĨ Google
AI-generated illustration (GPT-1.5) depicting a POV of a Steenbeck flatbed editing table as robot hands examine celluloid footage of a love scene from an old movie.

AI-modeller mister fortsatt spor av hvem som er hvem og hva som skjer i en film. Et nytt system orchestrerer ansiktsgjenkjenning og iscenesatt sammenfatting, holder karakterene rette, og plottet koherent over hele filmer.

 

Å fÃĨ kunstig intelligens til ÃĨ se og forstÃĨ Hollywood-stil filmer kan synes som en nisje eller perifer oppgave, men et system som kan se en hel film fra begynnelsen til slutten, spore fremgangen til alle karakterene, og holde pÃĨ plottet, har ikke bare gjort det mulig ÃĨ bruke direkte applikasjoner som kan dra nytte av slike evner, men ogsÃĨ en del perifere eller ubeslektede utfordringer, over forskjellige domener.

De letteste fruktene for film-seende AI-modeller er anbefalingsystemer, pÃĨ strÃļmmingtjenester som Netflix, Amazon Prime og HBO Max. En detaljert forstÃĨelse av plottutviklinger og karakterhandlinger gjÃļr det mulig ÃĨ finne en nÃĶrmere match til (ofte tvilsomme) preferanser og entusiasmer hos seerne.

I tillegg kan en dypere forstÃĨelse av en film muliggjÃļre nÃļkkelordsgenerering og mer nÃļyaktig kategorisering, i stedet for ÃĨ videreformidle ofte kopierte film beskrivelser som kan ha blitt skrevet for mange ÃĨr siden. Slike innsikter kan ogsÃĨ avdekke tilstedevÃĶrelsen av “voksne” temaer i en film som ikke er ÃĨpenbart fra dialogen eller visuelt.

I tillegg kan eldre filmer i en katalog ha foreldede vurderinger, samt oversikter; for eksempel kan sprÃĨk og idiom som var normalisert i en film fra 1950-ÃĨrene krevde mye mer oppmerksomhet nÃĨ. Men uten en helhetlig forstÃĨelse av konteksten, hentet fra ÃĨ faktisk fÃļlge en lang film-narrativ, kunne slike hendelser bli over- eller under-betont.

Mer generelt kan forbedrede film-analyse-tilnÃĶrminger bidra mye til det mye videre-rangerte problemet med hendelses-gjenkjenning, som er livsviktig for innovasjoner i sikkerhets-overvÃĨking, automatiserte sports-kommentarer og sammenfatninger av alle slag, over en stor rekke medier.

Derfor er ‘AI-basert film-seing’ en overraskende godt-subskribert sjanger i Computer Vision-litteraturen.

Å se det store bildet

Den nyeste deltakeren heter MovieTeller – et akademisk/industri-samarbeid fra Kina som gjÃļr nye fremskritt ved ÃĨ dele opp de forskjellige under-oppdragene i utfordringen over forskjellige AI-applikasjoner som passer disse utfordringene, i stedet for – som ofte er tilfelle – ÃĨ forsÃļke ÃĨ trene diskrete og innkapslede modeller som kan utfÃļre alle nÃļdvendige oppgaver fra ett latent rom.

Forfatterne observerer at tidligere Vision-Language-modeller (VLMs) som ble konfrontert med samme oppgave, ikke har klart ÃĨ gÃĨ mye lengre enn enkelt-ramme-analyse; og at deres mangel pÃĨ kontekst gjÃļr det vanskelig for slike modeller ÃĨ bestandig identifisere karakterer – kanskje den viktigste egenskapen til et slikt system:

Det nye systemet, MovieTeller, kan bestandig identifisere personer i scener, takket vÃĶre bruk av et dedikert ansiktsgjenkjenningssystem; men det er den mer overordnede dedikasjonen til kontekst som gjÃļr at rammeverket kan holde pÃĨ plottutviklingen. Kilde - https://arxiv.org/pdf/2602.23228

Det nye systemet, MovieTeller, kan bestandig identifisere personer i scener, takket vÃĶre bruk av et dedikert ansiktsgjenkjenningssystem; men det er den mer overordnede dedikasjonen til kontekst som gjÃļr at rammeverket kan holde pÃĨ plottutviklingen. Kilde

Forfatterne skriver:

‘Generiske VLMs har ofte vanskelig for ÃĨ gjenkjenne og bestandig spore bestemte karakterer gjennom en lang narrativ. De kan beskrive en nÃļkkel-protagonist som “en mann” i en scene og “en person” i en annen, uten ÃĨ binde den visuelle representasjonen til en konsistent identitet.’

Forfatterne bemerker at fordi Transformers‘ selv-oppmerksomhets-mekanisme bruker kvadratisk kompleksitet, blir behandling av hver ramme i en hel film pÃĨ en gang for dyrt. Derfor tenderer tilnÃĶrminger som avhenger av uniform ramme-ampling eller enkel konkatenering til ÃĨ bryte opp flyten i historien, og produsere fragmenterte sammenfatninger i stedet for en koherent narrativ.

I stedet bestÃĨr det nye systemet av en orkestrert, trening-fri pipeline, med dedikerte verktÃļy for ÃĨ hÃĨndtere ansiktsgjenkjenning og bestandig minne (slik at karakterer kan forlate og returnere til narrativet i en film).

MovieTeller ble testet mot tidligere tilnÃĶrminger ved hjelp av 60 hele filmer, tilsvarende 10 000 minutters film. I kvantitative ablasjonstester og menneske-studier, rapporterte forfatterne at deres tilnÃĶrmning var i stand til ÃĨ forbedre seg betydelig pÃĨ de standard-miljÃļene og antagelsene som ble brukt av tidligere systemer.

Den nye artikkelen heter MovieTeller: Tool-augmented Movie Synopsis med ID-konsistent Progressiv Abstraksjon, og kommer fra fem forfattere over Zhejiang University i Hangzhou, den statlige ledede China Media Group, og Watch AI Group* (de to siste basert i Beijing).

Metode

MovieTeller-skjemaet bestÃĨr av tre stadier: scene-segmentering og nÃļkkel-ramme-ekstraksjon, som hÃĨndteres gjennom PySceneDetect-prosjektet; Faktisk-grunnlagt Scene-beskrivelse-generering via tilpasning av Qwen2.5-VL-7B-Instruct-VLM; og progressiv abstraksjon, som kondenserer detaljerte scene-beskrivelser til kapittel-sammenfatninger, og deretter til en koherent synopsis – og dette blir ogsÃĨ utfÃļrt av Qwen2.5-modellen:

Oversikt over MovieTeller-rammeverket: en hel film blir fÃļrst segmentert i scener og destillert til hÃļykvalitets-nÃļkkel-rammer; deretter injiseres faktiske grunnlag via en ekstern ansiktsgjenkjenning-verktÃļy, som linker karakter-navn til avgrensning-bokser, som guidere en Vision-Language-Model i ÃĨ produsere ID-konsistente scene-beskrivelser. Disse beskrivelsene blir deretter progressivt abstrahert til kapittel-sammenfatninger og integrert i en koherent film-synopsis.

Oversikt over MovieTeller-rammeverket: en hel film blir fÃļrst segmentert i scener og destillert til hÃļykvalitets-nÃļkkel-rammer; deretter injiseres faktiske grunnlag via en ekstern ansiktsgjenkjenning-verktÃļy, som linker karakter-navn til avgrensning-bokser, som guidere en Vision-Language-Model i ÃĨ produsere ID-konsistente scene-beskrivelser. Disse beskrivelsene blir deretter progressivt abstrahert til kapittel-sammenfatninger og integrert i en koherent film-synopsis.

Den fÃļrste fasen bruker PySceneDetect til ÃĨ bryte filmen opp i diskrete scener, basert pÃĨ klare visuelle endringer, med hver scene representert av en enkelt nÃļkkel-ramme.

Men ikke hver enkelt ramme gjÃļr en god sammenfattnings-bilde, siden overgangs-momenter, fade-outer og mÃļrke-rammer kan forvirre senere analyse. Derfor utfÃļres en enkel kvalitets-sjekk pÃĨ kandidat-rammer, ved ÃĨ mÃĨle lysstyrke og visuell variasjon, og sikre at bare informasjons-rike bilder blir valgt for beskrivelse.

Plassering av ansiktet

En ansikt-database ble bygget fra offentlig tilgjengelig cast-informasjon†, som lagrer hver hovedkarakters navn sammen med et numerisk ansikt innkapsling. NÃĨr et ansikt vises i en nÃļkkel-ramme, blir innkapslingen sammenlignet med databasen, og den nÃĶrmeste resultatet akseptert hvis den klarer en tillit-grense. Dette skaper ‘faktiske grunnlag’, som linker navn til bestemte avgrensning-bokser.

For disse formÃĨlene, blir InsightFace brukt, som utnytter en ArcFace-basert gjenkjenning-hode:

To kjente ansikter godt husket av Additive Angular Margin Loss (ArcFace)-initiativet, brukt pÃĨ en lignende mÃĨte for MovieTeller-prosjektet. Kilde - https://www.youtube.com/watch?v=y-D1tReryGA&t=80s

To kjente ansikter godt husket av Additive Angular Margin Loss (ArcFace)-initiativet, brukt pÃĨ en lignende mÃĨte for MovieTeller-prosjektet. Kilde

De annoterte nÃļkkel-rammene blir deretter sendt til Qwen-modellen med en prompt som listar opp detekterte karakterer og deres posisjoner.

Siden Vision-Language-modeller ikke kan absorbere en hel film pÃĨ en gang, bryter MovieTeller opp materialet i scene-beskrivelser. Disse blir gruppert i pÃĨfÃļlgende, kapittel-lignende blokker, som deretter blir sendt til Qwen2.5, som sammenfatter hver kapittel, komprimerer plottutviklinger, karakter-motivasjoner og vendinger, mens den beholder de tidligere verifiserte karakter-navnene.

Disse komprimerte kapittel-sammenfatningene blir deretter koblet sammen og returnert til modellen med en ny prompt som ber om en fullstendig synopsis:

Et eksempel pÃĨ en prompt-mal som brukes til ÃĨ generere scene-beskrivelser, som injiserer verifiserte karakter-navn og avgrensning-bokser for ÃĨ begrense Vision-Language-modellen og pÃĨtvinge ID-konsistent fortelling.

Et eksempel pÃĨ en prompt-mal som brukes til ÃĨ generere scene-beskrivelser, som injiserer verifiserte karakter-navn og avgrensning-bokser for ÃĨ begrense Vision-Language-modellen og pÃĨtvinge ID-konsistent fortelling.

Data og tester

For ÃĨ teste systemet, kuraterte forfatterne en spesiallaget (og ukreditert) datasett pÃĨ 100 hele filmer, tilsvarende 166 timers spilletid. Filmene inkluderte Jernmann 3, Farvel, min elskede, Spis, drik, mann, kvinne og Det hemmelige landet. Forskerne krevde at alle inkluderte filmer skulle ha en vurdering over 5,0 pÃĨ IMDB:

Datasetts sammensetning over 100 filmer, som viser en balansert tidsmessig dekning fra 1992 til 2025, en liten majoritet av ikke-engelske titler, og en bred sjanger-spreidning ledet av Drama og Action, med representasjon over Sci-Fi, Horror, Komedie, Romantikk og Historie.

Datasetts sammensetning over 100 filmer, som viser en balansert tidsmessig dekning fra 1992 til 2025, en liten majoritet av ikke-engelske titler, og en bred sjanger-spreidning ledet av Drama og Action, med representasjon over Sci-Fi, Horror, Komedie, Romantikk og Historie.

Den brede sjanger-spreidningen var designet for ÃĨ forhindre bias mot en bestemt sjanger.

Ansikt-databasen for hver film bestod av to bilder av hovedkarakterer – ett fra en film-still, og ett fra en relatert promotering-fotografi.

Implementert i Python, ble testene kjÃļrt over fire NVIDIA A40-GPU-er, hver med 48 GB VRAM, og med den ovennevnte Qwen2.5-varianten som den sentrale VLM. Ablasjon-studier†† ble ogsÃĨ utfÃļrt med alternativt state-of-the-art-modeller InternVL3-8B og WeThink-Qwen2.5VL-7B.

Det nye rammeverket ble testet mot to ablasjon††-varianter: en No-Hint-baselinje, hvor Vision-Language-modellen genererte scene-beskrivelser fra nÃļkkel-rammen alene, uten noen tekstlige hint om karakter-identiteter; og en Name-Only Hint-innstilling, hvor modellen ble gitt detekterte karakter-navn, men ikke deres avgrensning-bokser, som tillot forfatterne ÃĨ isolere den spesifikke bidraget fra romlig grunnlag til identitets-konsistens og narrativ koherens

I forhold til metrikker, ble standard n-gram-overlapp-metrikker som ROUGE og BLEU forkastet til fordel for BERTScore med F1-score, for ÃĨ mÃĨle semantisk likhet mot en referanse-sammenfatning trukket fra ‘en offentlig encyklopedi’.

OgsÃĨ ble Gemini 2.5 Flash brukt til ÃĨ score hver sammenfatning for faktisk trofasthet; ID-konsistens og fullstendighet; narrativ koherens og flyt; og korthet, med poeng gjennomsnittlig over dimensjoner.

Til slutt ble en menneskelig evaluering av 50 tilfeldig utvalgte sammenfatninger utfÃļrt ved hjelp av parvis sammenligning, som ga en praktisk sjekk pÃĨ de automatiserte vurderingene.

Nedenfor ser vi BERTScore (F1)-resultater for de tre backbone-modellene: Qwen2.5-VL, InternVL3 og WeThink. Hver av dem ble testet i tre konfigurasjoner: No-Hint, Name-Only og det fullstendige MovieTeller-systemet:

BERTScore (F1)-sammenligning over tre basis-Vision-Language-modeller og tre eksperimentelle innstillinger, som viser konsistente gevinster fra ÃĨ legge til karakter-navn og ytterligere forbedringer nÃĨr romlig grunnlag er inkludert, med MovieTeller som oppnÃĨr de hÃļyeste poengene i alle tilfeller.

BERTScore (F1)-sammenligning over tre basis-Vision-Language-modeller og tre eksperimentelle innstillinger, som viser konsistente gevinster fra ÃĨ legge til karakter-navn og ytterligere forbedringer nÃĨr romlig grunnlag er inkludert, med MovieTeller som oppnÃĨr de hÃļyeste poengene i alle tilfeller.

Forfatterne bemerker at mÃļnsteret er konsistent over alle tre backbone-modellene: ÃĨ bruke bare den rÃĨ nÃļkkel-rammen gir den svakeste ytelsen; ÃĨ legge til karakter-navn produserer en beskjeden forbedring; og ÃĨ kombinere navn med avgrensning-bokser gir de sterkeste resultater. Selv om gevinstene er inkrementelle og ikke dramatiske, oppnÃĨr den fullstendig grunnlagte konfigurasjonen de hÃļyeste semantiske sammenfallene med referanse-sammenfatningen i alle innstillinger.

I forhold til LLM-basert evaluering av narrativ kvalitet: som vi ser i resultater nedenfor, har No-Hint-baselinjen vanskeligheter med identitets-konsistens, som trekker ned dens totale poeng; men ÃĨ levere navn alene produserer en merkbart lÃļft, spesielt pÃĨ identitets-relaterte dimensjoner. Imidlertid oppnÃĨr det fullstendige MovieTeller-rammeverket de hÃļyeste poengene over alle tre backbone-modellene:

LLM-as-a-Judge-vurdering (1–5-skala) over tre basis-modeller, som viser at ÃĨ legge til karakter-navn forbedrer identitets-konsistens og total kvalitet, mens det fullstendige MovieTeller-rammeverket oppnÃĨr de hÃļyeste poengene over faktisk trofasthet, koherens, korthet og sluttvurdering.

LLM-as-a-Judge-vurdering (1–5-skala) over tre basis-modeller, som viser at ÃĨ legge til karakter-navn forbedrer identitets-konsistens og total kvalitet, mens det fullstendige MovieTeller-rammeverket oppnÃĨr de hÃļyeste poengene over faktisk trofasthet, koherens, korthet og sluttvurdering.

De sterkeste gevinstene synes i ID-konsistens, og i den totale gjennomsnittlige poengsummen, som antyder at romlig grunnlag hjelper modellen ÃĨ holde rede pÃĨ hvem som gjÃļr hva mens plottet utvikler seg.

I den menneskelige evalueringen av 50 tilfeldig utvalgte sammenfatninger, ble deltakerne vist tre sammenfatninger om gangen, og bedt om ÃĨ velge den beste:

Menneskelig preferanse-rater i en treveis tvangssammenligning, som viser at de fullstendig grunnlagte MovieTeller-sammenfatningene blir valgt oftest over alle tre basis-modellene, og signifikant overgÃĨr bÃĨde No-Hint- og Name-Only-variantene.

Menneskelig preferanse-rater i en treveis tvangssammenligning, som viser at de fullstendig grunnlagte MovieTeller-sammenfatningene blir valgt oftest over alle tre basis-modellene, og signifikant overgÃĨr bÃĨde No-Hint- og Name-Only-variantene.

Til slutt ble en kvalitativ test utfÃļrt pÃĨ filmen Kula forsvinner (2012):

Vi kan ikke gjengi hele figuren fra den originale artikkelen, siden den er svÃĶrt hÃļy og tekst-tett. Vennligst se den originale artikkelen i stedet.

Vi kan ikke gjengi hele figuren fra den originale artikkelen, siden den er svÃĶrt hÃļy og tekst-tett. Vennligst se den originale artikkelen i stedet.

Her produserer No-Hint-baselinjen en vag sammenfatning som refererer til karakterer i generiske termer, og blander deres roller, noe som gjÃļr det vanskeligere ÃĨ fÃļlge hendelsesforlÃļpet. Å levere navn alene forbedrer overflatenivÃĨ-gjenkalling, men narrativet drifter fortsatt, med karakter-relasjoner og motivasjoner beskrevet pÃĨ en ganske ‘flat’ mÃĨte.

Omvelt, holder den fullstendig grunnlagte MovieTeller-versjonen identiteter stabile gjennom hele sammenfatningen og binder handlinger til riktige karakterer, noe som tillater etterforskning-plottet ÃĨ utvikle seg med en klarere ÃĨrsak-virkning-struktur. Spesifikke spenninger og rolle-dynamikk blir bevart i stedet for ÃĨ bli abstrahert bort, noe som resulterer i en sammenfatning som leser mer som en koherent gjenfortelling av filmens sentrale bue:

En del av den endelige sammenligningen, som vi ikke kan gjengi fullstendig her, som viser en ablasjon og en fullstendig MovieTeller-sammenfatning. Vennligst se den originale artikkelen i stedet.

En del av den endelige sammenligningen, som vi ikke kan gjengi fullstendig her, som viser en ablasjon og en fullstendig MovieTeller-sammenfatning. Vennligst se den originale artikkelen i stedet.

Konklusjon

Selv om de fleste nye prosjekter av denne typen ender opp i Computer Vision-litteraturen, omfatter AI-generert film-sammenfatting mange andre disipliner og domener i maskinlÃĶrings-forskning – og det er vanskelig ÃĨ si hvilke av disse som uforvarende kan bidra med den manglende biten av puslespillet; selv om MovieTeller tar et skritt i riktig retning, ved ÃĨ dele opp oppgavene over egnet moduler i stedet for ÃĨ forsÃļke ÃĨ lÃļse alt diskret i latent-rommet, har det fortsatt en ‘sammenfliket’ fÃļlelse som ofte foregÃĨr en senere, mer elegant lÃļsning.

 

* Jeg kan ikke identifisere denne institusjonen, selv etter noen sÃļking.

† En ville anta noe lignende IMDB eller OMDB, men kilde er ikke spesifisert.

†† Vennligst se den originale artikkelen for omfattende ablasjon, siden vi bare dekker full ablasjon i spesielle tilfeller. Jeg vil merke at de ubehandlet ablasjons-studiene som refereres til her, ikke undergraver artikkelen generelle funn.

FÃļrst publisert fredag, 27. februar 2026

Forfatter innen maskinlÃĶring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble opplÃļst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: [email protected]