KÄ t Andersona
W poszukiwaniu sztucznej inteligencji, ktÃģra moÅže ÅledziÄ caÅy film

Modele sztucznej inteligencji nadal tracÄ Ålad, kto jest kim i co siÄ dzieje w filmie. Nowy system orchestruje rozpoznawanie twarzy i scenicznÄ syntezy, utrzymujÄ c postacie proste, a fabuÅÄ spÃģjnÄ w caÅych filmach.
Â
Uzyskanie sztucznej inteligencji, ktÃģra moÅže oglÄ daÄ i rozumieÄ filmy w stylu Hollywood, moÅže siÄ wydawaÄ niszowym lub marginalnym zajÄciem, ale system, ktÃģry moÅže obejrzeÄ peÅnometraÅžowy film od poczÄ tku do koÅca, ÅledziÄ postÄpy wszystkich postaci i utrzymywaÄ siÄ na bieÅžÄ co z fabuÅÄ , umoÅžliwiÅ wiele bezpoÅrednich zastosowaÅ, ktÃģre mogÄ skorzystaÄ z takich moÅžliwoÅci, a takÅže wiele peryferyjnych lub niezwiÄ zanych wyzwaÅ w rÃģÅžnych dziedzinach.
NajÅatwiejszym celem dla modeli sztucznej inteligencji oglÄ dajÄ cych filmy sÄ systemy rekomendacji, na platformach streamingowych takich jak Netflix, Amazon Prime i HBO Max. DogÅÄbne zrozumienie rozwoju fabuÅy i dziaÅaÅ postaci pozwala na bliÅžsze dopasowanie do (czÄsto wÄ tpliwych) upodobaÅ i entuzjazmu widzÃģw.
Ponadto, gÅÄbsze zrozumienie filmu umoÅžliwia generowanie sÅÃģw kluczowych i bardziej dokÅadnÄ kategoryzacjÄ, zamiast utrwalania czÄsto kopiowanych opisÃģw filmÃģw, ktÃģre mogÅy byÄ napisane wiele lat temu. Takie spostrzeÅženia mogÄ rÃģwnieÅž ujawniÄ obecnoÅÄ âdorosÅychâ tematÃģw w filmie, ktÃģre nie sÄ oczywiste z dialogu lub wizualizacji.
Dodatkowo, starsze filmy w katalogu mogÄ mieÄ przestarzaÅe oceny oraz przeglÄ dy, na przykÅad jÄzyk i idiomy, ktÃģre byÅy normalizowane w filmie z lat 50., mogÄ wymagaÄ znacznie wiÄcej uwagi teraz. Ale bez ogÃģlnego zrozumienia kontekstu, uzyskanego z prawdziwego Åledzenia dÅugiej narracji filmowej, takie przypadki mogÄ byÄ przeszacowane lub niedoszacowane.
Bardziej ogÃģlnie, udoskonalone podejÅcia do analizy filmÃģw mogÄ przyczyniÄ siÄ do rozwiÄ zania znacznie szerszego problemu rozpoznawania zdarzeÅ, ktÃģry jest niezbÄdny do innowacji w monitorowaniu bezpieczeÅstwa, automatycznych komentarzach sportowych i podsumowaniach wszystkich rodzajÃģw, we wszystkich rodzajach mediÃģw.
Zatem âoparty na sztucznej inteligencji filmâ jest doÅÄ popularnym gatunkiem w literaturze Computer Vision.
Widzenie caÅoÅci
Najnowszy przykÅad to MovieTeller â wspÃģÅpraca akademicko-przemysÅowa z Chin, ktÃģra robi nowe postÄpy, dzielÄ c rÃģÅžne podzadania w wyzwaniu na rÃģÅžne aplikacje sztucznej inteligencji, ktÃģre odpowiadajÄ tym wyzwaniom, zamiast â jak to czÄsto bywa â prÃģbowaÄ trenowaÄ dyskretne i zamkniÄte modele, ktÃģre mogÄ wykonywaÄ wszystkie niezbÄdne zadania z jednego latent space.
Autorzy obserwujÄ , Åže poprzednie modele Vision-Language (VLMs) stojÄ ce przed tym samym zadaniem nie byÅy w stanie uczyniÄ znaczÄ cych postÄpÃģw poza analizÄ pojedynczych klatek; i Åže ich brak kontekstu utrudnia tym modelom trwaÅe identyfikowanie postaci â byÄ moÅže najbardziej istotnÄ cechÄ takiego systemu:

Nowy system, MovieTeller, jest w stanie trwale identyfikowaÄ ludzi w scenach, dziÄki zastosowaniu dedykowanego systemu rozpoznawania twarzy; ale to bardziej ogÃģlne poÅwiÄcenie kontekstowi pozwala ramom na utrzymanie siÄ na bieÅžÄ co z rozwojem fabuÅy. ÅđrÃģdÅo
Autorzy stwierdzajÄ :
âOgÃģlne modele VLM czÄsto majÄ trudnoÅci z rozpoznawaniem i trwaÅym Åledzeniem konkretnych postaci w caÅej narracji. MogÄ opisaÄ kluczowego protagonistÄ jako âmÄÅžczyznÄâ w jednej scenie i âosobÄâ w innej, nie wiÄ ÅžÄ c wizualnej reprezentacji z konsekwentnÄ toÅžsamoÅciÄ .â
Autorzy zauwaÅžajÄ , Åže poniewaÅž Transformery mechanizm uwagi wykorzystuje kwadratowÄ zÅoÅžonoÅÄ, przetwarzanie kaÅždej klatki peÅnometraÅžowego filmu na raz jest zbyt kosztowne obliczeniowo. W zwiÄ zku z tym, podejÅcia, ktÃģre polegajÄ na rÃģwnomiernym prÃģbkowaniu klatek lub prostym ÅÄ czeniu, tendencjÄ do Åamania przepÅywu historii, wytwarzajÄ c fragmentaryczne podsumowania zamiast spÃģjnej narracji.
Zamiast tego, nowy system skÅada siÄ z bezszwego, bezwzglÄdnego potoku szkoleniowego, z dedykowanymi narzÄdziami do rozpoznawania twarzy i trwaÅoÅci pamiÄci (gdy postacie wychodzÄ i wchodzÄ w narracjÄ filmu).
MovieTeller zostaÅ przetestowany wobec poprzednich podejÅÄ przy uÅžyciu 60 peÅnometraÅžowych filmÃģw, co odpowiada 10 000 minutom materiaÅu. W iloÅciowych testach ablacjacji i badaniach z udziaÅem ludzi, autorzy donoszÄ , Åže ich podejÅcie byÅo w stanie znacznie poprawiÄ wyniki w porÃģwnaniu z domyÅlnymi Årodowiskami i zaÅoÅženiami uÅžywanymi przez poprzednie systemy.
Nowy artykuÅ pt. MovieTeller: Tool-augmented Movie Synopsis with ID Consistent Progressive Abstraction, pochodzi od piÄciu autorÃģw z Zhejiang University w Hangzhou, paÅstwowej grupy medialnej China Media Group i Watch AI Group* (oba z siedzibÄ w Pekinie).
Metoda
Schemat MovieTeller skÅada siÄ z trzech etapÃģw: segmentacji scen i ekstrakcji klatek kluczowych, ktÃģre sÄ obsÅugiwane przez PySceneDetect; Factual-Grounded Scene Description Generation za pomocÄ dostosowania Qwen2.5-VL-7B-Instruct VLM; oraz progressive abstraction, ktÃģry kondensuje szczegÃģÅowe opisy scen w podsumowania rozdziaÅÃģw, a nastÄpnie w koherentny podsumowanie â i jest to rÃģwnieÅž wykonywane przez model Qwen2.5:

PrzeglÄ d ramy MovieTeller: peÅnometraÅžowy film jest najpierw podzielony na sceny i destylowany w wysokiej jakoÅci kluczowe klatki; nastÄpnie, zewnÄtrzne narzÄdzie rozpoznawania twarzy wstrzykuje podstawowe informacje, ÅÄ czÄ c nazwy postaci z bounding boxami, ktÃģre prowadzÄ model Vision-Language do wytwarzania opisÃģw scen zgodnych z identyfikatorem.
PoczÄ tkowy etap wykorzystuje PySceneDetect do podzielenia filmu na dyskretne sceny, na podstawie wyraÅšnych zmian wizualnych, z kaÅždÄ scenÄ reprezentowanÄ przez jednÄ kluczowÄ klatkÄ.
Jednak nie kaÅžda klatka jest dobrÄ klatkÄ podsumowujÄ cÄ , poniewaÅž momenty przejÅciowe, wygaszacze i ciemne klatki mogÄ wprowadziÄ w bÅÄ d pÃģÅšniejszÄ analizÄ. Dlatego prosta kontrola jakoÅci wykonuje filtr na kandydujÄ cych klatkach, mierzÄ c jasnoÅÄ i zmianÄ wizualnÄ , zapewniajÄ c, Åže tylko informacyjnie bogate obrazy sÄ wybrane do opisu.
Umieszczanie twarzy
Baza danych twarzy zostaÅa zbudowana z publicznie dostÄpnych informacji o obsadzieâ , przechowujÄ c nazwÄ kaÅždej gÅÃģwnej postaci obok numerycznego embeddingu. Gdy twarz pojawia siÄ w kluczowej klatce, jej embedding jest dopasowywany do bazy danych, a najbliÅžszy wynik jest akceptowany, jeÅli przekracza prÃģg ufnoÅci. To tworzy âpodstawowe informacjeâ, ÅÄ czÄ c nazwy z konkretnymi bounding boxami.
Dla tych celÃģw InsightFace jest uÅžywany, wykorzystujÄ c ArcFace loss-based recognition head:

Dwie dobrze rozpoznawalne twarze przez inicjatywÄ Additive Angular Margin Loss (ArcFace), uÅžywanÄ w bardzo podobny sposÃģb w projekcie MovieTeller. ÅđrÃģdÅo
Oznaczone kluczowe klatki sÄ nastÄpnie przekazywane do modelu Qwen z podpowiedziÄ , ktÃģra wymienia wykryte postacie i ich pozycje.
PoniewaÅž modele Vision-Language nie mogÄ pochÅonÄ Ä caÅego peÅnometraÅžowego filmu na raz, MovieTeller najpierw rozdziela materiaÅ na opisy scen. SÄ one grupowane w nastÄpujÄ ce po sobie bloki, ktÃģre sÄ nastÄpnie przekazywane do Qwen2.5, ktÃģry podsumowuje kaÅždy rozdziaÅ, kompresujÄ c rozwÃģj fabuÅy, motywacje postaci i punkty zwrotne, przy zachowaniu wczeÅniej zweryfikowanych nazw postaci.
Te skompresowane podsumowania rozdziaÅÃģw sÄ nastÄpnie ÅÄ czone i zwracane do modelu z nowÄ podpowiedziÄ , ktÃģra prosi o peÅne podsumowanie:

Podobnie jak podpowiedÅš, ktÃģra prosi o caÅe podsumowanie, ten przykÅad jest uÅžywany do generowania opisÃģw scen, wyraÅšnie wstrzykujÄ cy zweryfikowane nazwy postaci i bounding boxy, aby ograniczyÄ model Vision-Language i wymusiÄ narracjÄ zgodnÄ z identyfikatorem.
ZakÅadajÄ c, Åže proces zakoÅczyÅ siÄ powodzeniem, ostateczny wynik powinien spÃģjnie odzwierciedlaÄ narracyjnÄ Åuk filmu. To jest szczegÃģlnie trudne zadanie w uczeniu maszynowym, poniewaÅž rÃģÅžnorodnoÅÄ moÅžliwych podsumowaÅ fabuÅy i stylu, w jakim mogÄ byÄ one przedstawione, wraz z koniecznÄ dÅugoÅciÄ tych danych, sprawia, Åže niemal niemoÅžliwe jest przyjÄcie zwykÅych podejÅÄ opartych na ground truth.
Dane i testy
Aby przetestowaÄ system, autorzy stworzyli specjalnie przygotowanÄ (i nieprzypisanÄ do ÅšrÃģdÅa) bazÄ danych 100 peÅnometraÅžowych filmÃģw, co odpowiada 166 godzinom czasu odtwarzania. Filmy obejmowaÅy Iron Man 3, Farewell My Concubine, Eat Drink Man Woman i The Chronicles of Narnia. Badacze wymagali, aby wszystkie uwzglÄdnione filmy miaÅy ocenÄ powyÅžej 5,0 na IMDB:

SkÅad bazy danych w 100 filmach, pokazujÄ cy zrÃģwnowaÅžone pokrycie czasowe od 1992 do 2025, nieznacznie wiÄkszoÅÄ tytuÅÃģw nieangielskich i szeroki zakres gatunkÃģw, na czele z dramatem i akcjÄ , z reprezentacjÄ w Sci-Fi, Horror, Komedia, Romantyczne i Historia.
Szeroki zakres gatunkÃģw (patrz wykres powyÅžej) zostaÅ zaprojektowany, aby uniknÄ Ä uprzedzeÅ wobec jakiegokolwiek jednego gatunku.
Baza danych twarzy dla kaÅždego filmu skÅadaÅa siÄ z dwÃģch zdjÄÄ gÅÃģwnych aktorÃģw â jednego z klatki filmu, a drugiego ze zdjÄcia promocyjnego.
WdroÅžony w Pythonie, testy zostaÅy uruchomione na czterech procesorach NVIDIA A40, kaÅždy z 48 GB pamiÄci VRAM, a z wyÅžej wymienionym modelem Qwen2.5 jako centralnym VLM. Przeprowadzono rÃģwnieÅž studia ablacjacjiâ â z alternatywnymi modelami stanu sztuki InternVL3-8B i WeThink-Qwen2.5VL-7B.
Nowy framework zostaÅ przetestowany wobec dwÃģch wariantÃģw ablacjacjiâ â : No-Hint bazowy, w ktÃģrym model Vision-Language generowaÅ opisy scen wyÅÄ cznie z kluczowej klatki, bez Åžadnych tekstowych wskazÃģwek dotyczÄ cych toÅžsamoÅci postaci; oraz Name-Only Hint ustawienie, w ktÃģrym model otrzymywaÅ wykryte nazwy postaci, ale nie ich bounding boxy, co pozwoliÅo autorom na izolacjÄ konkretnego wkÅadu przestrzennego ugruntowania w identyfikacji i spÃģjnoÅci narracyjnej
W odniesieniu do metryk, biorÄ c pod uwagÄ trudnoÅci zastosowania podejÅÄ opartych na ground truth do dÅugich podsumowaÅ fabuÅy, standardowe metryki nakÅadu n-gram, takie jak ROUGE i BLEU, zostaÅy odrzucone na rzecz BERTScore z F1 score, aby zmierzyÄ semantycznÄ podobieÅstwo w stosunku do odniesienia podsumowania pobranego z âpublicznej encyklopediiâ.
Ponadto, Gemini 2.5 Flash zostaÅ uÅžyty do oceny kaÅždego podsumowania pod kÄ tem wiernoÅci faktom; spÃģjnoÅci identyfikatora i kompletnoÅci; koherencji narracyjnej i przepÅywu; oraz zwiÄzÅoÅci, z wynikami uÅrednionymi w rÃģÅžnych wymiarach.
Wreszcie, przeprowadzono ocenÄ ludzkÄ 50 losowo wybranych podsumowaÅ, korzystajÄ c z porÃģwnania parami, co zapewniÅo praktycznÄ weryfikacjÄ ocen automatycznych.
PoniÅžej widzimy wyniki BERTScore (F1) dla trzech modeli backbone: Qwen2.5-VL, InternVL3 i WeThink. KaÅždy z nich zostaÅ przetestowany w trzech konfiguracjach: No-Hint, Name-Only i peÅny system MovieTeller:

PorÃģwnanie BERTScore (F1) w trzech modelach backbone i trzech ustawieniach eksperymentalnych, pokazujÄ ce ciÄ gÅe zyski z dodawaniem nazw postaci i dalsze poprawy, gdy jest uwzglÄdnione ugruntowanie przestrzenne, z MovieTeller osiÄ gajÄ c najwyÅžsze wyniki we wszystkich przypadkach.
Autorzy zauwaÅžajÄ , Åže wzorzec jest spÃģjny we wszystkich trzech modelach backbone: korzystanie tylko z surowej klatki daje najgorsze wyniki; dodawanie nazw postaci daje umiarkowanÄ poprawÄ; a ÅÄ czenie nazw z bounding boxami daje najmocniejsze wyniki. ChociaÅž zyski sÄ stopniowe, a nie dramatyczne, w peÅni ugruntowana konfiguracja osiÄ ga najwyÅžszÄ semantycznÄ zgodnoÅÄ z odniesieniowym podsumowaniem we wszystkich ustawieniach.
W odniesieniu do oceny jakoÅci narracyjnej opartej na LLM: jak widaÄ w wynikach poniÅžej, No-Hint bazowy wariant ma najwiÄksze trudnoÅci z identyfikacjÄ postaci, co obniÅža jego ogÃģlny wynik; ale dostarczanie nazw postaci daje zauwaÅžalnÄ poprawÄ, szczegÃģlnie w wymiarach zwiÄ zanych z identyfikacjÄ . Jednak peÅna konfiguracja MovieTeller ponownie zajmuje najwyÅžsze miejsce we wszystkich trzech modelach backbone:

Ocena LLM-as-a-Judge (skala 1â5) w trzech modelach backbone, pokazujÄ ca, Åže dodawanie nazw postaci poprawia identyfikacjÄ postaci i ogÃģlnÄ jakoÅÄ, podczas gdy peÅna konfiguracja MovieTeller osiÄ ga najwyÅžsze wyniki w wiernoÅci faktom, koherencji, zwiÄzÅoÅci i koÅcowej ocenie.
NajwiÄksze zyski pojawiajÄ siÄ w identyfikacji postaci i w koÅcowej uÅrednionej ocenie, co sugeruje, Åže ugruntowanie przestrzenne pomaga modelowi utrzymaÄ wyraÅšnoÅÄ, kto robi co, gdy fabuÅa siÄ rozwija.
W ocenie ludzkiej 50 losowo wybranych podsumowaÅ, uczestnicy byli pokazywani trzy podsumowania na raz i proszeni o wybÃģr najlepszego:

Stawki preferencji ludzkich w trzydroÅžnym porÃģwnaniu wymuszonym, pokazujÄ c, Åže w peÅni ugruntowane podsumowania MovieTeller sÄ wybierane najczÄÅciej we wszystkich trzech modelach backbone, znacznie przewyÅžszajÄ c oba warianty No-Hint i Name-Only.
Wreszcie, przeprowadzono test jakoÅciowy na filmie The Bullet Vanishes (2012):

Nie moÅžemy odtworzyÄ caÅoÅci tej figury z oryginalnego artykuÅu, poniewaÅž jest ona bardzo wysoka i gÄsto wypeÅniona tekstem. ProszÄ odnieÅÄ siÄ do oryginalnego artykuÅu.
Tutaj No-Hint bazowy wariant wytwarza mgliste podsumowanie, ktÃģre odnosi siÄ do postaci w ogÃģlnych terminach i rozmywa ich role, utrudniajÄ c Åledzenie ÅaÅcucha zdarzeÅ. Dostarczanie nazw postaci poprawia powierzchowne przypomnienie, ale narracja nadal dryfuje, a relacje i motywacje postaci sÄ opisywane w doÅÄ âspÅaszczonyâ sposÃģb.
OdwrÃģcony, w peÅni ugruntowany wariant MovieTeller utrzymuje identyfikatory stabilne w caÅym podsumowaniu i wiÄ Åže dziaÅania z odpowiednimi postaciami, pozwalajÄ c na rozwiniÄcie siÄ Åledztwa z wyraÅšniejszÄ strukturÄ przyczynowo-skutkowÄ . Konkretnie napiÄcia i dynamika rÃģl sÄ zachowane, a nie abstrahowane, w wyniku czego podsumowanie brzmi bardziej jak spÃģjne opowiadanie o gÅÃģwnym Åuku filmu:

CzÄÅÄ ostatecznego porÃģwnania, ktÃģre nie moÅžemy odtworzyÄ w caÅoÅci tutaj, pokazujÄ ca ablacjowane i peÅne podsumowanie MovieTeller. ProszÄ odnieÅÄ siÄ do oryginalnego artykuÅu.
Wnioski
ChociaÅž wiÄkszoÅÄ nowych projektÃģw tego rodzaju koÅczy siÄ w literaturze Computer Vision, generowanie podsumowaÅ filmÃģw opartych na sztucznej inteligencji obejmuje wiele innych dyscyplin i dziedzin w badaniach nad sztucznÄ inteligencjÄ â i trudno powiedzieÄ, ktÃģre z nich przypadkowo przyczyniÄ siÄ do znalezienia brakujÄ cego elementu ukÅadanki; chociaÅž MovieTeller robi krok w dobrym kierunku, dzielÄ c zadania na odpowiednie moduÅy, zamiast prÃģbowaÄ rozwiÄ zaÄ wszystko dyskretne w latent space, nadal ma âskÅadanyâ charakter, ktÃģry czÄsto poprzedza pÃģÅšniejsze, bardziej eleganckie rozwiÄ zanie.
Â
* Nie mogÄ zidentyfikowaÄ tej instytucji, nawet po przeszukaniu.
â MoÅžna przypuszczaÄ, Åže coÅ w rodzaju IMDB lub OMDB, ale ÅšrÃģdÅo nie jest okreÅlone.
â â ProszÄ odnieÅÄ siÄ do oryginalnego artykuÅu w celu uzyskania kompleksowej ablacjacji, poniewaÅž tutaj omawiamy tylko peÅnÄ ablacjÄ w wyjÄ tkowych przypadkach. ZauwaÅžam, Åže nieleczona ablacjacja nie podwaÅža ogÃģlnych wnioskÃģw artykuÅu.
Pierwotnie opublikowane w piÄ tek, 27 lutego 2026












