Kąt Andersona

W poszukiwaniu sztucznej inteligencji, ktÃģra moÅže śledzić cały film

mm
Dodaj Unite.AI do preferowanych ÅšrÃģdeł w Google
AI-generated illustration (GPT-1.5) depicting a POV of a Steenbeck flatbed editing table as robot hands examine celluloid footage of a love scene from an old movie.

Modele sztucznej inteligencji nadal tracą ślad, kto jest kim i co się dzieje w filmie. Nowy system orchestruje rozpoznawanie twarzy i sceniczną syntezy, utrzymując postacie proste, a fabułę spÃģjną w całych filmach.

 

Uzyskanie sztucznej inteligencji, ktÃģra moÅže oglądać i rozumieć filmy w stylu Hollywood, moÅže się wydawać niszowym lub marginalnym zajęciem, ale system, ktÃģry moÅže obejrzeć pełnometraÅžowy film od początku do końca, śledzić postępy wszystkich postaci i utrzymywać się na bieŞąco z fabułą, umoÅžliwił wiele bezpośrednich zastosowań, ktÃģre mogą skorzystać z takich moÅžliwości, a takÅže wiele peryferyjnych lub niezwiązanych wyzwań w rÃģÅžnych dziedzinach.

Najłatwiejszym celem dla modeli sztucznej inteligencji oglądających filmy są systemy rekomendacji, na platformach streamingowych takich jak Netflix, Amazon Prime i HBO Max. Dogłębne zrozumienie rozwoju fabuły i działań postaci pozwala na bliÅžsze dopasowanie do (często wątpliwych) upodobań i entuzjazmu widzÃģw.

Ponadto, głębsze zrozumienie filmu umoÅžliwia generowanie słÃģw kluczowych i bardziej dokładną kategoryzację, zamiast utrwalania często kopiowanych opisÃģw filmÃģw, ktÃģre mogły być napisane wiele lat temu. Takie spostrzeÅženia mogą rÃģwnieÅž ujawnić obecność “dorosłych” tematÃģw w filmie, ktÃģre nie są oczywiste z dialogu lub wizualizacji.

Dodatkowo, starsze filmy w katalogu mogą mieć przestarzałe oceny oraz przeglądy, na przykład język i idiomy, ktÃģre były normalizowane w filmie z lat 50., mogą wymagać znacznie więcej uwagi teraz. Ale bez ogÃģlnego zrozumienia kontekstu, uzyskanego z prawdziwego śledzenia długiej narracji filmowej, takie przypadki mogą być przeszacowane lub niedoszacowane.

Bardziej ogÃģlnie, udoskonalone podejścia do analizy filmÃģw mogą przyczynić się do rozwiązania znacznie szerszego problemu rozpoznawania zdarzeń, ktÃģry jest niezbędny do innowacji w monitorowaniu bezpieczeństwa, automatycznych komentarzach sportowych i podsumowaniach wszystkich rodzajÃģw, we wszystkich rodzajach mediÃģw.

Zatem “oparty na sztucznej inteligencji film” jest dość popularnym gatunkiem w literaturze Computer Vision.

Widzenie całości

Najnowszy przykład to MovieTeller – wspÃģłpraca akademicko-przemysłowa z Chin, ktÃģra robi nowe postępy, dzieląc rÃģÅžne podzadania w wyzwaniu na rÃģÅžne aplikacje sztucznej inteligencji, ktÃģre odpowiadają tym wyzwaniom, zamiast – jak to często bywa – prÃģbować trenować dyskretne i zamknięte modele, ktÃģre mogą wykonywać wszystkie niezbędne zadania z jednego latent space.

Autorzy obserwują, Åže poprzednie modele Vision-Language (VLMs) stojące przed tym samym zadaniem nie były w stanie uczynić znaczących postępÃģw poza analizą pojedynczych klatek; i Åže ich brak kontekstu utrudnia tym modelom trwałe identyfikowanie postaci – być moÅže najbardziej istotną cechą takiego systemu:

Nowy system, MovieTeller, jest w stanie trwale identyfikować ludzi w scenach, dzięki zastosowaniu dedykowanego systemu rozpoznawania twarzy; ale to bardziej ogÃģlne poświęcenie kontekstowi pozwala ramom na utrzymanie się na bieŞąco z rozwojem fabuły. ÅđrÃģdło - https://arxiv.org/pdf/2602.23228

Nowy system, MovieTeller, jest w stanie trwale identyfikować ludzi w scenach, dzięki zastosowaniu dedykowanego systemu rozpoznawania twarzy; ale to bardziej ogÃģlne poświęcenie kontekstowi pozwala ramom na utrzymanie się na bieŞąco z rozwojem fabuły. ÅđrÃģdło

Autorzy stwierdzają:

‘OgÃģlne modele VLM często mają trudności z rozpoznawaniem i trwałym śledzeniem konkretnych postaci w całej narracji. Mogą opisać kluczowego protagonistę jako “męŞczyznę” w jednej scenie i “osobę” w innej, nie wiąŞąc wizualnej reprezentacji z konsekwentną toÅžsamością.’

Autorzy zauwaÅžają, Åže poniewaÅž Transformery mechanizm uwagi wykorzystuje kwadratową złoÅžoność, przetwarzanie kaÅždej klatki pełnometraÅžowego filmu na raz jest zbyt kosztowne obliczeniowo. W związku z tym, podejścia, ktÃģre polegają na rÃģwnomiernym prÃģbkowaniu klatek lub prostym łączeniu, tendencję do łamania przepływu historii, wytwarzając fragmentaryczne podsumowania zamiast spÃģjnej narracji.

Zamiast tego, nowy system składa się z bezszwego, bezwzględnego potoku szkoleniowego, z dedykowanymi narzędziami do rozpoznawania twarzy i trwałości pamięci (gdy postacie wychodzą i wchodzą w narrację filmu).

MovieTeller został przetestowany wobec poprzednich podejść przy uÅžyciu 60 pełnometraÅžowych filmÃģw, co odpowiada 10 000 minutom materiału. W ilościowych testach ablacjacji i badaniach z udziałem ludzi, autorzy donoszą, Åže ich podejście było w stanie znacznie poprawić wyniki w porÃģwnaniu z domyślnymi środowiskami i załoÅženiami uÅžywanymi przez poprzednie systemy.

Nowy artykuł pt. MovieTeller: Tool-augmented Movie Synopsis with ID Consistent Progressive Abstraction, pochodzi od pięciu autorÃģw z Zhejiang University w Hangzhou, państwowej grupy medialnej China Media Group i Watch AI Group* (oba z siedzibą w Pekinie).

Metoda

Schemat MovieTeller składa się z trzech etapÃģw: segmentacji scen i ekstrakcji klatek kluczowych, ktÃģre są obsługiwane przez PySceneDetect; Factual-Grounded Scene Description Generation za pomocą dostosowania Qwen2.5-VL-7B-Instruct VLM; oraz progressive abstraction, ktÃģry kondensuje szczegÃģłowe opisy scen w podsumowania rozdziałÃģw, a następnie w koherentny podsumowanie – i jest to rÃģwnieÅž wykonywane przez model Qwen2.5:

Przegląd ramy MovieTeller: pełnometraÅžowy film jest najpierw podzielony na sceny i destylowany w wysokiej jakości kluczowe klatki; następnie, zewnętrzne narzędzie rozpoznawania twarzy wstrzykuje podstawowe informacje, łącząc nazwy postaci z bounding boxami, ktÃģre prowadzą model Vision-Language do wytwarzania opisÃģw scen zgodnych z identyfikatorem. Te opisy są następnie stopniowo abstrahowane w podsumowania rozdziałÃģw i integrowane w koherentne podsumowanie filmu.

Przegląd ramy MovieTeller: pełnometraÅžowy film jest najpierw podzielony na sceny i destylowany w wysokiej jakości kluczowe klatki; następnie, zewnętrzne narzędzie rozpoznawania twarzy wstrzykuje podstawowe informacje, łącząc nazwy postaci z bounding boxami, ktÃģre prowadzą model Vision-Language do wytwarzania opisÃģw scen zgodnych z identyfikatorem.

Początkowy etap wykorzystuje PySceneDetect do podzielenia filmu na dyskretne sceny, na podstawie wyraÅšnych zmian wizualnych, z kaÅždą sceną reprezentowaną przez jedną kluczową klatkę.

Jednak nie kaÅžda klatka jest dobrą klatką podsumowującą, poniewaÅž momenty przejściowe, wygaszacze i ciemne klatki mogą wprowadzić w błąd pÃģÅšniejszą analizę. Dlatego prosta kontrola jakości wykonuje filtr na kandydujących klatkach, mierząc jasność i zmianę wizualną, zapewniając, Åže tylko informacyjnie bogate obrazy są wybrane do opisu.

Umieszczanie twarzy

Baza danych twarzy została zbudowana z publicznie dostępnych informacji o obsadzie†, przechowując nazwę kaÅždej głÃģwnej postaci obok numerycznego embeddingu. Gdy twarz pojawia się w kluczowej klatce, jej embedding jest dopasowywany do bazy danych, a najbliÅžszy wynik jest akceptowany, jeśli przekracza prÃģg ufności. To tworzy “podstawowe informacje”, łącząc nazwy z konkretnymi bounding boxami.

Dla tych celÃģw InsightFace jest uÅžywany, wykorzystując ArcFace loss-based recognition head:

Dwie dobrze rozpoznawalne twarze przez inicjatywę Additive Angular Margin Loss (ArcFace), uÅžywaną w bardzo podobny sposÃģb w projekcie MovieTeller. ÅđrÃģdło - https://www.youtube.com/watch?v=y-D1tReryGA&t=80s

Dwie dobrze rozpoznawalne twarze przez inicjatywę Additive Angular Margin Loss (ArcFace), uÅžywaną w bardzo podobny sposÃģb w projekcie MovieTeller. ÅđrÃģdło

Oznaczone kluczowe klatki są następnie przekazywane do modelu Qwen z podpowiedzią, ktÃģra wymienia wykryte postacie i ich pozycje.

PoniewaÅž modele Vision-Language nie mogą pochłonąć całego pełnometraÅžowego filmu na raz, MovieTeller najpierw rozdziela materiał na opisy scen. Są one grupowane w następujące po sobie bloki, ktÃģre są następnie przekazywane do Qwen2.5, ktÃģry podsumowuje kaÅždy rozdział, kompresując rozwÃģj fabuły, motywacje postaci i punkty zwrotne, przy zachowaniu wcześniej zweryfikowanych nazw postaci.

Te skompresowane podsumowania rozdziałÃģw są następnie łączone i zwracane do modelu z nową podpowiedzią, ktÃģra prosi o pełne podsumowanie:

Przykładowy szablon podpowiedzi uÅžywany do generowania opisÃģw scen, wyraÅšnie wstrzykujący zweryfikowane nazwy postaci i bounding boxy, aby ograniczyć model Vision-Language i wymusić narrację zgodną z identyfikatorem.

Podobnie jak podpowiedÅš, ktÃģra prosi o całe podsumowanie, ten przykład jest uÅžywany do generowania opisÃģw scen, wyraÅšnie wstrzykujący zweryfikowane nazwy postaci i bounding boxy, aby ograniczyć model Vision-Language i wymusić narrację zgodną z identyfikatorem.

Zakładając, Åže proces zakończył się powodzeniem, ostateczny wynik powinien spÃģjnie odzwierciedlać narracyjną łuk filmu. To jest szczegÃģlnie trudne zadanie w uczeniu maszynowym, poniewaÅž rÃģÅžnorodność moÅžliwych podsumowań fabuły i stylu, w jakim mogą być one przedstawione, wraz z konieczną długością tych danych, sprawia, Åže niemal niemoÅžliwe jest przyjęcie zwykłych podejść opartych na ground truth.

Dane i testy

Aby przetestować system, autorzy stworzyli specjalnie przygotowaną (i nieprzypisaną do ÅšrÃģdła) bazę danych 100 pełnometraÅžowych filmÃģw, co odpowiada 166 godzinom czasu odtwarzania. Filmy obejmowały Iron Man 3, Farewell My Concubine, Eat Drink Man Woman i The Chronicles of Narnia. Badacze wymagali, aby wszystkie uwzględnione filmy miały ocenę powyÅžej 5,0 na IMDB:

Skład bazy danych w 100 filmach, pokazujący zrÃģwnowaÅžone pokrycie czasowe od 1992 do 2025, nieznacznie większość tytułÃģw nieangielskich i szeroki zakres gatunkÃģw, na czele z dramatem i akcją, z reprezentacją w Sci-Fi, Horror, Komedia, Romantyczne i Historia.

Skład bazy danych w 100 filmach, pokazujący zrÃģwnowaÅžone pokrycie czasowe od 1992 do 2025, nieznacznie większość tytułÃģw nieangielskich i szeroki zakres gatunkÃģw, na czele z dramatem i akcją, z reprezentacją w Sci-Fi, Horror, Komedia, Romantyczne i Historia.

Szeroki zakres gatunkÃģw (patrz wykres powyÅžej) został zaprojektowany, aby uniknąć uprzedzeń wobec jakiegokolwiek jednego gatunku.

Baza danych twarzy dla kaÅždego filmu składała się z dwÃģch zdjęć głÃģwnych aktorÃģw – jednego z klatki filmu, a drugiego ze zdjęcia promocyjnego.

WdroÅžony w Pythonie, testy zostały uruchomione na czterech procesorach NVIDIA A40, kaÅždy z 48 GB pamięci VRAM, a z wyÅžej wymienionym modelem Qwen2.5 jako centralnym VLM. Przeprowadzono rÃģwnieÅž studia ablacjacji†† z alternatywnymi modelami stanu sztuki InternVL3-8B i WeThink-Qwen2.5VL-7B.

Nowy framework został przetestowany wobec dwÃģch wariantÃģw ablacjacji††: No-Hint bazowy, w ktÃģrym model Vision-Language generował opisy scen wyłącznie z kluczowej klatki, bez Åžadnych tekstowych wskazÃģwek dotyczących toÅžsamości postaci; oraz Name-Only Hint ustawienie, w ktÃģrym model otrzymywał wykryte nazwy postaci, ale nie ich bounding boxy, co pozwoliło autorom na izolację konkretnego wkładu przestrzennego ugruntowania w identyfikacji i spÃģjności narracyjnej

W odniesieniu do metryk, biorąc pod uwagę trudności zastosowania podejść opartych na ground truth do długich podsumowań fabuły, standardowe metryki nakładu n-gram, takie jak ROUGE i BLEU, zostały odrzucone na rzecz BERTScore z F1 score, aby zmierzyć semantyczną podobieństwo w stosunku do odniesienia podsumowania pobranego z “publicznej encyklopedii”.

Ponadto, Gemini 2.5 Flash został uÅžyty do oceny kaÅždego podsumowania pod kątem wierności faktom; spÃģjności identyfikatora i kompletności; koherencji narracyjnej i przepływu; oraz zwięzłości, z wynikami uśrednionymi w rÃģÅžnych wymiarach.

Wreszcie, przeprowadzono ocenę ludzką 50 losowo wybranych podsumowań, korzystając z porÃģwnania parami, co zapewniło praktyczną weryfikację ocen automatycznych.

PoniÅžej widzimy wyniki BERTScore (F1) dla trzech modeli backbone: Qwen2.5-VL, InternVL3 i WeThink. KaÅždy z nich został przetestowany w trzech konfiguracjach: No-Hint, Name-Only i pełny system MovieTeller:

PorÃģwnanie BERTScore (F1) w trzech modelach backbone i trzech ustawieniach eksperymentalnych, pokazujące ciągłe zyski z dodawaniem nazw postaci i dalsze poprawy, gdy jest uwzględnione ugruntowanie przestrzenne, z MovieTeller osiągając najwyÅžsze wyniki we wszystkich przypadkach.

PorÃģwnanie BERTScore (F1) w trzech modelach backbone i trzech ustawieniach eksperymentalnych, pokazujące ciągłe zyski z dodawaniem nazw postaci i dalsze poprawy, gdy jest uwzględnione ugruntowanie przestrzenne, z MovieTeller osiągając najwyÅžsze wyniki we wszystkich przypadkach.

Autorzy zauwaÅžają, Åže wzorzec jest spÃģjny we wszystkich trzech modelach backbone: korzystanie tylko z surowej klatki daje najgorsze wyniki; dodawanie nazw postaci daje umiarkowaną poprawę; a łączenie nazw z bounding boxami daje najmocniejsze wyniki. ChociaÅž zyski są stopniowe, a nie dramatyczne, w pełni ugruntowana konfiguracja osiąga najwyÅžszą semantyczną zgodność z odniesieniowym podsumowaniem we wszystkich ustawieniach.

W odniesieniu do oceny jakości narracyjnej opartej na LLM: jak widać w wynikach poniÅžej, No-Hint bazowy wariant ma największe trudności z identyfikacją postaci, co obniÅža jego ogÃģlny wynik; ale dostarczanie nazw postaci daje zauwaÅžalną poprawę, szczegÃģlnie w wymiarach związanych z identyfikacją. Jednak pełna konfiguracja MovieTeller ponownie zajmuje najwyÅžsze miejsce we wszystkich trzech modelach backbone:

Ocena LLM-as-a-Judge (skala 1–5) w trzech modelach backbone, pokazująca, Åže dodawanie nazw postaci poprawia identyfikację postaci i ogÃģlną jakość, podczas gdy pełna konfiguracja MovieTeller osiąga najwyÅžsze wyniki w wierności faktom, koherencji, zwięzłości i końcowej ocenie.

Ocena LLM-as-a-Judge (skala 1–5) w trzech modelach backbone, pokazująca, Åže dodawanie nazw postaci poprawia identyfikację postaci i ogÃģlną jakość, podczas gdy pełna konfiguracja MovieTeller osiąga najwyÅžsze wyniki w wierności faktom, koherencji, zwięzłości i końcowej ocenie.

Największe zyski pojawiają się w identyfikacji postaci i w końcowej uśrednionej ocenie, co sugeruje, Åže ugruntowanie przestrzenne pomaga modelowi utrzymać wyraÅšność, kto robi co, gdy fabuła się rozwija.

W ocenie ludzkiej 50 losowo wybranych podsumowań, uczestnicy byli pokazywani trzy podsumowania na raz i proszeni o wybÃģr najlepszego:

Stawki preferencji ludzkich w trzydroÅžnym porÃģwnaniu wymuszonym, pokazując, Åže w pełni ugruntowane podsumowania MovieTeller są wybierane najczęściej we wszystkich trzech modelach backbone, znacznie przewyÅžszając oba warianty No-Hint i Name-Only.

Stawki preferencji ludzkich w trzydroÅžnym porÃģwnaniu wymuszonym, pokazując, Åže w pełni ugruntowane podsumowania MovieTeller są wybierane najczęściej we wszystkich trzech modelach backbone, znacznie przewyÅžszając oba warianty No-Hint i Name-Only.

Wreszcie, przeprowadzono test jakościowy na filmie The Bullet Vanishes (2012):

Nie moÅžemy odtworzyć całości tej figury z oryginalnego artykułu, poniewaÅž jest ona bardzo wysoka i gęsto wypełniona tekstem. Proszę odnieść się do oryginalnego artykułu.

Nie moÅžemy odtworzyć całości tej figury z oryginalnego artykułu, poniewaÅž jest ona bardzo wysoka i gęsto wypełniona tekstem. Proszę odnieść się do oryginalnego artykułu.

Tutaj No-Hint bazowy wariant wytwarza mgliste podsumowanie, ktÃģre odnosi się do postaci w ogÃģlnych terminach i rozmywa ich role, utrudniając śledzenie łańcucha zdarzeń. Dostarczanie nazw postaci poprawia powierzchowne przypomnienie, ale narracja nadal dryfuje, a relacje i motywacje postaci są opisywane w dość “spłaszczony” sposÃģb.

OdwrÃģcony, w pełni ugruntowany wariant MovieTeller utrzymuje identyfikatory stabilne w całym podsumowaniu i wiÄ…Åže działania z odpowiednimi postaciami, pozwalając na rozwinięcie się śledztwa z wyraÅšniejszą strukturą przyczynowo-skutkową. Konkretnie napięcia i dynamika rÃģl są zachowane, a nie abstrahowane, w wyniku czego podsumowanie brzmi bardziej jak spÃģjne opowiadanie o głÃģwnym łuku filmu:

Część ostatecznego porÃģwnania, ktÃģre nie moÅžemy odtworzyć w całości tutaj, pokazująca ablacjowane i pełne podsumowanie MovieTeller. Proszę odnieść się do oryginalnego artykułu.

Część ostatecznego porÃģwnania, ktÃģre nie moÅžemy odtworzyć w całości tutaj, pokazująca ablacjowane i pełne podsumowanie MovieTeller. Proszę odnieść się do oryginalnego artykułu.

Wnioski

ChociaÅž większość nowych projektÃģw tego rodzaju kończy się w literaturze Computer Vision, generowanie podsumowań filmÃģw opartych na sztucznej inteligencji obejmuje wiele innych dyscyplin i dziedzin w badaniach nad sztuczną inteligencją – i trudno powiedzieć, ktÃģre z nich przypadkowo przyczynią się do znalezienia brakującego elementu układanki; chociaÅž MovieTeller robi krok w dobrym kierunku, dzieląc zadania na odpowiednie moduły, zamiast prÃģbować rozwiązać wszystko dyskretne w latent space, nadal ma “składany” charakter, ktÃģry często poprzedza pÃģÅšniejsze, bardziej eleganckie rozwiązanie.

 

* Nie mogę zidentyfikować tej instytucji, nawet po przeszukaniu.

† MoÅžna przypuszczać, Åže coś w rodzaju IMDB lub OMDB, ale ÅšrÃģdło nie jest określone.

†† Proszę odnieść się do oryginalnego artykułu w celu uzyskania kompleksowej ablacjacji, poniewaÅž tutaj omawiamy tylko pełną ablację w wyjątkowych przypadkach. ZauwaÅžam, Åže nieleczona ablacjacja nie podwaÅža ogÃģlnych wnioskÃģw artykułu.

Pierwotnie opublikowane w piątek, 27 lutego 2026

Pisarz na temat uczenia maszynowego, specjalista w dziedzinie syntezy obrazu ludzkiego. Były kierownik treści badawczych w Metaphysic.ai, do czasu jego rozwiązania w DNEG's Brahma.ai.
Strona portfelowo: martinanderson.ai
Kontakt: [email protected]