Anderson’un Açısı

Bir Filmin Tamamını İzleyebilen Bir AI Arayışında

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
AI-generated illustration (GPT-1.5) depicting a POV of a Steenbeck flatbed editing table as robot hands examine celluloid footage of a love scene from an old movie.

AI modelleri hala kimin kim olduğunu ve bir filmde neler olduğunu takip edemez. Yeni bir sistem, yüz tanıma ve sahne özeti oluşturma işlemlerini düzenleyerek, karakterleri doğru bir şekilde takip eder ve plotu tüm film boyunca tutarlı रखतır.

 

Sanal zeka ile Hollywood tarzı filmleri izletmek ve anlamak, bir niş veya marjinal bir uğraş gibi görünebilir; ancak bir filmi baştan sona izleyebilen, tüm karakterlerin ilerleyişini takip edebilen ve plotu takip edebilen bir sistem, yalnızca doğrudan uygulamalara değil, aynı zamanda farklı alanlardaki birçok periferik veya ilişkisiz zorluğa da olanak tanır.

Film izleme AI modelleri için düşük asma kirişi, öneri sistemleridir, Netflix, Amazon Prime ve HBO Max gibi akış platformlarında. Bir filmin gelişimini ve karakter eylemlerini ayrıntılı bir şekilde anlamak, izleyicilerin (sık sık spekülatif) tercihlerine ve coşkularına daha yakın bir eşleşme sağlar.

Daha da önemlisi, bir filmi derinlemesine anlamak, anahtar kelime oluşturma ve daha doğru kategorileme sağlar, böylece decades ago yazılmış olan kopya film açıklamalarının devam etmesini önler. Bu bilgiler, diyalogdan veya görsellerden açık olmayabilecek bir filmdeki “yetişkin” temalarının varlığını da ortaya çıkarabilir.

Ek olarak, bir kataloğun daha eski filmleri, güncellenmemiş derecelendirmeler ve açıklamalar içerebilir; Örneğin, 1950’lerin bir filminde normalize edilen dil ve deyimler şimdi daha fazla dikkat gerektirebilir. Ancak bir film anlatısının bağlamını gerçekten takip etmeden, bu olaylar aşırı veya az vurgulanabilir.

Daha geniş olarak, geliştirilmiş film analiz yaklaşımları, olay tanıma sorununa büyük ölçüde katkıda bulunabilir, bu da güvenlik izleme, otomatik spor yorumları ve tüm medya türleri boyunca çeşitli özetler için hayati önem taşır.

Bu nedenle, ‘AI tabanlı film izleme’ bilgisayar görüşü literatüründe şaşırtıcı bir şekilde iyi bir şekilde temsil edilmektedir.

Büyük Resmi Görmek

En son giren, MovieTeller adlı bir akademik ve endüstriyel işbirliğidir – Çin’den, çeşitli AI uygulamalarını bu zorluğun alt görevlerine bölen yeni bir başlangıç yapar, genellikle tek bir latent uzaydan tüm gerekli görevleri gerçekleştirebilen ayrı ve kapsül modelleri eğitmek yerine.

Yazarlar, önceki Vision-Language Modellerinin (VLM) aynı görevle karşılaştıklarında, tek çerçeveli analiz ötesine ilerleyemediklerini ve karakterleri sürekli olarak tanımlamakta zorluk çektiğini gözlemlediler; bu, böyle bir sistemin en önemli özelliği:

Yeni sistem, MovieTeller, bir yüz tanıma sistemi kullanarak sahne içindeki insanları sürekli olarak tanımlayabilme yeteneğine sahiptir; ancak bu, plot gelişimlerini takip etmeyi sağlayan daha kapsamlı bir bağlama adanmışlıktır. Kaynak - https://arxiv.org/pdf/2602.23228

Yeni sistem, MovieTeller, bir yüz tanıma sistemi kullanarak sahne içindeki insanları sürekli olarak tanımlayabilme yeteneğine sahiptir; ancak bu, plot gelişimlerini takip etmeyi sağlayan daha kapsamlı bir bağlama adanmışlıktır. Kaynak

Yazarlar şöyle diyor:

‘Genel amaçlı VLM’ler genellikle uzun bir anlatıda belirli karakterleri tanımakta ve sürekli olarak takip etmekte zorluk çeker. Bir ana karakteri bir sahne içinde “bir adam” olarak ve başka bir sahne içinde “bir kişi” olarak tanımlayabilir, görsel temsilini tutarlı bir kimliğe bağlayamaz.’

Yazarlar, Transformer’ların self-attention mekanizmasının kare karmaşıklık kullanması nedeniyle, bir full-length filmin her bir çerçevesini aynı anda işlemenin çok fazla hesaplama maliyeti gerektirdiğini belirtiyorlar. Bu nedenle, uniform frame-örnekleme veya basit birleştirme gibi yaklaşımlar, hikayenin akışını bozar ve parçalı özetler yerine tutarlı bir anlatı üretilir.

Örneğin, MovieTeller, bir yüz tanıma aracı ve bir sahne açıklama üretme aracı gibi çeşitli AI uygulamalarını birleştirir. Bu, bir filmi izlerken karakterlerin kimliklerini ve rollerini takip etmeyi sağlar.

MovieTeller, 60 full-length film ile test edildi, bu da yaklaşık 10.000 dakika film süresi anlamına gelir. Nicel ablasyon testleri ve insan çalışmaları, yazarların yaklaşımının önceki sistemlerin varsayılan ortamlarında ve varsayımlarında önemli ölçüde iyileşme sağladığını bildirdi.

Yeni makale, MovieTeller: Tool-augmented Movie Synopsis with ID Consistent Progressive Abstraction olarak adlandırılmıştır ve Zhejiang Üniversitesi, Çin Medya Grubu ve Watch AI Grubu’ndan beş yazar tarafından hazırlanmıştır.

Yöntem

MovieTeller şeması, üç aşamadan oluşur: sahne segmentasyonu ve anahtar kare çıkarma, PySceneDetect projesi aracılığıyla gerçekleştirilir; Factual-Grounded Scene Description Generation, Qwen2.5-VL-7B-Instruct VLM’nin özelleştirilmesi aracılığıyla gerçekleştirilir; ve progressive abstraction, ayrıntılı sahne açıklamalarını bölüm özetlerine ve ardından tutarlı bir senteza kondenser, bu da Qwen2.5 modeli tarafından gerçekleştirilir:

MovieTeller çerçevesinin概要u: bir full-length film önce sahnelere bölünür ve yüksek kaliteli anahtar karelere distille edilir; sonra, bir dış yüz tanıma aracı, karakter adlarını ve pozisyonlarını listeleyen bir.prompt ile Qwen modeline geçirilir.

MovieTeller çerçevesinin概要u: bir full-length film önce sahnelere bölünür ve yüksek kaliteli anahtar karelere distille edilir; sonra, bir dış yüz tanıma aracı, karakter adlarını ve pozisyonlarını listeleyen bir.prompt ile Qwen modeline geçirilir.

İlk aşama, PySceneDetect kullanarak filmi ayrı ayrı sahnelerine ayırır, her sahne bir anahtar kare ile temsil edilir.

Ancak, her kare iyi bir özet resmini yapmaz, çünkü geçiş anları, solma ve karanlık kareler daha sonraki analizi karıştırabilir. Bu nedenle, basit bir kalite kontrolü, aday kareler üzerinde bir filtre çalıştırır, parlaklık ve görsel varyasyonu ölçerek, yalnızca bilgi açısından zengin resimlerin seçildiğini sağlar.

Yüzü Yerleştirme

Bir yüz veritabanı, halka açık cast bilgilerinden oluşturulmuştur, her ana karakterin adını bir sayısal yüz embedding ile birlikte depolar. Bir yüz bir anahtar karede görünürse, gömme, veritabanındaki en yakın sonuca karşı eşleştirilir ve bir güven eşik değerini aşarsa kabul edilir. Bu, karakter adlarını belirli sınırlayıcı kutulara bağlayan “gerçek temeller” oluşturur.

Bu amaçlar için, InsightFace kullanılır, ArcFace loss-based tanınma başlığını kullanarak:

İki tanıdık yüz, MovieTeller projesi için benzer bir şekilde kullanılan Additive Angular Margin Loss (ArcFace) girişimi tarafından iyi hatırlanır. Kaynak - https://www.youtube.com/watch?v=y-D1tReryGA&t=80s

İki tanıdık yüz, MovieTeller projesi için benzer bir şekilde kullanılan Additive Angular Margin Loss (ArcFace) girişimi tarafından iyi hatırlanır. Kaynak

Annotated anahtar kareler, Qwen modeline, karakter adlarını ve pozisyonlarını listeleyen bir.prompt ile geçirilir:

Çünkü Vision-Language Modelleri bir full-length filmi tek bir geçişte absorbe edemez, MovieTeller ilk olarak malzemeyi sahne açıklamalarına ayırır. Bunlar, ardışık, bölüm benzeri bloklara gruplanır, daha sonra Qwen2.5’e geçirilir, bu da her bir bölümü özetler, plot gelişimlerini, karakter motivasyonlarını ve dönemeç noktalarını sıkıştırır, ancak önceden doğrulanan karakter adlarını korur.

Bu sıkıştırılmış bölüm özetleri, bir sonraki sentez için Qwen modeline geçirilir:

Sahne açıklamaları oluşturmak için kullanılan bir örnek.prompt şablonu, karakter adlarını ve sınırlayıcı kutuları Vision-Language Modelini kısıtlayacak ve ID tutarlı anlatıyı zorlayacak şekilde enjekte eder.

Sahne açıklamaları oluşturmak için kullanılan bir örnek.prompt şablonu, karakter adlarını ve sınırlayıcı kutuları Vision-Language Modelini kısıtlayacak ve ID tutarlı anlatıyı zorlayacak şekilde enjekte eder.

Varsayılan işlem başarılıysa, son çıktı, filmin anlatı arcını tutarlı bir şekilde yansıtmalıdır. Bu, özellikle zor bir görevdir, çünkü olası plot özetlerinin çeşitliliği ve sunulma şekli, birlikte uzunluğu, bu veri noktalarının genellikle ground truth tabanlı yaklaşımları benimsemesini imkansız kılar.

Veri ve Testler

Sistemi test etmek için, yazarlar 100 full-length filmten oluşan bir veri seti oluşturdular, bu da yaklaşık 166 saatlik bir süreye karşılık gelir. Filmler arasında Demir Adam 3, Veda Et Benim Concubine, Ye, İç, Adam, Kadın ve Narnia Kronikleri bulunuyordu. Araştırmacılar, tüm dahil edilen filmlerin IMDB’de 5.0’dan yüksek bir puan almasını gerektirdiler:

100 film boyunca veri seti bileşimi, 1992'den 2025'e kadar dengeli zaman kapsamı, İngilizce olmayan başlıkların hafif çoğunluğu ve Drama ve Aksiyon liderliğindeki geniş bir tür dağılımı, Sci-Fi, Korku, Komedi, Romantizm ve Tarih gibi türlerin temsil edildiği bir dağılım.

100 film boyunca veri seti bileşimi, 1992’den 2025’e kadar dengeli zaman kapsamı, İngilizce olmayan başlıkların hafif çoğunluğu ve Drama ve Aksiyon liderliğindeki geniş bir tür dağılımı, Sci-Fi, Korku, Komedi, Romantizm ve Tarih gibi türlerin temsil edildiği bir dağılım.

Geniş bir tür yelpazesi, herhangi bir tür için önyargı oluşturulmasını önlemek için tasarlandı.

Her filmin yüz veritabanı, iki ana aktörün resminden oluşuyordu – biri film stillerinden ve diğeri ilgili bir tanıtım fotoğrafından.

Python’da uygulanan testler, her biri 48GB VRAM ile donatılmış dört NVIDIA A40 GPU’sunda çalıştırıldı ve Qwen2.5 varyantı, merkezi VLM olarak kullanıldı. Ablasyon çalışmaları †† ayrıca InternVL3-8B ve WeThink-Qwen2.5VL-7B gibi alternatif durumların en iyi modelleriyle gerçekleştirildi.

Yeni çerçeve, iki ablasyon †† varyantına karşı test edildi: bir No-Hint temel çizgisi, Vision-Language Modelinin, karakter kimliklerine ilişkin metinsel ipuçları olmadan, yalnızca anahtar karelerden sahne açıklamaları üretebildiği bir ayar; ve bir Ad-Sadece-Hint ayarı, modelin, karakter adlarını alabildiği, ancak sınırlayıcı kutularını alamadığı bir ayar, yazarların, uzaysal temelin kimlik tutarlılığına ve anlatı tutarlılığına olan özel katkısını izole etmesine olanak tanır.

Metriclerle ilgili olarak, uzun plot özetlerine ground truth yöntemlerini uygulamanın zorluğuna dikkat edilerek, standard n-gram overlap metricleri gibi ROUGE ve BLEU yerine BERTScore ile F1 puanı kullanıldı, bu da bir referans sentezine karşı semantik benzerliği ölçer.

Ayrıca, Gemini 2.5 Flash, her sentezi, gerçeklik sadakati, ID tutarlılığı ve tamamlanması, anlatı tutarlılığı ve akışı, ve kısalık için puanladı, puanlar boyutlar boyunca ortalamalandı.

Son olarak, 50 rastgele örneklenen özetin insan değerlendirmesi, üçlü bir karşılaştırma yoluyla gerçekleştirildi, bu da otomatik değerlendirmelere pratik bir kontrol sağladı.

Aşağıda, üç temel model için BERTScore (F1) sonuçlarını görüyoruz: Qwen2.5-VL, InternVL3 ve WeThink. Her biri, üç farklı yapılandırmada test edildi: No-Hint, Ad-Sadece ve tam MovieTeller sistemi:

Üç temel Vision-Language Modeli ve üç deneysel ayar boyunca BERTScore (F1) karşılaştırması, karakter adlarını eklemenin sürekli kazançlar sağladığını ve uzaysal temelin dahil edilmesinin daha da iyileştirmeler sağladığını, MovieTeller'in her durumda en yüksek puanları aldığını gösteriyor.

Üç temel Vision-Language Modeli ve üç deneysel ayar boyunca BERTScore (F1) karşılaştırması, karakter adlarını eklemenin sürekli kazançlar sağladığını ve uzaysal temelin dahil edilmesinin daha da iyileştirmeler sağladığını, MovieTeller’in her durumda en yüksek puanları aldığını gösteriyor.

Yazarlar, desenin tüm üç temel model boyunca tutarlı olduğunu belirtiyorlar: yalnızca ham anahtar kareleri kullanmak en zayıf performansı sağlar; karakter adlarını eklemek mütevazi bir iyileşme sağlar; ve adları sınırlayıcı kutularla birleştirmek en güçlü sonuçları verir. Kazançlar dramatik değil, ancak tam temellendirilmiş yapılandırma, her ayar için referans sentezine en yüksek semantik hizalamayı sağlar.

Anlatı kalitesi değerlendirmesiyle ilgili olarak, LLM tabanlı bir değerlendirme olarak, No-Hint temel çizgisi, kimlik tutarlılığıyla en çok mücadele eder, bu da genel puanını düşürür; ancak yalnızca adları sağlama, özellikle kimlikle ilgili boyutlarda önemli bir artış sağlar. Tam MovieTeller yapılandırması, yine tüm üç temel model boyunca en yüksek puanları alır:

Üç temel model boyunca LLM-as-a-Judge değerlendirmesi (1-5 ölçeği), karakter adlarını eklemenin kimlik tutarlılığını ve genel kaliteyi iyileştirdiğini, tam MovieTeller çerçevesinin gerçeklik sadakati, tutarlılık, kısalık ve final puanı açısından en yüksek puanları aldığını gösteriyor.

Üç temel model boyunca LLM-as-a-Judge değerlendirmesi (1-5 ölçeği), karakter adlarını eklemenin kimlik tutarlılığını ve genel kaliteyi iyileştirdiğini, tam MovieTeller çerçevesinin gerçeklik sadakati, tutarlılık, kısalık ve final puanı açısından en yüksek puanları aldığını gösteriyor.

En güçlü kazançlar, kimlik tutarlılığında ve final ortalama puanında görünür, bu da uzaysal temelin, modelin kimin ne yaptığını takip etmesini sağlar.

50 rastgele örneklenen özetin insan değerlendirmesinde, katılımcılara üç özet gösterildi ve en iyisini seçmeleri istendi:

<img class=" wp-image-287300" src="https://www.unite.ai/wp-content/uploads/2026/02/table-3-3.jpg" alt="Üç temel model boyunca insan tercih oranları, tam MovieTeller özetlerinin her durumda en sık seçildiğini, No-Hint ve Ad-Sadece varyantlarını önemli ölçüde geride bıraktığını gösteriyor.” width=”618″ height=”131″ /> Üç temel model boyunca insan tercih oranları, tam MovieTeller özetlerinin her durumda en sık seçildiğini, No-Hint ve Ad-Sadece varyantlarını önemli ölçüde geride bıraktığını gösteriyor.

Son olarak, bir niteliksel test, The Bullet Vanishes (2012) filmi üzerinde gerçekleştirildi:

Kaynak makaleden alıntı yapılan bir figürün tamamını burada yeniden üretemiyoruz, çünkü çok uzun ve metin yoğundur. Lütfen kaynak makaleye başvurun.

Kaynak makaleden alıntı yapılan bir figürün tamamını burada yeniden üretemiyoruz, çünkü çok uzun ve metin yoğundur. Lütfen kaynak makaleye başvurun.

Burada, No-Hint temel çizgisi, karakterleri genel terimlerle tanımlayan ve rollerini bulanıklaştıran belirsiz bir sentez üretir, bu da olay zincirini takip etmeyi zorlaştırır. Yalnızca adları sağlama, yüzey düzeyinde bir iyileşme sağlar, ancak anlatı hala dağılır, karakter ilişkileri ve motivasyonları “düzleştirilmiş” bir şekilde tanımlanır.

Tersine, tam MovieTeller varyantı, kimlikleri tüm sentez boyunca stabil tutar ve eylemleri doğru karakterlere bağlar, bu da soruşturma plotunun daha net bir neden-sonuç zinciri ile ilerlemesini sağlar. Belirli gerilimler ve rol dinamikleri korunur, soyutlanmaz, bu da özetin, bir dizi bağlantısız anahtardan ziyade filmin merkezi anlatısını tutarlı bir şekilde yeniden anlatan bir metin gibi okunmasını sağlar:

Son karşılaştırmanın bir parçası, burada tam olarak yeniden üretemiyoruz, bir ablated ve tam MovieTeller sentezini gösteriyor. Lütfen kaynak makaleye başvurun.

Son karşılaştırmanın bir parçası, burada tam olarak yeniden üretemiyoruz, bir ablated ve tam MovieTeller sentezini gösteriyor. Lütfen kaynak makaleye başvurun.

Sonuç

Bu tür yeni projelerin çoğu, Bilgisayar Görüşü literatüründe yer alır, ancak AI tarafından üretilen film özetleme, Makine Öğrenimi araştırmalarında birçok başka disiplini ve alanı kapsar ve hangisinin kayıp parçayı sağlayacağı bilinmez; MovieTeller, görevleri uygun modüller boyunca bölen bir adım atar, ancak daha sonra, daha elegant bir çözüme yol açan “parçalı” hissi korur.

 

* Bu kurumu, bazı araştırmalar sonrasında bile tanımlayamadım.

IMDB veya OMDB gibi bir şey olacağını varsayarız, ancak kaynak belirtilmemiştir.

†† Lütfen kapsamlı ablasyon için kaynak makaleye başvurun, çünkü yalnızca istisnai durumlarda tam ablasyon hakkında bilgi veriyoruz. Bu bağlamda bahsedilen tedavi edilmemiş ablasyon çalışmaları, makalenin genel bulgularını zayıflatmaz.

İlk olarak 27 Şubat 2026 Cuma günü yayımlandı.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai