Anderson का एंगल

एक पूरी फिल्म का पालन करने में सक्षम एक एआई की तलाश में

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें
AI-generated illustration (GPT-1.5) depicting a POV of a Steenbeck flatbed editing table as robot hands examine celluloid footage of a love scene from an old movie.

AI मॉडल अभी भी पूरी फिल्म में यह भूल जाते हैं कि कौन-सा पात्र कौन है और कथानक में क्या हो रहा है। चीन की नई MovieTeller प्रणाली चेहरा पहचान और चरणबद्ध सारांश को जोड़कर पात्रों की पहचान तथा कहानी को पूर्ण लंबाई की फिल्मों में सुसंगत रखती है।

फिल्म समझने वाली AI केवल मनोरंजन का सीमित प्रयोग नहीं है। यह Netflix, Amazon Prime और HBO Max जैसी सेवाओं की अनुशंसा, अधिक सटीक श्रेणीकरण और कीवर्ड, वयस्क विषयों की पहचान तथा पुरानी रेटिंग की समीक्षा में मदद कर सकती है। यही तकनीक सुरक्षा निगरानी, खेल कमेंट्री और अन्य मीडिया में घटना पहचान को भी बेहतर कर सकती है।

पूरी कहानी देखना

MovieTeller चुनौती को अलग-अलग उपकार्य में बाँटता है और प्रत्येक के लिए उपयुक्त उपकरण का उपयोग करता है। सामान्य Vision-Language Models अक्सर एकल फ्रेम से आगे नहीं बढ़ते और लंबी कहानी में पात्रों को लगातार पहचान नहीं पाते—एक दृश्य में नायक को “एक आदमी” और अगले में “एक व्यक्ति” कह देते हैं।

MovieTeller समर्पित चेहरा-पहचान प्रणाली से दृश्यों में लोगों की पहचान बनाए रखता है; व्यापक संदर्भ प्रणाली को कथानक के विकास का हिसाब रखने देता है। स्रोत

Transformer की self-attention की लागत अनुक्रम की लंबाई के साथ वर्गाकार बढ़ती है, इसलिए पूरी फिल्म के प्रत्येक फ्रेम को एक साथ संसाधित करना बहुत महँगा है। समान अंतराल पर फ्रेम चुनना या उन्हें सीधे जोड़ना कहानी के प्रवाह को तोड़ देता है और खंडित सारांश बनाता है। MovieTeller इसके बजाय प्रशिक्षण-रहित, समन्वित pipeline में चेहरा पहचान, स्मृति और क्रमिक संक्षेपण का उपयोग करता है।

प्रणाली को 60 पूर्ण फिल्मों, लगभग 10,000 मिनट के वीडियो, पर पूर्व विधियों के विरुद्ध परखा गया। मात्रात्मक ablation और मानव अध्ययन में इसने पुराने तरीकों से बेहतर परिणाम दिए। शोधपत्र का नाम MovieTeller: Tool-augmented Movie Synopsis with ID Consistent Progressive Abstraction है और इसमें Zhejiang University, China Media Group तथा Watch AI Group के पाँच लेखक शामिल हैं।

विधि

MovieTeller के तीन चरण हैं: PySceneDetect से दृश्य विभाजन और keyframe निकालना; अनुकूलित Qwen2.5-VL-7B-Instruct से तथ्य-आधारित दृश्य वर्णन; और progressive abstraction, जिसमें दृश्य वर्णनों को अध्याय सारांश तथा अंततः एक सुसंगत फिल्म-सारांश में बदला जाता है।

पूर्ण फिल्म को दृश्यों और उच्च-गुणवत्ता keyframes में बाँटा जाता है। बाहरी चेहरा-पहचान उपकरण पात्रों के नाम bounding boxes से जोड़ता है, VLM पहचान-सुसंगत दृश्य वर्णन बनाता है, और इन्हें क्रमशः अध्यायों व अंतिम सारांश में संक्षिप्त किया जाता है।

PySceneDetect स्पष्ट दृश्य बदलावों से फिल्म को खंडित करता है और हर दृश्य के लिए एक keyframe चुनता है। संक्रमण, fade-out और अँधेरे फ्रेम खराब प्रतिनिधि हो सकते हैं, इसलिए brightness और visual variation मापकर केवल सूचना-समृद्ध चित्र रखे जाते हैं।

चेहरे को नाम देना

सार्वजनिक कलाकार-सूचना से चेहरा डेटाबेस बनाया गया, जिसमें मुख्य पात्र का नाम और numerical face embedding रखा गया। keyframe में दिखे चेहरे को डेटाबेस से मिलाया जाता है और confidence threshold पार करने वाला निकटतम परिणाम स्वीकार किया जाता है। InsightFace के ArcFace loss आधारित recognition head से नाम को सही bounding box से जोड़ा जाता है।

ArcFace की Additive Angular Margin Loss पहल द्वारा पहचाने गए दो परिचित चेहरे; MovieTeller इसी प्रकार की पहचान का उपयोग करता है। स्रोत

नाम और स्थान सहित annotated keyframes Qwen को दिए जाते हैं। पूरी फिल्म एक बार में समाहित नहीं हो सकती, इसलिए पहले दृश्य वर्णन बनते हैं; लगातार दृश्यों को अध्याय-जैसे समूहों में रखकर Qwen2.5 कथानक, प्रेरणा और turning points को पात्रों के सत्यापित नामों के साथ संक्षिप्त करता है। अध्याय सारांशों को जोड़कर मॉडल से पूर्ण synopsis माँगा जाता है।

दृश्य-वर्णन prompt का नमूना, जिसमें सत्यापित पात्र-नाम और bounding boxes स्पष्ट रूप से डालकर पहचान-सुसंगत narration लागू किया जाता है।

यह कठिन मूल्यांकन समस्या है, क्योंकि एक ही फिल्म के अनेक वैध सारांश, लेखन-शैलियाँ और लंबाइयाँ हो सकती हैं; सामान्य ground-truth आधारित तुलना इसलिए सीमित है।

डेटा और परीक्षण

लेखकों ने 100 पूर्ण फिल्मों का विशेष डेटा बनाया, जिसकी कुल अवधि लगभग 166 घंटे थी। इसमें Iron Man 3, Farewell My Concubine, Eat Drink Man Woman और The Chronicles of Narnia शामिल थे। हर फिल्म की IMDb rating 5.0 से अधिक थी।

100 फिल्मों की संरचना: 1992 से 2025 तक संतुलित समय-वितरण, गैर-अंग्रेजी शीर्षकों का हल्का बहुमत और Drama, Action, Sci-Fi, Horror, Comedy, Romance तथा History सहित विविध genres।

हर फिल्म के मुख्य अभिनेता की दो तस्वीरें—एक फिल्म still और एक publicity photo—चेहरा डेटा में रखी गईं। Python implementation को 48GB VRAM वाले चार NVIDIA A40 GPU पर Qwen2.5-VL के साथ चलाया गया। अतिरिक्त ablation में InternVL3-8B और WeThink-Qwen2.5VL-7B भी उपयोग हुए।

तीन settings की तुलना हुई: No-Hint, जिसमें केवल keyframe था; Name-Only, जिसमें नाम मिले पर bounding boxes नहीं; और पूर्ण MovieTeller, जिसमें नाम के साथ स्थान भी दिया गया। इससे spatial grounding के स्वतंत्र योगदान को मापा गया।

लंबे कथानक सारांशों के लिए ROUGE और BLEU जैसे n-gram overlap metrics छोड़कर सार्वजनिक encyclopedia के संदर्भ synopsis के साथ BERTScore F1 लिया गया। Gemini 2.5 Flash ने factual faithfulness, पहचान-सुसंगति और completeness, narrative coherence तथा conciseness को score किया। 50 randomly sampled summaries पर pairwise human evaluation भी हुआ।

तीन base VLM और तीन settings में BERTScore F1। केवल नाम जोड़ने से सुधार हुआ और spatial grounding से और लाभ मिला; MovieTeller हर backbone में सर्वोच्च रहा।

सभी तीन backbone में raw keyframe सबसे कमजोर, नाम जोड़ना थोड़ा बेहतर और नाम के साथ bounding box देना सर्वोत्तम रहा। लाभ बहुत बड़ा नहीं था, पर पूर्ण grounding ने हर setting में reference synopsis के साथ सबसे अधिक semantic alignment दिया।

1–5 scale पर LLM-as-a-Judge मूल्यांकन। नाम पहचान-सुसंगति बढ़ाते हैं, जबकि पूर्ण MovieTeller factual faithfulness, coherence, conciseness और final rating में सर्वोच्च है।

सबसे मजबूत लाभ ID consistency और औसत final score में था। इससे संकेत मिलता है कि spatial grounding कथानक आगे बढ़ते समय मॉडल को स्पष्ट रखता है कि कौन क्या कर रहा है।

तीन-तरफ़ा forced-choice मानव मूल्यांकन में पूर्ण grounding वाले MovieTeller सारांश सभी base models पर सबसे अधिक चुने गए और No-Hint तथा Name-Only को स्पष्ट रूप से पीछे छोड़ा।

The Bullet Vanishes (2012) पर qualitative test भी किया गया।

मूल शोध का यह figure बहुत लंबा और text-dense है, इसलिए पूरा पुनरुत्पादित नहीं किया जा सकता; विस्तृत तुलना के लिए स्रोत पत्र देखें।

No-Hint ने पात्रों को सामान्य शब्दों में बताया और भूमिकाएँ मिला दीं। केवल नाम देने से सतही recall सुधरा, लेकिन संबंध और प्रेरणाएँ सपाट रहीं। पूर्ण MovieTeller ने पूरे सारांश में पहचान स्थिर रखी, सही पात्रों से कार्य जोड़े और जाँच-कथानक की कारण-श्रृंखला अधिक स्पष्ट बनाई।

अंतिम तुलना का एक भाग, जिसमें ablated और पूर्ण MovieTeller सारांश दिखते हैं। संपूर्ण figure के लिए स्रोत शोध देखें।

निष्कर्ष

AI फिल्म-सारांश computer vision के साथ अनेक machine-learning क्षेत्रों को जोड़ता है। यह बताना कठिन है कि अंतिम समाधान किस क्षेत्र से आएगा। MovieTeller उपयुक्त modules में कार्य बाँटकर सही दिशा में कदम उठाता है, बजाय एक latent space में सब कुछ हल करने की कोशिश के; फिर भी इसका संयोजित स्वरूप संकेत देता है कि भविष्य में अधिक सुरुचिपूर्ण, एकीकृत समाधान उभर सकता है।

* Watch AI Group की संस्था की स्वतंत्र पहचान स्पष्ट नहीं हुई। † कलाकार-सूचना का स्रोत नहीं बताया गया। †† पूर्ण ablation के लिए मूल शोध देखें; छोड़े गए परिणाम मुख्य निष्कर्ष को कमजोर नहीं करते।

पहली बार शुक्रवार, 27 फ़रवरी 2026 को प्रकाशित।

मशीन लर्निंग पर लेखक, मानव छवि संश्लेषण में डोमेन विशेषज्ञ। Metaphysic.ai में शोध सामग्री के पूर्व प्रमुख, जब तक यह DNEG की Brahma.ai में विलीन नहीं हो गया।
वेबसाइट: martinanderson.ai
संपर्क: martin@martinanderson.ai