Anderson का एंगल

हुन्युआनकस्टम वीडियो डीपफेक्स के साथ एकल-इमेज, ऑडियो और लिप सिंक को लाता है

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें
Images from the new paper at https://arxiv.org/pdf/2505.04512

यह लेख हुन्युआन वीडियो वर्ल्ड मॉडल के एक नए संस्करण के बारे में चर्चा करता है, जिसे ‘हुन्युआनकस्टम’ कहा जाता है। नए पेपर की कवरेज की व्यापकता, संयुक्त रूप से कई उदाहरण वीडियो में कई मुद्दों के साथ प्रोजेक्ट पेज *, हमें सामान्य कवरेज और सीमित पुनरुत्पादन के लिए मजबूर करती है।

कृपया ध्यान दें कि पेपर एपीआई-आधारित जनरेटिव सिस्टम क्लिंग को ‘केलिंग’ के रूप में संदर्भित करता है। स्पष्टता के लिए, मैं पूरे लेख में ‘क्लिंग’ का उल्लेख करता हूं।

 

टेंसेंट अपने हुन्युआन वीडियो मॉडल के एक नए संस्करण को जारी करने की प्रक्रिया में है, जिसे हुन्युआनकस्टम कहा जाता है। यह नया रिलीज़ हुन्युआन लोरा मॉडल को अप्रचलित बनाने में सक्षम होने के लिए प्रतीत होता है, जिससे उपयोगकर्ता एक एकल छवि के माध्यम से ‘डीपफेक’-शैली के वीडियो अनुकूलन को बना सकता है:

[वीडियो चौड़ाई=”2508″ ऊंचाई=”408″ mp4=”https://www.unite.ai/wp-content/uploads/2025/05/HunyuanCustom-cooking-noodles-AE_bordered.mp4″ लूप=”सही”][/वीडियो]

प्ले करने के लिए क्लिक करें। प्रोम्प्ट: ‘एक आदमी संगीत सुन रहा है और रसोई में स्नेल नूडल्स पका रहा है’। नए तरीके की तुलना दोनों बंद-स्रोत और ओपन-सोर्स तरीकों से की जाती है, जिनमें क्लिंग भी शामिल है, जो इस स्थान में एक महत्वपूर्ण प्रतिद्वंद्वी है। स्रोत: https://hunyuancustom.github.io/ (चेतावनी: सीपीयू/मेमोरी-गहन साइट!)

उपरोक्त वीडियो के बायीं-सबसे कॉलम में, हम हुन्युआनकस्टम को दिए गए एकल स्रोत छवि को देखते हैं, उसके बगल में नए सिस्टम की प्रॉम्प्ट की व्याख्या। शेष कॉलम विभिन्न प्रोप्राइटरी और फॉस्स सिस्टम से परिणाम दिखाते हैं: क्लिंग; विडु; पिका; हैलुओ; और वान-आधारित स्कायरील्स-ए2.

नीचे दिए गए वीडियो में, हम इस रिलीज़ के लिए तीन परिदृश्यों के रेंडर देखते हैं: क्रमशः, व्यक्ति + वस्तु; एकल-चरित्र अनुकरण; और वर्चुअल ट्राई-ऑन (व्यक्ति + कपड़े)

[वीडियो चौड़ाई=”1288″ ऊंचाई=”728″ mp4=”https://www.unite.ai/wp-content/uploads/2025/05/hunyuancustom-3x-examples_bordered.mp4″ लूप=”सही”][/वीडियो]

प्ले करने के लिए क्लिक करें।। हुन्युआन वीडियो के समर्थन साइट से संपादित तीन उदाहरण,

हम इन उदाहरणों से कुछ बातें देख सकते हैं, ज्यादातर एक एकल स्रोत छवि पर निर्भर करने के संबंध में:

पहले क्लिप में, आदमी मूल रूप से अभी भी कैमरे का सामना कर रहा है। वह अपना सिर नीचे और पार्श्व में 20-25 डिग्री के घुमाव से अधिक नहीं करता है, लेकिन, एक झुकाव में जो उस से अधिक है, प्रणाली वास्तव में अनुमान लगाने के लिए शुरू हो जाएगी कि वह प्रोफ़ाइल में कैसा दिखता है। यह कठिन है, शायद एकमात्र फ्रंटल छवि से सटीक रूप से मापना असंभव है।

दूसरे उदाहरण में, हम देखते हैं कि छोटी लड़की मुस्करा रही है जैसा कि स्थिर स्रोत छवि में है, फिर से एकमात्र छवि के संदर्भ के रूप में। हुन्युआनकस्टम को उसके ‘आराम के चेहरे’ की तरह कैसा दिखता है, इसके बारे में एक अप्रशिक्षित अनुमान लगाना होगा। इसके अलावा, उसका चेहरा पिछले उदाहरण (‘आदमी क्रिस्प्स खा रहा है’) से अधिक नहीं है जो कैमरे के सामने की मुद्रा से विचलित होता है।

अंतिम उदाहरण में, हम देखते हैं कि चूंकि स्रोत सामग्री – महिला और वह जिस कपड़ों में पहनने के लिए प्रेरित की जा रही है – पूरी छवियां नहीं हैं, इसलिए रेंडर ने परिदृश्य को फिट करने के लिए फसल की है – जो वास्तव में एक डेटा समस्या के लिए एक相当 अच्छा समाधान है!

बिंदु यह है कि हालांकि नया सिस्टम एक से अधिक छवियों (जैसे व्यक्ति + क्रिस्प्स, या व्यक्ति + कपड़े) को संभाल सकता है, यह एक ही व्यक्ति के विभिन्न कोण या वैकल्पिक दृश्यों की अनुमति नहीं देता है, ताकि विभिन्न अभिव्यक्तियों या असामान्य कोणों को समायोजित किया जा सके। इस सीमा तक, सिस्टम हुन्युआन वीडियो के आसपास बढ़े हुए लोरा मॉडल को बदलने के लिए संघर्ष कर सकता है जो एकल छवि से सुसंगत व्यक्तियों का उत्पादन करने में मदद कर सकते हैं (20-60 छवियां आमतौर पर प्रशिक्षण डेटासेट में होती हैं)।

वायर्ड फॉर साउंड

ऑडियो के लिए, हुन्युआनकस्टम लैटेंटसिंक सिस्टम का लाभ उठाता है (जो शौकिया लोगों के लिए सेट अप करना और अच्छे परिणाम प्राप्त करना मुश्किल है) ऑडियो और पाठ के साथ मिलाने के लिए होठों की गति प्राप्त करने के लिए जो उपयोगकर्ता प्रदान करता है:

[वीडियो चौड़ाई=”1672″ ऊंचाई=”728″ mp4=”https://www.unite.ai/wp-content/uploads/2025/05/audio-examples-hunyuancontrol_bordered.mp4″][/वीडियो]

प्ले करने के लिए क्लिक करें। हुन्युआनकस्टम की सहायक साइट से विभिन्न उदाहरणों का संपादन, संपादित किया गया है।

लेखन के समय, कोई अंग्रेजी भाषा के उदाहरण नहीं हैं, लेकिन वे काफी अच्छे लगते हैं – और अधिक यदि उनके निर्माण की विधि आसानी से स्थापित और सुलभ है।

मौजूदा वीडियो को संपादित करना

नया सिस्टम वीडियो-से-वीडियो (वी2वी, या विड2विड) संपादन के लिए बहुत प्रभावशाली परिणाम प्रदान करता है, जिसमें एक मौजूदा (वास्तविक) वीडियो का एक खंड मास्क किया जाता है और एक संदर्भ छवि में दिए गए विषय द्वारा बुद्धिमानी से प्रतिस्थापित किया जाता है। नीचे सहायक सामग्री साइट से एक उदाहरण है:

[वीडियो चौड़ाई=”984″ ऊंचाई=”520″ mp4=”https://www.unite.ai/wp-content/uploads/2025/05/video-custom-PLUSH-AE-_bordered.mp4″ लूप=”सही”][/वीडियो]

प्ले करने के लिए क्लिक करें। केवल केंद्रीय वस्तु को लक्षित किया जाता है, लेकिन जो उसके चारों ओर रहता है वह भी हुन्युआनकस्टम विड2विड पास में बदल जाता है।

जैसा कि हम देख सकते हैं, और जैसा कि विड2विड परिदृश्य में मानक है, पूरा वीडियो प्रक्रिया द्वारा कुछ हद तक बदल दिया जाता है, हालांकि लक्षित क्षेत्र में, अर्थात प्लश खिलौने में सबसे ज्यादा बदलाव होता है। संभवतः पाइपलाइनें विकसित की जा सकती हैं जो ऐसे परिवर्तनों को एक गार्बेज मैट दृष्टिकोण के तहत बना सकती हैं, जो मूल वीडियो सामग्री को अधिकांश भाग के लिए मूल रूप में छोड़ देता है। यह वही है जो एडोब फायरफ्लाई अंदर करता है और काफी अच्छा काम करता है – लेकिन यह फॉस्स जनरेटिव दृश्य में एक कम अध्ययन वाली प्रक्रिया है।

कहा जा रहा है, वैकल्पिक उदाहरणों में से अधिकांश बेहतर काम करते हैं जो इन एकीकरणों को लक्षित करते हैं, जैसा कि नीचे दिए गए संकलित संकलन में देखा जा सकता है:

[वीडियो चौड़ाई=”1032″ ऊंचाई=”920″ mp4=”https://www.unite.ai/wp-content/uploads/2025/05/vid2vid-hunyuancustom-examples2_bordered.mp4″ लूप=”सही” पोस्टर=”https://www.unite.ai/wp-content/uploads/2025/05/vlcsnap-00010.png”][/वीडियो]

प्ले करने के लिए क्लिक करें। हुन्युआनकस्टम में विड2विड का उपयोग करके इंजेक्ट की गई सामग्री के विभिन्न उदाहरण, जो अप्रभावित सामग्री के लिए उल्लेखनीय सम्मान प्रदर्शित करते हैं।

एक नया प्रारंभ?

यह पहल हुन्युआन वीडियो परियोजना का एक विकास है, न कि उस विकास धारा से दूर एक कठिन मोड़। परियोजना के सुधार विस्तृत वास्तुशिल्प सम्मिलन के रूप में पेश किए जाते हैं, न कि व्यापक संरचनात्मक परिवर्तन, जिसका उद्देश्य मॉडल को फ्रेम के माध्यम से पहचान विश्वासघात को बनाए रखने में सक्षम बनाना है, विषय-विशिष्ट फाइन-ट्यूनिंग पर निर्भर नहीं है, जैसा कि लोरा या पाठक अवरोहण दृष्टिकोणों के साथ होता है।

स्पष्ट करने के लिए, इसलिए, हुन्युआनकस्टम प्रशिक्षित नहीं है, बल्कि दिसंबर 2024 हुन्युआनवीडियो फाउंडेशन मॉडल का एक फाइन-ट्यूनिंग है।

जिन लोगों ने हुन्युआनवीडियो लोरास विकसित किए हैं, वे आश्चर्यचकित हो सकते हैं कि क्या वे इस नए संस्करण के साथ काम करेंगे या नहीं, या क्या उन्हें अधिक अनुकूलन क्षमताओं के लिए लोरा पहिया को फिर से बनाना होगा फिर से यदि वे इस नए रिलीज में निर्मित से अधिक अनुकूलन क्षमताएं चाहते हैं।

आम तौर पर, एक हाइपरस्केल मॉडल का एक भारी रूप से फाइन-ट्यून किया गया संस्करण मॉडल वजन को पर्याप्त रूप से बदल देता है कि पिछले मॉडल के लिए बनाए गए लोरास नए रिफाइन्ड मॉडल के साथ ठीक से काम नहीं करेंगे या बिल्कुल भी काम नहीं करेंगे।

कभी-कभी, हालांकि, एक फाइन-ट्यून की लोकप्रियता इसके मूल को चुनौती दे सकती है: एक फाइन-ट्यून का एक प्रभावी फोर्क बनने का एक उदाहरण, जिसके अपने समर्पित पारिस्थितिकी तंत्र और अनुयायी हैं, पोनी डिफ्यूजन है स्टेबल डिफ्यूजन एक्सएल (एसडीएक्सएल) का ट्यूनिंग। पोनी वर्तमान में सिविटएआई डोमेन पर 592,000+ डाउनलोड के साथ है, जिसमें व्यापक श्रृंखला के लोरास हैं जिन्होंने पोनी (और नहीं एसडीएक्सएल) का उपयोग किया है और जो पोनी को अनुमान समय में आवश्यक बनाते हैं।

रिलीज़

प्रोजेक्ट पेज नए पेपर के लिए (जिसका शीर्षक हुन्युआनकस्टम: एक अनुकूलित वीडियो जनरेशन के लिए एक बहुमोडल-ड्राइवन आर्किटेक्चर है) में एक गिटहब साइट के लिंक हैं जो लिखने के समय कार्यात्मक हो गए हैं, और जो स्थानीय कार्यान्वयन के लिए सभी कोड और आवश्यक वजन शामिल करने के लिए प्रतीत होते हैं, साथ ही एक प्रस्तावित समयरेखा (जिसमें केवल महत्वपूर्ण बात जो अभी तक आनी बाकी है वह कॉम्फ्यूआई एकीकरण है)।

लेखन के समय, प्रोजेक्ट का हगिंग फेस उपस्थिति अभी भी 404 है। हालांकि, एक एपीआई-आधारित संस्करण है जहां आप कथित तौर पर प्रणाली का डेमो कर सकते हैं, बशर्ते आप एक वीचैट स्कैन कोड प्रदान कर सकें।

मैंने शायद ही कभी एक असेंबली में इतने सारे परियोजनाओं का इतना व्यापक उपयोग देखा है, जैसा कि हुन्युआनकस्टम में है – और संभवतः कुछ लाइसेंस किसी भी मामले में एक पूर्ण रिलीज के लिए बाध्य करेंगे।

गिटहब पेज पर दो मॉडल की घोषणा की जाती है: एक 720px1280px संस्करण जिसके लिए 8)GB जीपीयू पीक मेमोरी की आवश्यकता होती है, और एक 512px896px संस्करण जिसके लिए 60GB जीपीयू पीक मेमोरी की आवश्यकता होती है।

रिपॉजिटरी में कहा गया है ‘न्यूनतम जीपीयू मेमोरी आवश्यकता 24GB के लिए 720px1280px129f है, लेकिन बहुत धीमी… हम 80GB की मेमोरी वाले जीपीयू का उपयोग करने की सलाह देते हैं बेहतर जनरेशन गुणवत्ता के लिए ‘ – और यह बताता है कि प्रणाली का परीक्षण अभी तक केवल लिनक्स पर किया गया है।

पहले हुन्युआन वीडियो मॉडल को आधिकारिक रिलीज के बाद क्वांटाइज किया गया है और कम से कम 24GB की वीआरएएम पर चलने में सक्षम है, और यह लगता है कि नई मॉडल को भी समुदाय द्वारा अधिक उपभोक्ता-मित्र रूपों में अनुकूलित किया जाएगा, और यह जल्द ही विंडोज सिस्टम पर भी उपयोग के लिए अनुकूलित हो जाएगी।

समय की कमी और इस रिलीज के साथ आने वाली जानकारी की अधिकता के कारण, हम केवल इस रिलीज पर एक व्यापक, बल्कि गहन देख नहीं सकते हैं। फिर भी, आइए हुन्युआनकस्टम को थोड़ा खोलें:

पेपर की एक झलक

हुन्युआनकस्टम के लिए डेटा पाइपलाइन, जो कथित तौर पर जीडीपीआर फ्रेमवर्क के अनुरूप है, सिंथेटिक और ओपन-सोर्स वीडियो डेटासेट दोनों को शामिल करती है, जिनमें ओपनह्यूमनविड शामिल है, जिसमें आठ मुख्य श्रेणियां हैं: मानव, जानवर, पौधे, परिदृश्य, वाहन, वस्तुएं, वास्तुकला, और एनीमे

[कैप्शन आईडी=”अटैचमेंट_217325″ संरेखित=”संरेखित-नहीं” चौड़ाई=”1200″]हुन्युआनकस्टम डेटा निर्माण पाइपलाइन में योगदान करने वाले विविध पैकेजों का एक अवलोकन, रिलीज पेपर से। स्रोत: https://arxiv.org/pdf/2505.04512 हुन्युआनकस्टम डेटा निर्माण पाइपलाइन में योगदान करने वाले विविध पैकेजों का एक अवलोकन, रिलीज पेपर से। स्रोत: https://arxiv.org/pdf/2505.04512[/कैप्शन]

प्रारंभिक फिल्टरिंग पीसीनडिटेक्ट के साथ शुरू होती है, जो वीडियो को एकल-शॉट क्लिप में विभाजित करती है। टेक्स्टबीपीएन-प्लस-प्लस तब वीडियो को हटा देता है जिनमें स्क्रीन पर अत्यधिक पाठ, उपशीर्षक, वॉटरमार्क या लोगो होते हैं।

रिज़ॉल्यूशन और अवधि में असंगतताओं को संबोधित करने के लिए, क्लिप को पांच सेकंड की लंबाई में मानकीकृत किया जाता है और 512 या 720 पिक्सल तक छोटी तरफ का आकार बदल दिया जाता है। सौंदर्य फिल्टरिंग कोआला-36एम का उपयोग करके की जाती है, जिसमें अनुकूलित डेटासेट के लिए 0.06 का कस्टम थ्रेशहोल्ड लागू किया जाता है।

विषय निष्कर्षण प्रक्रिया क्यूवेन7बी बड़े भाषा मॉडल (एलएलएम), योलो11एक्स वस्तु पहचान फ्रेमवर्क, और लोकप्रिय इनसाइटफेस आर्किटेक्चर को जोड़ती है, मानव पहचान की पहचान और सत्यापन करने के लिए।

गैर-मानव विषयों के लिए, क्यूवेनवीएल और ग्राउंडेड एसएएम 2 का उपयोग प्रासंगिक बाउंडिंग बॉक्स निकालने के लिए किया जाता है, जिन्हें बहुत छोटा होने पर हटा दिया जाता है।

[कैप्शन आईडी=”अटैचमेंट_217326″ संरेखित=”संरेखित-नहीं” चौड़ाई=”918″]हुन्युआन कंट्रोल प्रोजेक्ट में ग्राउंडेड एसएएम 2 के साथ सेमेंटिक सेगमेंटेशन के उदाहरण। स्रोत: https://github.com/IDEA-Research/Grounded-SAM-2 हुन्युआन कंट्रोल प्रोजेक्ट में ग्राउंडेड एसएएम 2 के साथ सेमेंटिक सेगमेंटेशन के उदाहरण। स्रोत: https://github.com/IDEA-Research/Grounded-SAM-2[/कैप्शन]

बहु-विषय निष्कर्षण फ्लोरेंस2 का उपयोग बाउंडिंग बॉक्स एनोटेशन के लिए करता है, और ग्राउंडेड एसएएम 2 का उपयोग सेगमेंटेशन के लिए करता है, जिसके बाद क्लस्टरिंग और प्रशिक्षण फ्रेम का समय सेगमेंटेशन होता है।

संसाधित क्लिप को आगे एनोटेशन के माध्यम से बढ़ाया जाता है, जिसमें हुन्युआन टीम द्वारा विकसित एक प्रोप्राइटरी संरचित-लेबलिंग सिस्टम शामिल है, जो परतदार मेटाडेटा जैसे विवरण और कैमरा मोशन संकेत प्रदान करता है।

मास्क ऑगमेंटेशन रणनीतियों को प्रशिक्षण के दौरान लागू किया गया था, जिसमें बाउंडिंग बॉक्स में रूपांतरण शामिल था, वस्तु के आकार को कम करने और सुनिश्चित करने के लिए कि मॉडल विविध वस्तु आकारों के लिए अनुकूल हो।

ऑडियो डेटा को लेटेंटसिंक का उपयोग करके सिंक्रोनाइज़ किया गया था, और क्लिप को हटा दिया गया था यदि सिंक्रोनाइजेशन स्कोर न्यूनतम थ्रेशहोल्ड से नीचे गिर जाता है।

ब्लाइंड इमेज क्वालिटी असेसमेंट फ्रेमवर्क हाइपरआईक्यूए का उपयोग उन वीडियो को बाहर करने के लिए किया गया था जो 40 (हाइपरआईक्यूए के स्व-निर्धारित पैमाने पर) से कम स्कोर करते थे। वैध ऑडियो ट्रैक को तब व्हिस्पर के साथ संसाधित किया गया ताकि डाउनस्ट्रीम कार्यों के लिए विशेषताएं निकाली जा सकें।

लेखक एलएलएवीए भाषा सहायक मॉडल को एनोटेशन चरण के दौरान शामिल करते हैं, और वे इस फ्रेमवर्क की केंद्रीय स्थिति पर जोर देते हैं जो हुन्युआनकस्टम में है। एलएवीए का उपयोग छवि कैप्शन और दृश्य सामग्री को पाठ प्रॉम्प्ट के साथ संरेखित करने में मदद करने के लिए किया जाता है, जो मॉडल के निर्माण में एक सुसंगत प्रशिक्षण संकेत के निर्माण का समर्थन करता है:

[कैप्शन आईडी=”अटैचमेंट_217327″ संरेखित=”संरेखित-नहीं” चौड़ाई=”901″]हुन्युआनकस्टम फ्रेमवर्क पाठ, छवि, ऑडियो और वीडियो इनपुट पर स्थिर वीडियो जनरेशन को समर्थन करता है। हुन्युआनकस्टम फ्रेमवर्क पाठ, छवि, ऑडियो और वीडियो इनपुट पर स्थिर वीडियो जनरेशन को समर्थन करता है।[/कैप्शन]

एलएवीए की दृष्टि-भाषा संरेखण क्षमताओं का लाभ उठाकर, पाइपलाइन दृश्य तत्वों और उनके पाठ्य सारांशों के बीच एक अतिरिक्त परत सेमांटिक संगति प्राप्त करती है – विशेष रूप से बहु-विषय या जटिल दृश्य परिदृश्यों में।

कस्टम वीडियो

एक संदर्भ छवि और एक प्रॉम्प्ट के आधार पर वीडियो जनरेशन की अनुमति देने के लिए, एलएवीए के आसपास केंद्रित दो मॉड्यूल बनाए गए थे, पहले हुन्युआनवीडियो के इनपुट संरचना को अनुकूलित किया गया ताकि यह एक छवि के साथ-साथ पाठ को स्वीकार कर सके:

इसमें प्रॉम्प्ट को एक तरीके से प्रारूपित करना शामिल था जो छवि को सीधे एम्बेड करता है या इसे एक छोटे पहचान विवरण के साथ टैग करता है। एक सेपरेटर टोकन का उपयोग छवि एम्बेडिंग को प्रॉम्प्ट सामग्री से अभिभूत होने से रोकने के लिए किया गया था।

चूंकि एलएवीए का दृश्य एनकोडर विशेष रूप से जब एक एकल संदर्भ छवि को एक सामान्य सेमेंटिक एम्बेडिंग में अनुवाद करता है, तो विशिष्ट स्थानिक विवरण (विशेष रूप से) दबा देता है या छोड़ देता है, एक पहचान उन्नति मॉड्यूल शामिल किया गया था। चूंकि लगभग सभी वीडियो लेटेंट डिफ्यूजन मॉडल को एक लोरा के बिना पहचान बनाए रखने में कुछ कठिनाई होती है, भले ही यह एक पांच-सेकंड क्लिप में हो, इस मॉड्यूल का प्रदर्शन सामुदायिक परीक्षण में महत्वपूर्ण साबित हो सकता है।

किसी भी मामले में, संदर्भ छवि को पुनराकारित किया जाता है और मूल हुन्युआनवीडियो मॉडल से कारण 3डी-वीएई का उपयोग करके एन्कोड किया जाता है, और इसका लेटेंट वीडियो लेटेंट के माध्यम से समय के साथ डाला जाता है, एक स्थानिक ऑफसेट लागू किया जाता है ताकि छवि को आउटपुट में सीधे पुनरुत्पादित न किया जा सके, जबकि अभी भी पीढ़ी का मार्गदर्शन करते हुए।

मॉडल को फ्लो मैचिंग का उपयोग करके प्रशिक्षित किया गया था, जिसमें एक लॉगिट-नॉर्मल वितरण से नमूने निकाले गए थे – और नेटवर्क को इन शोर लेटेंट से सही वीडियो को पुनर्प्राप्त करने के लिए प्रशिक्षित किया गया था। एलएवीए और वीडियो जनरेटर दोनों को एक साथ फाइन-ट्यून किया गया ताकि छवि और प्रॉम्प्ट आउटपुट का मार्गदर्शन अधिक तरली से कर सकें और विषय पहचान को बनाए रख सकें।

बहु-विषय प्रॉम्प्ट के लिए, प्रत्येक छवि-पाठ जोड़े को अलग से एम्बेड किया गया और एक विशिष्ट समय स्थान सौंपा गया, जिससे पहचानों को भेद करने और बहु इंटरैक्टिंग विषयों के दृश्यों के जन्म का समर्थन करने की अनुमति मिली।

साउंड एंड विजन

हुन्युआनकस्टम उपयोगकर्ता-इनपुट ऑडियो और एक प्रॉम्प्ट का उपयोग करके ऑडियो/भाषण पीढ़ी की स्थिति में है, जिससे पात्र दृश्यों में बोलते हैं जो वर्णित सेटिंग को प्रतिबिंबित करते हैं:

इसका समर्थन करने के लिए, एक पहचान-वियुक्त ऑडियोनेट मॉड्यूल पहचान संकेतों को बाधित किए बिना ऑडियो विशेषताओं को पेश करता है जो संदर्भ छवि और प्रॉम्प्ट से एम्बेड किए गए हैं। ये विशेषताएं वीडियो टाइमलाइन में संकुचित होती हैं, फ्रेम-स्तर के खंडों में विभाजित होती हैं, और एक स्थानिक क्रॉस-ध्यान तंत्र का उपयोग करके इंजेक्ट की जाती हैं जो प्रत्येक फ्रेम को अलग रखती है, विषय स्थिरता को बनाए रखती है और समयिक हस्तक्षेप से बचाती है।

एक दूसरा समयिक इंजेक्शन मॉड्यूल समय और गति पर अधिक नियंत्रण प्रदान करता है, ऑडियोनेट के साथ मिलकर काम करता है, ऑडियो विशेषताओं को लेटेंट अनुक्रम के विशिष्ट क्षेत्रों में मैप करता है, और उन्हें मल्टी-लेयर परसेप्ट्रॉन (एमएलपी) में परिवर्तित करता है टोकन-वार गति ऑफसेट में। यह बोले गए इनपुट की लय और जोर के साथ इशारों और चेहरे की गति का पालन करने की अनुमति देता है जो अधिक सटीक है।

हुन्युआनकस्टम मौजूदा वीडियो में विषयों को सीधे संपादित करने की अनुमति देता है, वीडियो को पुनर्निर्माण किए बिना दृश्य में व्यक्तियों या वस्तुओं को प्रतिस्थापित या डाल सकता है। यह उन कार्यों के लिए उपयोगी बनाता है जिनमें दृश्य में उपस्थिति या गति में परिवर्तन शामिल है।

[वीडियो चौड़ाई=”1208″ ऊंचाई=”296″ mp4=”https://www.unite.ai/wp-content/uploads/2025/05/example-hunyuancustom_bordered.mp4″][/वीडियो]

प्ले करने के लिए क्लिक करें। सहायक साइट से एक और उदाहरण।

मौजूदा वीडियो में विषय प्रतिस्थापन को कुशलता से सुविधाजनक बनाने के लिए, नया सिस्टम हाल के तरीकों जैसे कि वर्तमान में लोकप्रिय वीएसीई के रूप में संसाधन-गहन दृष्टिकोण से परहेज करता है, या जो पूरे वीडियो अनुक्रमों को एक साथ मिलाते हैं, इसके बजाय प्रीट्रेन्ड कॉज़ल 3डी-वीएई का उपयोग करके एक संदर्भ वीडियो को संपीड़ित करना पसंद करता है – इसे पीढ़ी पाइपलाइन के आंतरिक वीडियो लेटेंट के साथ संरेखित करता है, और फिर दोनों को जोड़ता है। यह प्रक्रिया को अपेक्षाकृत हल्का रखता है, जबकि अभी भी बाहरी वीडियो सामग्री को आउटपुट का मार्गदर्शन करने की अनुमति देता है।

एक छोटा तंत्रिका नेटवर्क साफ इनपुट वीडियो और पीढ़ी के लिए उपयोग किए जाने वाले शोर लेटेंट के बीच संरेखण को संभालता है। प्रणाली इस जानकारी को इंजेक्ट करने के दो तरीकों का परीक्षण करती है: दोनों सेटों को संपीड़ित करने से पहले विशेषताओं को मिलाना; और फ्रेम दर फ्रेम जोड़ना। लेखकों ने पाया कि दूसरा तरीका बेहतर काम करता है, और गुणवत्ता हानि के बिना कम्प्यूटेशनल लोड को बनाए रखता है।

डेटा और परीक्षण

परीक्षणों में, उपयोग किए गए मीट्रिक थे: आरसीफेस में पहचान स्थिरता मॉड्यूल, जो संदर्भ छवि और पीढ़े गए वीडियो के प्रत्येक फ्रेम से चेहरे के एम्बेडिंग निकालता है, और फिर उनके बीच औसत कोसाइन समानता की गणना करता है; विषय समानता, योलो11एक्स सेगमेंट को डिनो 2 की तुलना के लिए भेजकर; सीएलआईपी-बी, पाठ-वीडियो संरेखण, जो प्रॉम्प्ट और पीढ़े गए वीडियो के बीच समानता को मापता है; सीएलआईपी-बी फिर से, प्रत्येक फ्रेम और इसके पड़ोसी फ्रेमों और पहले फ्रेम के साथ-साथ समयिक स्थिरता की गणना करने के लिए; और डायनामिक डिग्री, जैसा कि वीबेंच द्वारा परिभाषित किया गया है।

जैसा कि पहले उल्लेख किया गया था, बंद-स्रोत प्रतिद्वंद्वी हैलुओ थे; विडु 2.0; क्लिंग (1.6); और पिका। प्रतिस्पर्धी फॉस्स फ्रेमवर्क वीएसीई और स्कायरील्स-ए2 थे।

[कैप्शन आईडी=”अटैचमेंट_217329″ संरेखित=”संरेखित-नहीं” चौड़ाई=”941″]हुन्युआनकस्टम की तुलना में अग्रणी वीडियो अनुकूलन विधियों के साथ मॉडल प्रदर्शन मूल्यांकन आईडी स्थिरता (फेस-मिम), विषय समानता (डिनो-मिम), पाठ-वीडियो संरेखण (सीएलआईपी-बी-टी), समयिक स्थिरता (टेम्प-कन्सिस), और गति तीव्रता (डीडी) के साथ। इष्टतम और उप-इष्टतम परिणाम क्रमशः बोल्ड और अंडरलाइन में दिखाए गए हैं। हुन्युआनकस्टम की तुलना में अग्रणी वीडियो अनुकूलन विधियों के साथ मॉडल प्रदर्शन मूल्यांकन आईडी स्थिरता (फेस-मिम), विषय समानता (डिनो-मिम), पाठ-वीडियो संरेखण (सीएलआईपी-बी-टी), समयिक स्थिरता (टेम्प-कन्सिस), और गति तीव्रता (डीडी) के साथ। इष्टतम और उप-इष्टतम परिणाम क्रमशः बोल्ड और अंडरलाइन में दिखाए गए हैं।[/कैप्शन]

इन परिणामों में, लेखक कहते हैं:

‘हमारा [हुन्युआनकस्टम] आईडी स्थिरता और विषय स्थिरता में सर्वश्रेष्ठ प्रदर्शन करता है। यह प्रॉम्प्ट का पालन करने और समयिक स्थिरता में तुलनात्मक परिणाम भी प्राप्त करता है। [हैलुओ] का क्लिप स्कोर सबसे अच्छा है क्योंकि यह केवल आईडी स्थिरता के साथ पाठ निर्देशों का पालन कर सकता है, जो गैर-मानव विषयों (सबसे खराब डिनो-मिम) की स्थिरता की बलि देता है। डायनामिक-डिग्री के संदर्भ में, [विडु] और [वीएसीई] खराब प्रदर्शन करते हैं, जो मॉडल के छोटे आकार के कारण हो सकता है। ‘

हालांकि प्रोजेक्ट साइट पर तुलनात्मक वीडियो की भरमार है (जिसकी लेआउट तुलना के लिए आसान नहीं है), यह नहीं दिखाता है कि पीडीएफ में स्थिर परिणामों के बराबर एक वीडियो संस्करण है, जो प्रारंभिक गुणात्मक परीक्षणों के संबंध में है:

[कैप्शन आईडी=”अटैचमेंट_217330″ संरेखित=”संरेखित-नहीं” चौड़ाई=”1200″]वस्तु-केंद्रित वीडियो अनुकूलन पर तुलना। यद्यपि देखने वाले को स्रोत पीडीएफ के लिए बेहतर रिज़ॉल्यूशन और विवरण के लिए संदर्भित किया जाना चाहिए, प्रोजेक्ट साइट पर वीडियो एक अधिक प्रेरक संसाधन हो सकते हैं। वस्तु-केंद्रित वीडियो अनुकूलन पर तुलना। यद्यपि देखने वाले को स्रोत पीडीएफ के लिए बेहतर रिज़ॉल्यूशन और विवरण के लिए संदर्भित किया जाना चाहिए, प्रोजेक्ट साइट पर वीडियो एक अधिक प्रेरक संसाधन हो सकते हैं।[/कैप्शन]

लेखक यहां टिप्पणी करते हैं:

‘यह देखा जा सकता है कि [विडु], [स्कायरील्स ए2] और हमारी विधि प्रॉम्प्ट संरेखण और विषय स्थिरता में अपेक्षाकृत अच्छे परिणाम प्राप्त करती हैं, लेकिन हमारी वीडियो गुणवत्ता विडु और स्कायरील्स की तुलना में बेहतर है, हमारे आधार मॉडल, अर्थात [हुन्युआनवीडियो-13बी] के अच्छे वीडियो पीढ़ी प्रदर्शन के कारण। ‘

‘व्यावसायिक उत्पादों के बीच, हालांकि [क्लिंग] की वीडियो गुणवत्ता अच्छी है, वीडियो का पहला फ्रेम एक कॉपी-पेस्ट [समस्या] है, और कभी-कभी विषय बहुत तेजी से चलता है और [धुंधला] हो जाता है, जिससे देखने का अनुभव खराब हो जाता है।’

लेखक आगे कहते हैं कि पिका समयिक स्थिरता के संदर्भ में खराब प्रदर्शन करता है, जिसमें उपशीर्षक कलाकृतियां (डेटा क्यूरेशन से प्रभावित, जहां वीडियो क्लिप में पाठ तत्वों को मूल अवधारणाओं को प्रदूषित करने की अनुमति दी गई है) पेश करता है।

हैलुओ चेहरे की पहचान बनाए रखता है, वे कहते हैं, लेकिन पूर्ण-शरीर स्थिरता को बनाए रखने में विफल रहता है। खुले स्रोत विधियों के बीच, वीएसीई, शोधकर्ता दावा करते हैं, पहचान स्थिरता को बनाए रखने में असमर्थ है, जबकि वे दावा करते हैं कि हुन्युआनकस्टम वीडियो का उत्पादन करता है जो पहचान संरक्षण को बनाए रखता है, जबकि गुणवत्ता और विविधता को बनाए रखता है।

इसके बाद, बहु-विषय वीडियो अनुकूलन के लिए परीक्षण किए गए, जो समान प्रतिद्वंद्वियों के खिलाफ थे जैसा कि पिछले उदाहरण में था:

[कैप्शन आईडी=”अटैचमेंट_217331″ संरेखित=”संरेखित-नहीं” चौड़ाई=”1156″]बहु-विषय वीडियो अनुकूलन की तुलना। कृपया बेहतर विवरण और रिज़ॉल्यूशन के लिए पीडीएफ देखें। बहु-विषय वीडियो अनुकूलन की तुलना। कृपया बेहतर विवरण और रिज़ॉल्यूशन के लिए पीडीएफ देखें।[/कैप्शन]

पेपर में कहा गया है:

‘[पिका] निर्दिष्ट विषयों को उत्पन्न कर सकता है, लेकिन वीडियो फ्रेम में अस्थिरता प्रदर्शित करता है, जिसमें एक दृश्य में एक आदमी के गायब होने और एक महिला के दरवाजा खोलने में विफल होने जैसी घटनाएं शामिल हैं। [विडु] और [वीएसीई] मानव पहचान को आंशिक रूप से पकड़ लेते हैं, लेकिन गैर-मानव वस्तुओं के विवरण को खो देते हैं, जो गैर-मानव विषयों को प्रस्तुत करने में एक सीमा का संकेत देते हैं। ‘

‘[स्कायरील्स ए2] फ्रेम में अस्थिरता का अनुभव करता है, जिसमें चिप्स में परिवर्तन और दाहिने दृश्य में कई कलाकृतियां हैं। ‘

‘इसके विपरीत, हमारा हुन्युआनकस्टम मानव और गैर-मानव दोनों विषय पहचान को प्रभावी ढंग से पकड़ लेता है, प्रॉम्प्ट के अनुसार वीडियो उत्पन्न करता है, और उच्च दृश्य गुणवत्ता और स्थिरता बनाए रखता है।’

एक और प्रयोग ‘वर्चुअल ह्यूमन विज्ञापन’ था, जिसमें फ्रेमवर्क को एक उत्पाद के साथ एक व्यक्ति को एकीकृत करने का काम सौंपा गया था:

[कैप्शन आईडी=”अटैचमेंट_217332″ संरेखित=”संरेखित-नहीं” चौड़ाई=”999″]गुणात्मक परीक्षण दौर से न्यूरल 'उत्पाद प्लेसमेंट' के उदाहरण। कृपया बेहतर विवरण और रिज़ॉल्यूशन के लिए पीडीएफ देखें। गुणात्मक परीक्षण दौर से न्यूरल ‘उत्पाद प्लेसमेंट’ के उदाहरण। कृपया बेहतर विवरण और रिज़ॉल्यूशन के लिए पीडीएफ देखें।[/कैप्शन]

इस दौर के लिए, लेखक कहते हैं:

‘परिणाम यह दिखाते हैं कि हुन्युआनकस्टम प्रभावी ढंग से मानव की पहचान को बनाए रखता है, जबकि लक्ष्य उत्पाद के विवरण को संरक्षित करता है, जिसमें उस पर लिखा गया पाठ भी शामिल है। ‘

‘इसके अलावा, मानव और उत्पाद के बीच परस्पर क्रिया प्राकृतिक लगती है, और वीडियो दिए गए प्रॉम्प्ट का पालन करता है, हुन्युआनकस्टम को विज्ञापन वीडियो के जनरेशन में इसकी महत्वपूर्ण क्षमता को रेखांकित करता है।’

एक क्षेत्र जहां वीडियो परिणाम बहुत उपयोगी होते वह ऑडियो-संचालित विषय अनुकूलन के लिए गुणात्मक दौर था, जहां पात्र एक पाठ-विवरणित दृश्य और मुद्रा से संबंधित ऑडियो बोलता है:

[कैप्शन आईडी=”अटैचमेंट_217333″ संरेखित=”संरेखित-नहीं” चौड़ाई=”1007″]ऑडियो दौर के लिए आंशिक परिणाम - हालांकि वीडियो परिणाम इस मामले में अधिक वांछनीय हो सकते हैं। केवल पीडीएफ फिगर का ऊपरी आधा हिस्सा यहां पुनरुत्पादित किया गया है, क्योंकि यह बड़ा और इस लेख में समायोजित करना मुश्किल है। कृपया बेहतर विवरण और रिज़ॉल्यूशन के लिए स्रोत पीडीएफ देखें। ऑडियो दौर के लिए आंशिक परिणाम – हालांकि वीडियो परिणाम इस मामले में अधिक वांछनीय हो सकते हैं। केवल पीडीएफ फिगर का ऊपरी आधा हिस्सा यहां पुनरुत्पादित किया गया है, क्योंकि यह बड़ा और इस लेख में समायोजित करना मुश्किल है। कृपया बेहतर विवरण और रिज़ॉल्यूशन के लिए स्रोत पीडीएफ देखें।[/कैप्शन]

लेखक दावा करते हैं:

‘पिछले ऑडियो-संचालित मानव एनिमेशन विधियां एक मानव छवि और एक ऑडियो को इनपुट करती हैं, जहां मानव मुद्रा, पोशाक और पर्यावरण दिए गए छवि के साथ सुसंगत रहते हैं और नहीं सकते हैं वीडियो का उत्पादन करें जो दिए गए छवि से अलग है। ‘

‘… हमारा [हुन्युआनकस्टम] ऑडियो-संचालित मानव अनुकूलन को सक्षम बनाता है, जहां पात्र एक पाठ-विवरणित दृश्य और मुद्रा में संबंधित ऑडियो बोलता है, अधिक लचीले और नियंत्रित ऑडियो-संचालित मानव एनिमेशन की अनुमति देता है।’

अतिरिक्त परीक्षण (कृपया सभी विवरणों के लिए पीडीएफ देखें) में वीएसीई और क्लिंग 1.6 के खिलाफ वीडियो विषय प्रतिस्थापन के लिए एक दौर शामिल था:

[कैप्शन आईडी=”अटैचमेंट_217334″ संरेखित=”संरेखित-नहीं” चौड़ाई=”911″]वीडियो-से-वीडियो मोड में विषय प्रतिस्थापन का परीक्षण। कृपया बेहतर विवरण और रिज़ॉल्यूशन के लिए स्रोत पीडीएफ देखें। वीडियो-से-वीडियो मोड में विषय प्रतिस्थापन का परीक्षण। कृपया बेहतर विवरण और रिज़ॉल्यूशन के लिए स्रोत पीडीएफ देखें।[/कैप्शन]

इन परीक्षणों में, शोधकर्ता टिप्पणी करते हैं:

‘वीएसीई सीमा कलाकृतियों के कारण इनपुट मास्क के लिए सख्ती से चिपके रहने के कारण प्राकृतिक विषय आकार और गति निरंतरता में व्यवधान पैदा करता है। [क्लिंग], इसके विपरीत, एक कॉपी-पेस्ट प्रभाव प्रदर्शित करता है, जहां विषयों को सीधे वीडियो पर ओवरले किया जाता है, जिससे पृष्ठभूमि के साथ एकीकरण खराब हो जाता है। ‘

‘तुलना में, हुन्युआनकस्टम सीमा कलाकृतियों से बचता है, वीडियो पृष्ठभूमि के साथ सहज एकीकरण प्राप्त करता है, और मजबूत पहचान संरक्षण का प्रदर्शन करता है – वीडियो संपादन कार्यों में इसके उत्कृष्ट प्रदर्शन का प्रदर्शन करता है।’

निष्कर्ष

यह एक आकर्षक रिलीज है, कम से कम इसलिए कि यह एक ऐसी चीज को संबोधित करता है जिसके बारे में असंतुष्ट शौकिया दृश्य हाल ही में अधिक शिकायत कर रहा है – हुन्युआन वीडियो और वान 2.1 जैसी प्रणालियों में वास्तविकता की बढ़ी हुई क्षमता को एक नए आयाम की वास्तविकता प्रदान करने के लिए लिप-सिंक की कमी।

हालांकि प्रोजेक्ट साइट पर तुलनात्मक वीडियो की व्यवस्था यह मुश्किल बना देती है कि हुन्युआनकस्टम की क्षमताओं की तुलना पूर्ववर्ती प्रतिद्वंद्वियों से की जा सके, यह ध्यान देने योग्य है कि कुछ परियोजनाएं वीडियो संश्लेषण स्थान में क्लिंग के खिलाफ खुद को तुलना में डालने का साहस रखती हैं, जो हमेशा चार्ट के शीर्ष पर या उसके पास रहता है। टेंसेंट ने इस पदस्थ के खिलाफ प्रगति की है एक相当 प्रभावशाली तरीके से।

 

* समस्या यह है कि कुछ वीडियो इतने चौड़े, छोटे और उच्च-रिज़ॉल्यूशन वाले हैं कि वे मानक वीडियो प्लेयर जैसे वीएलसी या विंडोज मीडिया प्लेयर में नहीं चलेंगे, जो काली स्क्रीन दिखाते हैं।

पहली बार गुरुवार, 8 मई, 2025 को प्रकाशित।

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: martin@martinanderson.ai