Anderson का एंगल
लोरा को मॉडल संस्करण अपग्रेड से बचाने के लिए

मेरे हाल के कवरेज के बाद हुन्युआन वीडियो लोरा (छोटे, प्रशिक्षित फ़ाइलें जो मल्टी-बिलियन पैरामीटर टेक्स्ट-टू-वीडियो और इमेज-टू-वीडियो फाउंडेशन मॉडल में कस्टम व्यक्तित्व को इंजेक्ट कर सकते हैं) की वृद्धि के बारे में, सिविट समुदाय में संबंधित लोरा की संख्या 185% बढ़ गई है।

हुन्युआन वीडियो लोरा बनाने के लिए कोई आसान या कम-प्रयास वाला तरीका नहीं है, लेकिन सिविट में सेलिब्रिटी और थीम्ड लोरा की सूची दैनिक रूप से बढ़ रही है। स्रोत: https://civitai.com/
हुन्युआन वीडियो (एचवी) के लिए इन ‘एड-ऑन व्यक्तित्व’ को उत्पादन करने के लिए संघर्ष कर रहे समुदाय भी अल्सरेटिंग है अनौपचारिक इमेज-टू-वीडियो (आई2वी) कार्यक्षमता के वादा किए गए रिलीज़ के लिए हुन्युआन वीडियो में।
मानव इमेज सिंथेसिस के लिए खुला स्रोत के संबंध में, यह एक बड़ी बात है; हुन्युआन लोरा के विकास के साथ मिलकर, यह उपयोगकर्ताओं को लोगों की तस्वीरों को वीडियो में बदलने में सक्षम बना सकता है जो वीडियो के विकास के दौरान उनकी पहचान को कम नहीं करता है – जो वर्तमान में सभी राज्य-ऑफ-द-आर्ट इमेज-टू-वीडियो जनरेटर में है, जिनमें क्लिंग, काइबर और रनवे एमएल शामिल हैं।
प्ले करने के लिए क्लिक करें। रनवे एमएल के राज्य-ऑफ-द-आर्ट जेन 3 टर्बो मॉडल से एक इमेज-टू-वीडियो जेनरेशन। हालांकि, अन्य सभी समान और कम राइवल मॉडल की तरह, यह कैमरे से दूर जाने पर स्थिर पहचान बनाए रखने में असमर्थ है, और शुरुआती छवि की विशिष्ट विशेषताएं ‘जेनेरिक डिफ्यूजन महिला’ बन जाती हैं।. स्रोत: https://app.runwayml.com/
एक कस्टम लोरा विकसित करके, जिस व्यक्ति के लिए व्यक्तित्व है, एक हुन्युआन आई2वी वर्कफ़्लो में एक वास्तविक फोटो का उपयोग शुरुआती बिंदु के रूप में किया जा सकता है। यह मॉडल के लेटेंट स्पेस में एक यादृच्छिक संख्या भेजने और जो भी सेमेंटिक परिदृश्य परिणाम से निपटने से बेहतर ‘बीज’ है।
संभावित रूप से, इस तरह के संयोजन की उपलब्धता स्टेबल डिफ्यूजन के लॉन्च के बाद से जनरेटिव एआई में सबसे महत्वपूर्ण परिवर्तनों में से एक का प्रतिनिधित्व कर सकती है, जिसमें खुले स्रोत उत्साही लोगों को जबरदस्त जनरेटिव शक्ति प्रदान की जाती है, बिना वर्तमान लोकप्रिय जेन विद प्रणालियों में सामग्री सेंसर द्वारा प्रदान किए गए नियमन (या ‘गेटकीपिंग’, यदि आप पसंद करते हैं) के।
जैसा कि मैं लिखता हूं, हुन्युआन इमेज-टू-वीडियो हुन्युआन वीडियो गिटहब रेपो में एक अनचेक्ड ‘टू-डू’ है, जिसमें शौकिया समुदाय अनौपचारिक रूप से एक हुन्युआन डेवलपर की डिस्कॉर्ड टिप्पणी की रिपोर्ट कर रहा है, जिसने कथित तौर पर कहा था कि इस कार्यक्षमता को जारी करने की समय सीमा को मॉडल के अधिक ‘अनियंत्रित‘ होने के कारण क्यू 1 में बाद में धकेल दिया गया है।

हुन्युआन वीडियो के लिए आधिकारिक सुविधा रिलीज़ चेकलिस्ट। स्रोत: https://github.com/Tencent/HunyuanVideo?tab=readme-ov-file#-open-source-plan
सटीक या नहीं, रेपो डेवलपर्स ने हुन्युआन चेकलिस्ट के बाकी हिस्सों पर काफी हद तक वितरित किया है, और इसलिए हुन्युआन आई2वी似乎 अंततः आने वाला है, चाहे वह सेंसर्ड, अनसेंसर्ड या किसी तरह से ‘अनलॉकेबल’ हो।
लेकिन जैसा कि हम ऊपर सूची में देख सकते हैं, आई2वी रिलीज़ एक अलग मॉडल है – जो यह बताता है कि वर्तमान हुन्युआन वीडियो लोरा की बढ़ती फसल में से कोई भी मॉडल के साथ काम नहीं करेगा।
इस (अब) भविष्यवाणी योग्य परिदृश्य में, लोरा प्रशिक्षण फ्रेमवर्क जैसे मुसुबी ट्यूनर और वनट्रेनर या तो नए मॉडल के समर्थन में वापस आ जाएंगे या रीसेट हो जाएंगे। इसके बीच, एक या दो सबसे तकनीकी रूप से कुशल (और उद्यमी) यूट्यूब एआई प्रतिभागी अपने समाधानों को पेट्रॉन के माध्यम से फिरौती देंगे जब तक कि दृश्य पकड़ नहीं लेता।
अपग्रेड थकान
लगभग कोई भी लोरा या फाइन-ट्यूनिंग उत्साही के रूप में अपग्रेड थकान का अनुभव नहीं करता है, क्योंकि जनरेटिव एआई में परिवर्तन की तेज और प्रतिस्पर्धी गति मॉडल फाउंड्री जैसे स्टेबिलिटी.ai, टेंसेंट और ब्लैक फॉरेस्ट लैब्स को बड़े और (कभी-कभी) बेहतर मॉडल का उत्पादन करने के लिए प्रोत्साहित करती है। अधिकतम व्यवहार्य आवृत्ति।
चूंकि ये नए और सुधारित मॉडल कम से कम अलग पूर्वाग्रह और वजन होंगे, और अधिक सामान्यतः एक अलग पैमाने और/या वास्तुकला होगी, इसका मतलब है कि फाइन-ट्यूनिंग समुदाय को अपने डेटासेट को फिर से निकालना होगा और नए संस्करण के लिए थका देने वाली प्रशिक्षण प्रक्रिया को दोहराना होगा।
इस कारण से, सिविट में कई प्रकार के स्टेबल डिफ्यूजन लोरा संस्करण उपलब्ध हैं:

अपग्रेड ट्रेल, सिविट.एआई में खोज फिल्टर विकल्पों में दृश्य
चूंकि इनमें से कोई भी हल्के लोरा मॉडल उच्च या निम्न मॉडल संस्करणों के साथ इंटरऑपरेबल नहीं है, और चूंकि उनमें से कई को लोकप्रिय बड़े पैमाने पर मॉडल मerging और फाइन-ट्यून पर निर्भरता है जो एक पुराने मॉडल का पालन करते हैं, समुदाय का एक महत्वपूर्ण हिस्सा एक ‘विरासत’ रिलीज़ के साथ चिपके रहते हैं, जैसा कि ग्राहक वफादारी विंडोज़ एक्सपी के प्रति बनी रहती है वर्षों बाद आधिकारिक समर्थन समाप्त हो गया।
परिवर्तन के अनुकूल
यह विषय एक नए पत्र के कारण आता है क्वालकॉम एआई रिसर्च से जो दावा करता है कि एक विधि विकसित की है जिसके द्वारा मौजूदा लोरा को ‘अपग्रेड’ किया जा सकता है एक नए जारी मॉडल संस्करण में।

मॉडल संस्करणों में लोरा का नमूना रूपांतरण。 स्रोत: https://arxiv.org/pdf/2501.16559
यह नहीं意味ा है कि नई दृष्टिकोण, लोरा-एक्स कहा जाता है, मुक्त रूप से सभी मॉडलों के बीच अनुवाद कर सकता है (अर्थात, टेक्स्ट से छवि मॉडल, या बड़े भाषा मॉडल [एलएलएम]); लेकिन लेखकों ने स्टेबल डिफ्यूजन वी1.5 > एसडीएक्सएल में एक लोरा का एक प्रभावी अनुवाद प्रदर्शित किया है, और टेक्स्ट-आधारित टिनीलमा 3टी मॉडल के लिए एक लोरा का एक रूपांतरण टिनीलमा 2.5टी में।
लोरा-एक्स लोरा पैरामीटर को अलग-अलग आधार मॉडलों में स्थानांतरित करता है पैरामीटर को संरक्षित करके स्रोत मॉडल के उपस्थान में; लेकिन केवल उन हिस्सों में जो मॉडल संस्करणों में पर्याप्त रूप से समान हैं।

बाएं, लोरा-एक्स स्रोत मॉडल के लिए एक एडाप्टर को फाइन-ट्यून करने के लिए एक योजना। दाएं, एसडी ईफ-वी1.0 और एसएसडी-1बी लक्ष्य मॉडल द्वारा उत्पन्न छवियां, एसडी-वी1.5 और एसडीएक्सएल से एडाप्टर लागू करने के बाद अतिरिक्त प्रशिक्षण के बिना।
जबकि यह परिदृश्यों के लिए एक व्यावहारिक समाधान प्रदान करता है जहां पुनः प्रशिक्षण वांछनीय या असंभव नहीं है (जैसे मूल प्रशिक्षण डेटा पर लाइसेंस परिवर्तन), यह विधि समान मॉडल वास्तुकला तक सीमित है, अन्य सीमाओं सहित।
हालांकि यह एक कम अध्ययन किए गए क्षेत्र में एक दुर्लभ प्रयास है, हम इस पत्र की गहराई से जांच नहीं करेंगे लोरा-एक्स की कई कमियों के कारण, जैसा कि इसके आलोचकों और सलाहकारों द्वारा ओपन रिव्यू में देखा गया है।
विधि की उपस्थान समानता पर निर्भरता इसके अनुप्रयोग को密न मॉडल तक सीमित करती है, और लेखकों ने समीक्षा मंच में स्वीकार किया है कि लोरा-एक्स को आसानी से महत्वपूर्ण रूप से अलग वास्तुकला में स्थानांतरित नहीं किया जा सकता है।
अन्य पीईएफटी दृष्टिकोण
लोरा को संस्करणों में अधिक पोर्टेबल बनाने की संभावना एक छोटी लेकिन दिलचस्प अध्ययन की धारा है, और लोरा-एक्स का मुख्य योगदान इस पीछा में इसका दावा है कि यह कोई प्रशिक्षण की आवश्यकता नहीं है। यह सख्ती से सच नहीं है, यदि आप पत्र पढ़ते हैं; लेकिन यह पिछले तरीकों की तुलना में कम से कम प्रशिक्षण की आवश्यकता है।
लोरा-एक्स पैरामीटर-эффектив फाइन-ट्यूनिंग (पीईएफटी) विधियों के कैनन में एक और प्रविष्टि है, जो बड़े पूर्व-प्रशिक्षित मॉडल को विशिष्ट कार्यों के लिए अनुकूलित करने की चुनौती का समाधान करती है बिना व्यापक पुनः प्रशिक्षण के। यह अवधारणात्मक दृष्टिकोण एक न्यूनतम संख्या में पैरामीटर को संशोधित करने का लक्ष्य रखते हुए प्रदर्शन को बनाए रखने का लक्ष्य रखता है।
उल्लेखनीय हैं:
एक्स-एडाप्टर
एक्स-एडाप्टर फ्रेमवर्क मॉडल के बीच फाइन-ट्यून किए गए एडाप्टर को स्थानांतरित करता है कुछ पुनः प्रशिक्षण के साथ। सिस्टम का उद्देश्य प्री-ट्रेन्ड प्लग-एंड-प्ले मॉड्यूल (जैसे कंट्रोलनेट और लोरा) को एक बेस डिफ्यूजन मॉडल (अर्थात स्टेबल डिफ्यूजन वी1.5) से एक अपग्रेडेड डिफ्यूजन मॉडल (जैसे एसडीएक्सएल) के साथ काम करने में सक्षम बनाने के लिए है बिना पुनः प्रशिक्षण के, प्रभावी रूप से प्लग-इन के लिए एक ‘यूनिवर्सल अपग्रेडर’ के रूप में कार्य करता है।
सिस्टम एक अतिरिक्त नेटवर्क को प्रशिक्षित करके इसे प्राप्त करता है जो अपग्रेडेड मॉडल को नियंत्रित करता है, जो एक फ्रोज़न कॉपी का उपयोग करके प्लग-इन कनेक्टरों को संरक्षित करने के लिए बेस मॉडल का उपयोग करता है:

एक्स-एडाप्टर के लिए योजना। स्रोत: https://arxiv.org/pdf/2312.02238
एक्स-एडाप्टर मूल रूप से एसडी1.5 से एसडीएक्सएल में एडाप्टर को स्थानांतरित करने के लिए विकसित और परीक्षण किया गया था, जबकि लोरा-एक्स एक व्यापक श्रृंखला में अनुवाद प्रदान करता है।
डोरा (वजन-विघटित निम्न-रैंक अनुकूलन)
डोरा एक उन्नत फाइन-ट्यूनिंग विधि है जो लोरा पर एक वजन विघटन रणनीति का उपयोग करके सुधार करती है जो पूर्ण फाइन-ट्यूनिंग के समान है:

डोरा लोरा-एक्स की तरह एक एडाप्टर को फ्रोज़न वातावरण में कॉपी करने का प्रयास नहीं करता है, बल्कि वजन के मूल पैरामीटर को बदलता है, जैसे कि परिमाण और दिशा। स्रोत: https://arxiv.org/pdf/2402.09353
डोरा फाइन-ट्यूनिंग प्रक्रिया को स्वयं में सुधार पर केंद्रित करता है, मॉडल के वजन को परिमाण और दिशा में विभाजित करके (ऊपर दी गई छवि देखें)। इसके बजाय, लोरा-एक्स मौजूदा फाइन-ट्यून किए गए पैरामीटर को अलग-अलग बेस मॉडल के बीच स्थानांतरित करने पर केंद्रित है।
हालांकि, लोरा-एक्स दृष्टिकोण डोरा के लिए विकसित प्रोजेक्शन तकनीकों को अपनाता है, और पुराने सिस्टम के खिलाफ परीक्षण में एक बेहतर डिनो स्कोर का दावा करता है।
फोरा (फूरियर निम्न-रैंक अनुकूलन)
जून 2024 में प्रकाशित, फोरा विधि क्वालकॉम एआई रिसर्च से आती है, और लोरा-एक्स के साथ कुछ परीक्षण प्रॉम्प्ट और विषयों को साझा करती है।

लोरा में वितरण पतन के उदाहरण, 2024 फोरा पत्र से, रियलिस्टिक विजन 3.0 मॉडल का उपयोग करके ‘ब्लू फायर’ और ‘ओरिगामी’ शैली के एडाप्टर के साथ लोरा और फोरा के साथ प्रशिक्षित, चार बीज के माध्यम से। लोरा छवियों में वितरण पतन और विविधता में कमी है, जबकि फोरा अधिक विविध आउटपुट उत्पन्न करता है। स्रोत: https://arxiv.org/pdf/2406.08798
फोरा लोरा को फ्रीक्वेंसी डोमेन में अनुकूलित करके उत्पन्न छवियों की विविधता और गुणवत्ता में सुधार पर केंद्रित है फूरियर ट्रांसफॉर्म दृष्टिकोण का उपयोग करके।
यहाँ, फिर से, लोरा-एक्स फोरा के फूरियर-आधारित दृष्टिकोण से बेहतर परिणाम प्राप्त करने में सक्षम था।
हालांकि दोनों फ्रेमवर्क पीईएफटी श्रेणी में आते हैं, वे बहुत अलग उपयोग के मामलों और दृष्टिकोणों के साथ हैं।
एसवीडिफ
एसवीडिफ के अलग लक्ष्य हैं, लेकिन यह नए पत्र में मजबूती से लाभान्वित है। एसवीडिफ का उद्देश्य डिफ्यूजन मॉडल के फाइन-ट्यूनिंग की दक्षता में सुधार करना है, और सीधे मॉडल के वजन मैट्रिक्स के मानों को संशोधित करता है, जबकि सिंगुलर वेक्टर को अपरिवर्तित रखता है। एसवीडिफ ट्रंकेटेड एसवीडी का उपयोग करता है, केवल सबसे बड़े मानों को संशोधित करके मॉडल के वजन को समायोजित करता है।
इस दृष्टिकोण का उपयोग कट-मिक्स-アンमिक्स नामक एक डेटा ऑगमेंटेशन तकनीक का उपयोग करता है:

एसवीडिफ में मल्टी-सब्जेक्ट जेनरेशन एक अवधारणा-अलग करने वाली प्रणाली के रूप में कार्य करती है। स्रोत: https://arxiv.org/pdf/2303.11305
कट-मिक्स-アンमिक्स का उद्देश्य डिफ्यूजन मॉडल को विभिन्न विषयों की छवियों को एक ही छवि में जोड़कर अलग-अलग अवधारणाओं को सीखने में मदद करना है। मॉडल को प्रॉम्प्ट के साथ प्रशिक्षित किया जाता है जो छवि में अलग-अलग तत्वों का वर्णन करता है। यह मॉडल को अवधारणाओं को मिलाने के बजाय उन्हें पहचानने और संरक्षित करने के लिए मजबूर करता है।
प्रशिक्षण के दौरान, एक अतिरिक्त नियमितीकरण शब्द क्रॉस-सब्जेक्ट हस्तक्षेप को रोकने में मदद करता है। लेखकों का सिद्धांत कहता है कि यह बेहतर मल्टी-सब्जेक्ट जेनरेशन को सुविधाजनक बनाता है, जहां प्रत्येक तत्व दृश्य रूप से अलग रहता है, न कि उन्हें मिलाने के बजाय।
एसवीडिफ का लक्ष्य एक कompact पैरामीटर स्थान बनाना है, जबकि लोरा-एक्स मॉडल के मूल स्थान में काम करके अलग-अलग बेस मॉडलों में लोरा पैरामीटर की स्थानांतरण पर केंद्रित है।
निष्कर्ष
यहाँ चर्चा की गई विधियाँ पीईएफटी की एकमात्र निवासी नहीं हैं। अन्य में क्यूएलओआरए और क्यूए-लोरा; प्रीफिक्स ट्यूनिंग; प्रॉम्प्ट-ट्यूनिंग; और एडाप्टर-ट्यूनिंग शामिल हैं, अन्य लोगों के बीच।
अपग्रेडेबल लोरा शायद एक अल्केमिकल पीछा है; निश्चित रूप से, कोई भी तुरंत दृष्टि में नहीं है जो लोरा मॉडलर्स को नए और महान वजन रिलीज़ के लिए अपने पुराने डेटासेट को फिर से निकालने से रोकेगा। यदि वजन संशोधन के लिए कोई संभावित प्रोटोटाइप मानक है जो वास्तुकला और मॉडल संस्करणों के बीच पैरामीटर में वृद्धि को सहन कर सकता है, तो यह साहित्य में अभी तक नहीं आया है, और इसे प्रति-मॉडल डेटा से निकालना जारी रखना होगा।
पहली बार गुरुवार, 30 जनवरी, 2025 को प्रकाशित












