Anderson का एंगल

लोरा को मॉडल संस्करण अपग्रेड से बचाने के लिए

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें
ChatGPT-4o: variation on ‘a 1792x1024 feature article reportage image of a skip full of discarded metal figurines, featuring realistic men and women of all ages and all types’

मेरे हाल के कवरेज के बाद हुन्युआन वीडियो लोरा (छोटे, प्रशिक्षित फ़ाइलें जो मल्टी-बिलियन पैरामीटर टेक्स्ट-टू-वीडियो और इमेज-टू-वीडियो फाउंडेशन मॉडल में कस्टम व्यक्तित्व को इंजेक्ट कर सकते हैं) की वृद्धि के बारे में, सिविट समुदाय में संबंधित लोरा की संख्या 185% बढ़ गई है।

हुन्युआन वीडियो लोरा बनाने के लिए कोई आसान या कम-प्रयास वाला तरीका नहीं है, लेकिन सिविट में सेलिब्रिटी और थीम्ड लोरा की सूची दैनिक रूप से बढ़ रही है। स्रोत: https://civitai.com/

हुन्युआन वीडियो लोरा बनाने के लिए कोई आसान या कम-प्रयास वाला तरीका नहीं है, लेकिन सिविट में सेलिब्रिटी और थीम्ड लोरा की सूची दैनिक रूप से बढ़ रही है। स्रोत: https://civitai.com/

हुन्युआन वीडियो (एचवी) के लिए इन ‘एड-ऑन व्यक्तित्व’ को उत्पादन करने के लिए संघर्ष कर रहे समुदाय भी अल्सरेटिंग है अनौपचारिक इमेज-टू-वीडियो (आई2वी) कार्यक्षमता के वादा किए गए रिलीज़ के लिए हुन्युआन वीडियो में।

मानव इमेज सिंथेसिस के लिए खुला स्रोत के संबंध में, यह एक बड़ी बात है; हुन्युआन लोरा के विकास के साथ मिलकर, यह उपयोगकर्ताओं को लोगों की तस्वीरों को वीडियो में बदलने में सक्षम बना सकता है जो वीडियो के विकास के दौरान उनकी पहचान को कम नहीं करता है – जो वर्तमान में सभी राज्य-ऑफ-द-आर्ट इमेज-टू-वीडियो जनरेटर में है, जिनमें क्लिंग, काइबर और रनवे एमएल शामिल हैं।

प्ले करने के लिए क्लिक करें। रनवे एमएल के राज्य-ऑफ-द-आर्ट जेन 3 टर्बो मॉडल से एक इमेज-टू-वीडियो जेनरेशन। हालांकि, अन्य सभी समान और कम राइवल मॉडल की तरह, यह कैमरे से दूर जाने पर स्थिर पहचान बनाए रखने में असमर्थ है, और शुरुआती छवि की विशिष्ट विशेषताएं ‘जेनेरिक डिफ्यूजन महिला’ बन जाती हैं।. स्रोत: https://app.runwayml.com/

एक कस्टम लोरा विकसित करके, जिस व्यक्ति के लिए व्यक्तित्व है, एक हुन्युआन आई2वी वर्कफ़्लो में एक वास्तविक फोटो का उपयोग शुरुआती बिंदु के रूप में किया जा सकता है। यह मॉडल के लेटेंट स्पेस में एक यादृच्छिक संख्या भेजने और जो भी सेमेंटिक परिदृश्य परिणाम से निपटने से बेहतर ‘बीज’ है।

संभावित रूप से, इस तरह के संयोजन की उपलब्धता स्टेबल डिफ्यूजन के लॉन्च के बाद से जनरेटिव एआई में सबसे महत्वपूर्ण परिवर्तनों में से एक का प्रतिनिधित्व कर सकती है, जिसमें खुले स्रोत उत्साही लोगों को जबरदस्त जनरेटिव शक्ति प्रदान की जाती है, बिना वर्तमान लोकप्रिय जेन विद प्रणालियों में सामग्री सेंसर द्वारा प्रदान किए गए नियमन (या ‘गेटकीपिंग’, यदि आप पसंद करते हैं) के।

जैसा कि मैं लिखता हूं, हुन्युआन इमेज-टू-वीडियो हुन्युआन वीडियो गिटहब रेपो में एक अनचेक्ड ‘टू-डू’ है, जिसमें शौकिया समुदाय अनौपचारिक रूप से एक हुन्युआन डेवलपर की डिस्कॉर्ड टिप्पणी की रिपोर्ट कर रहा है, जिसने कथित तौर पर कहा था कि इस कार्यक्षमता को जारी करने की समय सीमा को मॉडल के अधिक ‘अनियंत्रित‘ होने के कारण क्यू 1 में बाद में धकेल दिया गया है।

हुन्युआन वीडियो के लिए आधिकारिक सुविधा रिलीज़ चेकलिस्ट। स्रोत: https://github.com/Tencent/HunyuanVideo?tab=readme-ov-file#-open-source-plan

हुन्युआन वीडियो के लिए आधिकारिक सुविधा रिलीज़ चेकलिस्ट। स्रोत: https://github.com/Tencent/HunyuanVideo?tab=readme-ov-file#-open-source-plan

सटीक या नहीं, रेपो डेवलपर्स ने हुन्युआन चेकलिस्ट के बाकी हिस्सों पर काफी हद तक वितरित किया है, और इसलिए हुन्युआन आई2वी似乎 अंततः आने वाला है, चाहे वह सेंसर्ड, अनसेंसर्ड या किसी तरह से ‘अनलॉकेबल’ हो।

लेकिन जैसा कि हम ऊपर सूची में देख सकते हैं, आई2वी रिलीज़ एक अलग मॉडल है – जो यह बताता है कि वर्तमान हुन्युआन वीडियो लोरा की बढ़ती फसल में से कोई भी मॉडल के साथ काम नहीं करेगा।

इस (अब) भविष्यवाणी योग्य परिदृश्य में, लोरा प्रशिक्षण फ्रेमवर्क जैसे मुसुबी ट्यूनर और वनट्रेनर या तो नए मॉडल के समर्थन में वापस आ जाएंगे या रीसेट हो जाएंगे। इसके बीच, एक या दो सबसे तकनीकी रूप से कुशल (और उद्यमी) यूट्यूब एआई प्रतिभागी अपने समाधानों को पेट्रॉन के माध्यम से फिरौती देंगे जब तक कि दृश्य पकड़ नहीं लेता।

अपग्रेड थकान

लगभग कोई भी लोरा या फाइन-ट्यूनिंग उत्साही के रूप में अपग्रेड थकान का अनुभव नहीं करता है, क्योंकि जनरेटिव एआई में परिवर्तन की तेज और प्रतिस्पर्धी गति मॉडल फाउंड्री जैसे स्टेबिलिटी.ai, टेंसेंट और ब्लैक फॉरेस्ट लैब्स को बड़े और (कभी-कभी) बेहतर मॉडल का उत्पादन करने के लिए प्रोत्साहित करती है। अधिकतम व्यवहार्य आवृत्ति।

चूंकि ये नए और सुधारित मॉडल कम से कम अलग पूर्वाग्रह और वजन होंगे, और अधिक सामान्यतः एक अलग पैमाने और/या वास्तुकला होगी, इसका मतलब है कि फाइन-ट्यूनिंग समुदाय को अपने डेटासेट को फिर से निकालना होगा और नए संस्करण के लिए थका देने वाली प्रशिक्षण प्रक्रिया को दोहराना होगा।

इस कारण से, सिविट में कई प्रकार के स्टेबल डिफ्यूजन लोरा संस्करण उपलब्ध हैं:

अपग्रेड ट्रेल, सिविट.एआई में खोज फिल्टर विकल्पों में दृश्य

अपग्रेड ट्रेल, सिविट.एआई में खोज फिल्टर विकल्पों में दृश्य

चूंकि इनमें से कोई भी हल्के लोरा मॉडल उच्च या निम्न मॉडल संस्करणों के साथ इंटरऑपरेबल नहीं है, और चूंकि उनमें से कई को लोकप्रिय बड़े पैमाने पर मॉडल मerging और फाइन-ट्यून पर निर्भरता है जो एक पुराने मॉडल का पालन करते हैं, समुदाय का एक महत्वपूर्ण हिस्सा एक ‘विरासत’ रिलीज़ के साथ चिपके रहते हैं, जैसा कि ग्राहक वफादारी विंडोज़ एक्सपी के प्रति बनी रहती है वर्षों बाद आधिकारिक समर्थन समाप्त हो गया

परिवर्तन के अनुकूल

यह विषय एक नए पत्र के कारण आता है क्वालकॉम एआई रिसर्च से जो दावा करता है कि एक विधि विकसित की है जिसके द्वारा मौजूदा लोरा को ‘अपग्रेड’ किया जा सकता है एक नए जारी मॉडल संस्करण में।

मॉडल संस्करणों में लोरा का नमूना रूपांतरण। स्रोत: https://arxiv.org/pdf/2501.16559

मॉडल संस्करणों में लोरा का नमूना रूपांतरण。 स्रोत: https://arxiv.org/pdf/2501.16559

यह नहीं意味ा है कि नई दृष्टिकोण, लोरा-एक्स कहा जाता है, मुक्त रूप से सभी मॉडलों के बीच अनुवाद कर सकता है (अर्थात, टेक्स्ट से छवि मॉडल, या बड़े भाषा मॉडल [एलएलएम]); लेकिन लेखकों ने स्टेबल डिफ्यूजन वी1.5 > एसडीएक्सएल में एक लोरा का एक प्रभावी अनुवाद प्रदर्शित किया है, और टेक्स्ट-आधारित टिनीलमा 3टी मॉडल के लिए एक लोरा का एक रूपांतरण टिनीलमा 2.5टी में।

लोरा-एक्स लोरा पैरामीटर को अलग-अलग आधार मॉडलों में स्थानांतरित करता है पैरामीटर को संरक्षित करके स्रोत मॉडल के उपस्थान में; लेकिन केवल उन हिस्सों में जो मॉडल संस्करणों में पर्याप्त रूप से समान हैं।

बाएं, लोरा-एक्स स्रोत मॉडल के लिए एक एडाप्टर को फाइन-ट्यून करने के लिए एक योजना। दाएं, एसडी ईफ-वी1.0 और एसएसडी-1बी लक्ष्य मॉडल द्वारा उत्पन्न छवियां, एसडी-वी1.5 और एसडीएक्सएल से एडाप्टर लागू करने के बाद अतिरिक्त प्रशिक्षण के बिना।

बाएं, लोरा-एक्स स्रोत मॉडल के लिए एक एडाप्टर को फाइन-ट्यून करने के लिए एक योजना। दाएं, एसडी ईफ-वी1.0 और एसएसडी-1बी लक्ष्य मॉडल द्वारा उत्पन्न छवियां, एसडी-वी1.5 और एसडीएक्सएल से एडाप्टर लागू करने के बाद अतिरिक्त प्रशिक्षण के बिना।

जबकि यह परिदृश्यों के लिए एक व्यावहारिक समाधान प्रदान करता है जहां पुनः प्रशिक्षण वांछनीय या असंभव नहीं है (जैसे मूल प्रशिक्षण डेटा पर लाइसेंस परिवर्तन), यह विधि समान मॉडल वास्तुकला तक सीमित है, अन्य सीमाओं सहित।

हालांकि यह एक कम अध्ययन किए गए क्षेत्र में एक दुर्लभ प्रयास है, हम इस पत्र की गहराई से जांच नहीं करेंगे लोरा-एक्स की कई कमियों के कारण, जैसा कि इसके आलोचकों और सलाहकारों द्वारा ओपन रिव्यू में देखा गया है।

विधि की उपस्थान समानता पर निर्भरता इसके अनुप्रयोग को密न मॉडल तक सीमित करती है, और लेखकों ने समीक्षा मंच में स्वीकार किया है कि लोरा-एक्स को आसानी से महत्वपूर्ण रूप से अलग वास्तुकला में स्थानांतरित नहीं किया जा सकता है।

अन्य पीईएफटी दृष्टिकोण

लोरा को संस्करणों में अधिक पोर्टेबल बनाने की संभावना एक छोटी लेकिन दिलचस्प अध्ययन की धारा है, और लोरा-एक्स का मुख्य योगदान इस पीछा में इसका दावा है कि यह कोई प्रशिक्षण की आवश्यकता नहीं है। यह सख्ती से सच नहीं है, यदि आप पत्र पढ़ते हैं; लेकिन यह पिछले तरीकों की तुलना में कम से कम प्रशिक्षण की आवश्यकता है।

लोरा-एक्स पैरामीटर-эффектив फाइन-ट्यूनिंग (पीईएफटी) विधियों के कैनन में एक और प्रविष्टि है, जो बड़े पूर्व-प्रशिक्षित मॉडल को विशिष्ट कार्यों के लिए अनुकूलित करने की चुनौती का समाधान करती है बिना व्यापक पुनः प्रशिक्षण के। यह अवधारणात्मक दृष्टिकोण एक न्यूनतम संख्या में पैरामीटर को संशोधित करने का लक्ष्य रखते हुए प्रदर्शन को बनाए रखने का लक्ष्य रखता है।

उल्लेखनीय हैं:

एक्स-एडाप्टर

एक्स-एडाप्टर फ्रेमवर्क मॉडल के बीच फाइन-ट्यून किए गए एडाप्टर को स्थानांतरित करता है कुछ पुनः प्रशिक्षण के साथ। सिस्टम का उद्देश्य प्री-ट्रेन्ड प्लग-एंड-प्ले मॉड्यूल (जैसे कंट्रोलनेट और लोरा) को एक बेस डिफ्यूजन मॉडल (अर्थात स्टेबल डिफ्यूजन वी1.5) से एक अपग्रेडेड डिफ्यूजन मॉडल (जैसे एसडीएक्सएल) के साथ काम करने में सक्षम बनाने के लिए है बिना पुनः प्रशिक्षण के, प्रभावी रूप से प्लग-इन के लिए एक ‘यूनिवर्सल अपग्रेडर’ के रूप में कार्य करता है।

सिस्टम एक अतिरिक्त नेटवर्क को प्रशिक्षित करके इसे प्राप्त करता है जो अपग्रेडेड मॉडल को नियंत्रित करता है, जो एक फ्रोज़न कॉपी का उपयोग करके प्लग-इन कनेक्टरों को संरक्षित करने के लिए बेस मॉडल का उपयोग करता है:

एक्स-एडाप्टर के लिए योजना। स्रोत: https://arxiv.org/pdf/2312.02238

एक्स-एडाप्टर के लिए योजना। स्रोत: https://arxiv.org/pdf/2312.02238

एक्स-एडाप्टर मूल रूप से एसडी1.5 से एसडीएक्सएल में एडाप्टर को स्थानांतरित करने के लिए विकसित और परीक्षण किया गया था, जबकि लोरा-एक्स एक व्यापक श्रृंखला में अनुवाद प्रदान करता है।

डोरा (वजन-विघटित निम्न-रैंक अनुकूलन)

डोरा एक उन्नत फाइन-ट्यूनिंग विधि है जो लोरा पर एक वजन विघटन रणनीति का उपयोग करके सुधार करती है जो पूर्ण फाइन-ट्यूनिंग के समान है:

डोरा लोरा-एक्स की तरह एक एडाप्टर को फ्रोज़न वातावरण में कॉपी करने का प्रयास नहीं करता है, बल्कि वजन के मूल पैरामीटर को बदलता है, जैसे कि परिमाण और दिशा। स्रोत: https://arxiv.org/pdf/2402.09353

डोरा लोरा-एक्स की तरह एक एडाप्टर को फ्रोज़न वातावरण में कॉपी करने का प्रयास नहीं करता है, बल्कि वजन के मूल पैरामीटर को बदलता है, जैसे कि परिमाण और दिशा। स्रोत: https://arxiv.org/pdf/2402.09353

डोरा फाइन-ट्यूनिंग प्रक्रिया को स्वयं में सुधार पर केंद्रित करता है, मॉडल के वजन को परिमाण और दिशा में विभाजित करके (ऊपर दी गई छवि देखें)। इसके बजाय, लोरा-एक्स मौजूदा फाइन-ट्यून किए गए पैरामीटर को अलग-अलग बेस मॉडल के बीच स्थानांतरित करने पर केंद्रित है।

हालांकि, लोरा-एक्स दृष्टिकोण डोरा के लिए विकसित प्रोजेक्शन तकनीकों को अपनाता है, और पुराने सिस्टम के खिलाफ परीक्षण में एक बेहतर डिनो स्कोर का दावा करता है।

फोरा (फूरियर निम्न-रैंक अनुकूलन)

जून 2024 में प्रकाशित, फोरा विधि क्वालकॉम एआई रिसर्च से आती है, और लोरा-एक्स के साथ कुछ परीक्षण प्रॉम्प्ट और विषयों को साझा करती है।

लोरा में वितरण पतन के उदाहरण, 2024 फोरा पत्र से, रियलिस्टिक विजन 3.0 मॉडल का उपयोग करके 'ब्लू फायर' और 'ओरिगामी' शैली के एडाप्टर के साथ लोरा और फोरा के साथ प्रशिक्षित, चार बीज के माध्यम से। लोरा छवियों में वितरण पतन और विविधता में कमी है, जबकि फोरा अधिक विविध आउटपुट उत्पन्न करता है। स्रोत: https://arxiv.org/pdf/2406.08798

लोरा में वितरण पतन के उदाहरण, 2024 फोरा पत्र से, रियलिस्टिक विजन 3.0 मॉडल का उपयोग करके ‘ब्लू फायर’ और ‘ओरिगामी’ शैली के एडाप्टर के साथ लोरा और फोरा के साथ प्रशिक्षित, चार बीज के माध्यम से। लोरा छवियों में वितरण पतन और विविधता में कमी है, जबकि फोरा अधिक विविध आउटपुट उत्पन्न करता है। स्रोत: https://arxiv.org/pdf/2406.08798

फोरा लोरा को फ्रीक्वेंसी डोमेन में अनुकूलित करके उत्पन्न छवियों की विविधता और गुणवत्ता में सुधार पर केंद्रित है फूरियर ट्रांसफॉर्म दृष्टिकोण का उपयोग करके।

यहाँ, फिर से, लोरा-एक्स फोरा के फूरियर-आधारित दृष्टिकोण से बेहतर परिणाम प्राप्त करने में सक्षम था।

हालांकि दोनों फ्रेमवर्क पीईएफटी श्रेणी में आते हैं, वे बहुत अलग उपयोग के मामलों और दृष्टिकोणों के साथ हैं।

एसवीडिफ

एसवीडिफ के अलग लक्ष्य हैं, लेकिन यह नए पत्र में मजबूती से लाभान्वित है। एसवीडिफ का उद्देश्य डिफ्यूजन मॉडल के फाइन-ट्यूनिंग की दक्षता में सुधार करना है, और सीधे मॉडल के वजन मैट्रिक्स के मानों को संशोधित करता है, जबकि सिंगुलर वेक्टर को अपरिवर्तित रखता है। एसवीडिफ ट्रंकेटेड एसवीडी का उपयोग करता है, केवल सबसे बड़े मानों को संशोधित करके मॉडल के वजन को समायोजित करता है।

इस दृष्टिकोण का उपयोग कट-मिक्स-アンमिक्स नामक एक डेटा ऑगमेंटेशन तकनीक का उपयोग करता है:

एसवीडिफ में मल्टी-सब्जेक्ट जेनरेशन एक अवधारणा-अलग करने वाली प्रणाली के रूप में कार्य करती है। स्रोत: https://arxiv.org/pdf/2303.11305

एसवीडिफ में मल्टी-सब्जेक्ट जेनरेशन एक अवधारणा-अलग करने वाली प्रणाली के रूप में कार्य करती है। स्रोत: https://arxiv.org/pdf/2303.11305

कट-मिक्स-アンमिक्स का उद्देश्य डिफ्यूजन मॉडल को विभिन्न विषयों की छवियों को एक ही छवि में जोड़कर अलग-अलग अवधारणाओं को सीखने में मदद करना है। मॉडल को प्रॉम्प्ट के साथ प्रशिक्षित किया जाता है जो छवि में अलग-अलग तत्वों का वर्णन करता है। यह मॉडल को अवधारणाओं को मिलाने के बजाय उन्हें पहचानने और संरक्षित करने के लिए मजबूर करता है।

प्रशिक्षण के दौरान, एक अतिरिक्त नियमितीकरण शब्द क्रॉस-सब्जेक्ट हस्तक्षेप को रोकने में मदद करता है। लेखकों का सिद्धांत कहता है कि यह बेहतर मल्टी-सब्जेक्ट जेनरेशन को सुविधाजनक बनाता है, जहां प्रत्येक तत्व दृश्य रूप से अलग रहता है, न कि उन्हें मिलाने के बजाय।

एसवीडिफ का लक्ष्य एक कompact पैरामीटर स्थान बनाना है, जबकि लोरा-एक्स मॉडल के मूल स्थान में काम करके अलग-अलग बेस मॉडलों में लोरा पैरामीटर की स्थानांतरण पर केंद्रित है।

निष्कर्ष

यहाँ चर्चा की गई विधियाँ पीईएफटी की एकमात्र निवासी नहीं हैं। अन्य में क्यूएलओआरए और क्यूए-लोरा; प्रीफिक्स ट्यूनिंग; प्रॉम्प्ट-ट्यूनिंग; और एडाप्टर-ट्यूनिंग शामिल हैं, अन्य लोगों के बीच।

अपग्रेडेबल लोरा शायद एक अल्केमिकल पीछा है; निश्चित रूप से, कोई भी तुरंत दृष्टि में नहीं है जो लोरा मॉडलर्स को नए और महान वजन रिलीज़ के लिए अपने पुराने डेटासेट को फिर से निकालने से रोकेगा। यदि वजन संशोधन के लिए कोई संभावित प्रोटोटाइप मानक है जो वास्तुकला और मॉडल संस्करणों के बीच पैरामीटर में वृद्धि को सहन कर सकता है, तो यह साहित्य में अभी तक नहीं आया है, और इसे प्रति-मॉडल डेटा से निकालना जारी रखना होगा।

 

पहली बार गुरुवार, 30 जनवरी, 2025 को प्रकाशित

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: martin@martinanderson.ai