Anderson का एंगल
हन्युआन वीडियो लोरा मॉडल्स को प्रशिक्षित करने और उपयोग करने के लिए एक गाइड

यह लेख आपको विंडोज़-आधारित सॉफ़्टवेयर स्थापित करने और उपयोग करने के तरीके के बारे में दिखाएगा जो हन्युआन वीडियो लोरा मॉडल्स को प्रशिक्षित करने में सक्षम है, जिससे उपयोगकर्ता हन्युआन वीडियो फाउंडेशन मॉडल में कस्टम व्यक्तित्व उत्पन्न कर सकते हैं:
[वीडियो चौड़ाई = “1200” ऊंचाई = “900” mp4 = “https://www.unite.ai/wp-content/uploads/2025/01/loras-hunyuan-AE2.mp4”] [/ वीडियो]
प्ले करने के लिए क्लिक करें। सिविट.एआई समुदाय से हाल ही में सेलिब्रिटी हन्युआन लोरास के उदाहरण।
वर्तमान में, हन्युआन लोरा मॉडल्स को स्थानीय रूप से उत्पन्न करने के दो सबसे लोकप्रिय तरीके हैं:
1) डिफ्यूजन-पाइप-यूआई डॉकर-आधारित फ्रेमवर्क , जो विंडोज़ सब्सिस्टम फॉर लिनक्स (WSL) पर निर्भर करता है ताकि यह कुछ प्रक्रियाओं को संभाल सके।
2) मुसुबी ट्यूनर , कोह्या एसएस डिफ्यूजन प्रशिक्षण आर्किटेक्चर के लिए एक नया जोड़। मुसुबी ट्यूनर को डॉकर की आवश्यकता नहीं है और यह WSL या अन्य लिनक्स-आधारित प्रॉक्सी पर निर्भर नहीं करता है – लेकिन इसे विंडोज़ पर चलाना मुश्किल हो सकता है।
इसलिए, यह चलने वाला मुसुबी ट्यूनर पर केंद्रित होगा, और हन्युआन लोरा प्रशिक्षण और पीढ़ी के लिए एक पूरी तरह से स्थानीय समाधान प्रदान करने पर, बिना किसी एपीआई-चालित वेबसाइटों या व्यावसायिक जीपीयू-किराये की प्रक्रियाओं का उपयोग किए, जैसे कि रनपॉड।
[वीडियो चौड़ाई = “1200” ऊंचाई = “674” mp4 = “https://www.unite.ai/wp-content/uploads/2025/01/example-woman-hunyuan-loras.mp4” लूप = “सच”] [/ वीडियो]
प्ले करने के लिए क्लिक करें। इस लेख के लिए मुसुबी ट्यूनर पर लोरा प्रशिक्षण के नमूने। सभी चित्रित व्यक्ति द्वारा अनुमति दी गई, इस लेख को चित्रित करने के उद्देश्य से ही।
आवश्यकताएं
स्थापना के लिए न्यूनतम आवश्यकता एक विंडोज़ 10 पीसी है जिसमें 30+/40+ श्रृंखला का एनवीआईडीआईए ग्राफिक्स कार्ड है जिसमें कम से कम 12GB वीआरएएम है (हालांकि 16GB की सिफारिश की जाती है)। इस लेख के लिए उपयोग की जाने वाली स्थापना 64GB सिस्टम रैम और 24GB वीआरएएम के साथ एनवीआईडीआईए 3090 ग्राफिक्स कार्ड वाले एक मशीन पर परीक्षण की गई थी। यह एक ताज़ा स्थापित विंडोज़ 10 प्रोफेशनल सिस्टम पर परीक्षण किया गया था, 600+ जीबी खाली डिस्क स्थान के साथ एक पार्टीशन पर।
चेतावनी
मुसुबी ट्यूनर और इसके पूर्वापेक्षाओं की स्थापना में विकासकर्ता-केंद्रित सॉफ़्टवेयर और पैकेजों की स्थापना शामिल है जो सीधे मुख्य विंडोज़ स्थापना पर होती है। कॉम्फ़ूआई की स्थापना के अंतिम चरणों को ध्यान में रखते हुए, यह परियोजना लगभग 400-500 गीगाबाइट डिस्क स्थान की आवश्यकता होगी। हालांकि मैंने कई बार नए स्थापित विंडोज़ 10 परीक्षण बेड़ पर इस प्रक्रिया का परीक्षण किया है, न तो मैं और न ही यूनाइट.एआई किसी भी प्रणाली को नुकसान के लिए जिम्मेदार होंगे जो इन निर्देशों का पालन करने से हो सकता है। मैं आपको इस प्रकार की स्थापना प्रक्रिया का प्रयास करने से पहले अपने महत्वपूर्ण डेटा का बैकअप लेने की सलाह देता हूं।
विचार
क्या यह तरीका अभी भी मान्य है?
जनरेटिव एआई दृश्य बहुत तेजी से आगे बढ़ रहा है, और हम इस वर्ष हन्युआन वीडियो लोरा फ्रेमवर्क के लिए बेहतर और अधिक सुव्यवस्थित तरीकों की उम्मीद कर सकते हैं।
… या यहां तक कि इस सप्ताह! जब मैं इस लेख को लिख रहा था, तो मुसुबी / कोह्या के विकासकर्ता ने मुसुबी-ट्यूनर-गुई बनाया, जो मुसुबी ट्यूनर के लिए एक जटिल ग्रेडियो जीयूआई है:

जाहिर है, एक उपयोगकर्ता-मित्र ग्राफिकल यूजर इंटरफेस बैट फाइलों की तुलना में बेहतर होगा जिनका उपयोग मैं इस सुविधा में करता हूं – एक बार मुसुबी-ट्यूनर-गुई काम करने पर। जैसा कि मैं लिखता हूं, यह केवल पांच दिन पहले ऑनलाइन हुआ, और मुझे किसी के द्वारा इसका सफलतापूर्वक उपयोग करने का कोई खाता नहीं मिला।
रिपॉजिटरी में पोस्ट के अनुसार, नई गुई को जल्द से जल्द मुसुबी ट्यूनर प्रोजेक्ट में शामिल किया जाने का इरादा है, जो इसके वर्तमान गिटहब रिपॉजिटरी के रूप में इसके अस्तित्व को समाप्त कर देगा।
वर्तमान स्थापना निर्देशों के आधार पर, नई गुई को मौजूदा मुसुबी वर्चुअल एनवायरनमेंट में सीधे क्लोन किया जाता है; और, कई प्रयासों के बावजूद, मैं इसे मौजूदा मुसुबी स्थापना से जोड़ने में असमर्थ हूं।
एक बार गुई मुसुबी ट्यूनर में एकीकृत हो जाने के बाद, इस तरह के मुद्दों का समाधान निश्चित रूप से किया जाएगा। हालांकि लेखक स्वीकार करता है कि नया परियोजना ‘वास्तव में खुरदरा’ है, वह इसके विकास और मुसुबी ट्यूनर में सीधे एकीकरण के लिए आशावादी है।
दिए गए मुद्दों के कारण (स्थापना समय में डिफ़ॉल्ट पथ और यूवी पाइथन पैकेज के उपयोग के बारे में), हमें हन्युआन वीडियो लोरा प्रशिक्षण अनुभव के लिए थोड़ा और प्रतीक्षा करने की आवश्यकता होगी। यह बहुत ही आशाजनक दिखता है!
लेकिन अगर आप प्रतीक्षा नहीं कर सकते हैं, और अपनी बाहों को थोड़ा ऊपर करने के लिए तैयार हैं, तो आप स्थानीय रूप से हन्युआन वीडियो लोरा प्रशिक्षण चला सकते हैं।
आइए शुरू करें।
क्यों कुछ भी बेयर मेटल पर स्थापित करें?
(उन्नत उपयोगकर्ताओं को यह अनुच्छेद छोड़ सकते हैं)
उन्नत उपयोगकर्ता आश्चर्यचकित हो सकते हैं कि मैंने इतने सारे सॉफ़्टवेयर को बेयर मेटल विंडोज़ 10 स्थापना पर स्थापित करने का चुनाव क्यों किया है। इसका कारण यह है कि लिनक्स-आधारित ट्राइटन पैकेज का विंडोज़ पोर्ट बहुत अधिक कठिन है एक आभासी वातावरण में काम करने के लिए। मुसुबी की स्थापना के लिए अन्य बेयर-मेटल स्थापनाएं आवश्यक हैं क्योंकि उन्हें स्थानीय हार्डवेयर के साथ सीधे इंटरफेस करने की आवश्यकता है।
पूर्वापेक्षा पैकेज और कार्यक्रम स्थापित करना
जिन कार्यक्रमों और पैकेजों को शुरू में स्थापित करने की आवश्यकता है, उनकी स्थापना का क्रम महत्वपूर्ण है। आइए शुरू करें।
1: माइक्रोसॉफ्ट रेडिस्ट्रीब्यूटेबल डाउनलोड करें
माइक्रोसॉफ्ट रेडिस्ट्रीब्यूटेबल पैकेज डाउनलोड और स्थापित करें https://aka.ms/vs/17/release/vc_redist.x64.exe से।
यह एक सरल और तेज़ स्थापना है।

2: विज़ुअल स्टूडियो 2022 स्थापित करें
माइक्रोसॉफ्ट विज़ुअल स्टूडियो 2022 का सामुदायिक संस्करण डाउनलोड करें https://visualstudio.microsoft.com/downloads/?cid=learn-onpage- डाउनलोड-इंस्टॉल-विज़ुअल-स्टूडियो-पेज-सीटीए से।
डाउनलोड किए गए इंस्टॉलर को शुरू करें:

हमें सभी उपलब्ध पैकेजों की आवश्यकता नहीं है, जो एक भारी और लंबी स्थापना होगी। शुरुआती वर्कलोड पेज जो खुलता है, डेस्कटॉप विकास के साथ सी++ (नीचे दी गई छवि देखें) पर टिक करें।

अब व्यक्तिगत घटक टैब पर क्लिक करें जो इंटरफ़ेस के ऊपरी बाएं कोने में है और खोज बॉक्स का उपयोग करके ‘विंडोज़ एसडीके’ खोजें।

डिफ़ॉल्ट रूप से, केवल विंडोज़ 11 एसडीके पर टिक किया जाता है। यदि आप विंडोज़ 10 (यह स्थापना प्रक्रिया मेरे द्वारा विंडोज़ 11 पर परीक्षण नहीं की गई है) पर हैं, तो नवीनतम विंडोज़ 10 संस्करण पर टिक करें, जैसा कि ऊपर दी गई छवि में दिखाया गया है।
‘सी++ सीएमके’ खोजें और जांचें कि सी++ सीएमके टूल्स फॉर विंडोज़ चेक किया गया है।

यह स्थापना कम से कम 13 जीबी स्थान लेगी।

एक बार विज़ुअल स्टूडियो स्थापित हो जाने के बाद, यह आपके कंप्यूटर पर पूरी तरह से खुलने का प्रयास करेगा। इसे पूरी तरह से खुलने दें, और जब विज़ुअल स्टूडियो का पूर्ण-स्क्रीन इंटरफ़ेस अंततः दिखाई देता है, तो कार्यक्रम को बंद कर दें।
3: विज़ुअल स्टूडियो 2019 स्थापित करें
कुछ मुसुबी के बाद के पैकेज पुराने संस्करण की अपेक्षा करते हैं माइक्रोसॉफ्ट विज़ुअल स्टूडियो, जबकि अन्य एक हाल के संस्करण की आवश्यकता है।
इसलिए, माइक्रोसॉफ्ट ( https://visualstudio.microsoft.com/vs/older-downloads/ – खाता आवश्यक) से या टेकस्पॉट ( https://www.techspot.com/downloads/7241-visual-studio-2019.html ) से विज़ुअल स्टूडियो 2019 का मुफ्त सामुदायिक संस्करण डाउनलोड करें।
इसे विज़ुअल स्टूडियो 2022 (ऊपर दी गई प्रक्रिया के अनुसार) के समान विकल्पों के साथ स्थापित करें।
आप देखेंगे कि विज़ुअल स्टूडियो 2019 इंस्टॉलर पहले से ही जानता है कि एक नए संस्करण की स्थापना रिगिंग है क्योंकि यह स्थापित हो रहा है:

जब स्थापना पूरी हो जाए, और आपने स्थापित विज़ुअल स्टूडियो 2019 अनुप्रयोग खोला और बंद कर दिया है, तो विंडोज़ कमांड प्रॉम्प्ट खोलें (प्रारंभ में सीएमडी टाइप करें) और प्रवेश करें:
जहां cl
परिणाम दो स्थापित विज़ुअल स्टूडियो संस्करणों के ज्ञात स्थान होना चाहिए:

यदि इसके बजाय आपको जानकारी: फ़ाइलें नहीं मिलीं जो दिए गए पैटर्न (स) से मेल खाती हों मिलता है, तो चेक पथ अनुभाग देखें इस लेख के नीचे और उन निर्देशों का पालन करें, और फिर जहां cl कमांड को फिर से आज़माएं।
स्थापना के अनुसार किए गए किसी भी परिवर्तन को सहेजें, और फिर जहां cl कमांड को फिर से आज़माएं।
4: सीउडीए 11 + 12 टूलकिट स्थापित करें
विभिन्न पैकेज जो मुसुबी में स्थापित किए जाते हैं उन्हें एनवीआईडीआईए सीउडीए के विभिन्न संस्करणों की आवश्यकता होती है, जो एनवीआईडीआईए ग्राफिक्स कार्ड पर प्रशिक्षण को तेज और अनुकूलित करता है।
हम विज़ुअल स्टूडियो संस्करणों को पहले स्थापित किया क्योंकि एनवीआईडीआईए सीउडीए इंस्टॉलर विज़ुअल स्टूडियो स्थापना के साथ एकीकृत होने के लिए मौजूदा विज़ुअल स्टूडियो स्थापना की तलाश में हैं।
11 श्रृंखला के लिए सीउडीए स्थापना पैकेज डाउनलोड करें:
https://developer.nvidia.com/cuda-11-8-0- डाउनलोड-आर्काइव? target_os = विंडोज़ & amp; target_arch = x86_64 & amp; target_version = 11 & amp; target_type = exe_local ( ‘एक्सई (स्थानीय)’ डाउनलोड करें)
12 श्रृंखला के लिए सीउडीए टूलकिट स्थापना पैकेज डाउनलोड करें:
https://developer.nvidia.com/cuda-downloads?target_os=Windows&target_arch=x86_64
दोनों इंस्टॉलरों की स्थापना प्रक्रिया समान है। एनवीआईडीआईए इंस्टॉलर द्वारा दी गई किसी भी चेतावनी को अनदेखा करें जो विंडोज़ परिवेश перемен्चल में स्थापना पथ के अस्तित्व या गैर-मौजूदगी के बारे में है – हम बाद में इसे मैन्युअल रूप से संबोधित करेंगे।
एनवीआईडीआईए सीउडीए टूलकिट वी11+ स्थापित करें
11 श्रृंखला के लिए सीउडीए टूलकिट इंस्टॉलर शुरू करें।


स्थापना विकल्प पर, कस्टम (उन्नत) चुनें और आगे बढ़ें।

एनवीआईडीआईए जीफोर्स एक्सपीरियंस विकल्प को अनचेक करें और अगला पर क्लिक करें।

स्थापना स्थान का चयन डिफ़ॉल्ट रूप से छोड़ दें (यह महत्वपूर्ण है):

अगला पर क्लिक करें और स्थापना को समाप्त होने दें।

एनवीआईडीआईए इंस्टॉलर द्वारा दी गई किसी भी चेतावनी या नोट को अनदेखा करें जो एनसाइट विज़ुअल स्टूडियो एकीकरण के बारे में है, जिसकी हमारे उपयोग के मामले में आवश्यकता नहीं है।
एनवीआईडीआईए सीउडीए टूलकिट वी12+ स्थापित करें
12 श्रृंखला के लिए अलग सीउडीए टूलकिट इंस्टॉलर के लिए पूरी प्रक्रिया को दोहराएं जिसे आपने डाउनलोड किया है:

12+ संस्करण की स्थापना प्रक्रिया 11+ संस्करण (ऊपर सूचीबद्ध) के समान है, एक चेतावनी के अलावा जो पर्यावरण पथों के बारे में है जिसे आप अनदेखा कर सकते हैं:

जब 12+ सीउडीए संस्करण की स्थापना पूरी हो जाए, तो विंडोज़ कमांड प्रॉम्प्ट में टाइप करें और प्रवेश करें:
nvcc --version
यह ड्राइवर संस्करण के बारे में जानकारी की पुष्टि करनी चाहिए:

कार्ड को मान्यता देने के लिए, टाइप करें और प्रवेश करें:
nvidia-smi

5: जीआईटी स्थापित करें
जीआईटी मुसुबी रिपॉजिटरी की स्थापना को स्थानीय मशीन पर संभालने जा रहा है। जीआईटी इंस्टॉलर को https://git-scm.com/downloads/win से डाउनलोड करें ( ’64- बिट गिट फॉर विंडोज़ सेटअप’)।

इंस्टॉलर चलाएं:

घटक चुनें के लिए डिफ़ॉल्ट सेटिंग्स का उपयोग करें:

विम को डिफ़ॉल्ट संपादक के रूप में छोड़ दें:

जीआईटी शाखा नामों के लिए सिफारिश की गई सेटिंग्स का उपयोग करें:

पथ पर्यावरण के लिए सिफारिश की गई सेटिंग्स का उपयोग करें:

एसएसएच के लिए सिफारिश की गई सेटिंग्स का उपयोग करें:

एचटीटीपीएस ट्रांसपोर्ट बैकएंड के लिए सिफारिश की गई सेटिंग्स का उपयोग करें:

रेखा समाप्ति रूपांतरण के लिए सिफारिश की गई सेटिंग्स का उपयोग करें:

विंडोज़ डिफ़ॉल्ट कंसोल को टर्मिनल एमुलेटर के रूप में चुनें:

जीआईटी पुल के लिए सिफारिश की गई सेटिंग्स ( फास्ट-फॉरवर्ड या मर्ज ) का उपयोग करें:

जीआईटी-क्रेडेंशियल मैनेजर (डिफ़ॉल्ट सेटिंग) क्रेडेंशियल हेल्पर के लिए उपयोग करें:

अतिरिक्त विकल्प को कॉन्फ़िगर करने में, फ़ाइल सिस्टम कैशिंग को टिक करें और प्रतीकात्मक लिंक को अनटिक करें (जब तक कि आप एक उन्नत उपयोगकर्ता न हों जो एक केंद्रीकृत मॉडल रिपॉजिटरी के लिए हार्ड लिंक का उपयोग कर रहे हों)।

स्थापना को समाप्त करें और जांचें कि जीआईटी ठीक से स्थापित है या नहीं एक सीएमडी विंडो खोलकर और प्रवेश करके:
git --version

गिटहब लॉगिन
बाद में जब आप गिटहब रिपॉजिटरी को क्लोन करने का प्रयास करेंगे, तो आपको अपने गिटहब क्रेडेंशियल्स के लिए चुनौती दी जा सकती है। इसे先 करने के लिए, अपने विंडोज़ सिस्टम पर स्थापित किसी भी ब्राउज़र पर अपने गिटहब खाते में लॉग इन करें (यदि आवश्यक हो तो एक बनाएं)। इस तरह, 0Auth प्रमाणीकरण विधि (एक पॉप-अप विंडो) कम से कम समय लेगी।
6: सीएमके स्थापित करें
सीएमके 3.21 या बाद का संस्करण मुसुबी स्थापना प्रक्रिया के कुछ हिस्सों के लिए आवश्यक है। सीएमके एक क्रॉस-प्लेटफ़ॉर्म विकास वास्तुकला है जो विविध संकलकों को समन्वित करने में सक्षम है और स्रोत कोड से सॉफ़्टवेयर को संकलित करने में सक्षम है।
इसे https://cmake.org/download/ से डाउनलोड करें ( ‘विंडोज़ x64 इंस्टॉलर’)।
लॉन्चर चलाएं:

सुनिश्चित करें कि सीएमके को पथ पर्यावरण चर में जोड़ें चेक किया गया है।

अगला दबाएं।

एक विंडोज़ कमांड प्रॉम्प्ट में टाइप करें और प्रवेश करें:
सीएमके -- संस्करण
यदि सीएमके सफलतापूर्वक स्थापित हो गया है, तो यह कुछ ऐसा प्रदर्शित करेगा:
सीएमके संस्करण 3.31.4
सीएमके सुइट किटवेयर द्वारा बनाए रखा और समर्थित है। com/cmake

7: पाइथन 3.10 स्थापित करें
पाइथन इंटरप्रीटर इस परियोजना के लिए केंद्रीय है। 3.10 संस्करण (मुसुबी पैकेजों की विभिन्न मांगों के बीच एक अच्छा समझौता) को https://www.python.org/downloads/release/python-3100/ से डाउनलोड करें ( ’64- बिट विंडोज़ इंस्टॉलर’)।
डाउनलोड किए गए इंस्टॉलर को चलाएं, और डिफ़ॉल्ट सेटिंग्स पर छोड़ दें:


स्थापना प्रक्रिया के अंत में, पथ लंबाई सीमा अक्षम करें (प्रशासक सहमति की आवश्यकता है) पर क्लिक करें:

एक विंडोज़ कमांड प्रॉम्प्ट में टाइप करें और प्रवेश करें:
पाइथन -- संस्करण
यह परिणाम पाइथन 3.10.0 होना चाहिए

पथ जांचें
मुसुबी फ्रेमवर्क की क्लोनिंग और स्थापना, साथ ही साथ इसका सामान्य संचालन स्थापना के बाद, यह आवश्यक है कि इसके घटकों को विंडोज़ में कई महत्वपूर्ण बाहरी घटकों के पथ के बारे में पता हो, विशेष रूप से सीउडीए।
इसलिए हमें पथ पर्यावरण खोलने और जांच करने की आवश्यकता है कि सभी आवश्यक तत्व वहां हैं।
विंडोज़ पर्यावरण के नियंत्रण को जल्दी से प्राप्त करने का एक तरीका है विंडोज़ खोज बार में सिस्टम पर्यावरण चर संपादित करें टाइप करना।

यह सिस्टम गुण नियंत्रण पैनल खोलेगा। सिस्टम गुण के निचले दाएं कोने में, पर्यावरण चर बटन पर क्लिक करें, और एक विंडो खुलेगी जिसे पर्यावरण चर कहा जाता है। पर्यावरण चर विंडो के निचले आधे हिस्से में सिस्टम चर पैनल में, पथ पर डबल-क्लिक करें। यह पर्यावरण चर संपादित करें विंडो खोलेगा। इस विंडो की चौड़ाई को इतना चौड़ा करें कि आप पूरे पथ देख सकें:

यहां महत्वपूर्ण प्रविष्टियां हैं:
सी: \ प्रोग्राम फ़ाइलें \ एनवीआईडीआईए जीपीयू कंप्यूटिंग टूलकिट \ सीउडीए \ वी 12.6 \ बिन
सी: \ प्रोग्राम फ़ाइलें \ एनवीआईडीआईए जीपीयू कंप्यूटिंग टूलकिट \ सीउडीए \ वी 12.6 \ libnvvp
सी: \ प्रोग्राम फ़ाइलें \ एनवीआईडीआईए जीपीयू कंप्यूटिंग टूलकिट \ सीउडीए \ वी 11.8 \ बिन
सी: \ प्रोग्राम फ़ाइलें \ एनवीआईडीआईए जीपीयू कंप्यूटिंग टूलकिट \ सीउडीए \ वी 11.8 \ libnvvp
सी: \ प्रोग्राम फ़ाइलें (x86) \ माइक्रोसॉफ्ट विज़ुअल स्टूडियो \ 2019 \ कम्युनिटी \ वीसी \ टूल्स \ एमएसवीसी \ 14.29.30133 \ बिन \ होस्टएक्स 64 \ x64
सी: \ प्रोग्राम फ़ाइलें \ माइक्रोसॉफ्ट विज़ुअल स्टूडियो \ 2022 \ कम्युनिटी \ वीसी \ टूल्स \ एमएसवीसी \ 14.42.34433 \ बिन \ होस्टएक्स 64 \ x64
सी: \ प्रोग्राम फ़ाइलें \ गिट \ cmd
सी: \ प्रोग्राम फ़ाइलें \ सीएमके \ बिन
अधिकांश मामलों में, सही पथ चर पहले से ही मौजूद होना चाहिए।
जो पथ गायब हैं उन्हें जोड़ने के लिए नया पर क्लिक करें और सही पथ चिपकाएं:

केवल उन पथों की प्रतिलिपि न बनाएं जो ऊपर सूचीबद्ध हैं; जांचें कि प्रत्येक समान पथ आपके स्वयं के विंडोज़ स्थापना में मौजूद है।
यदि विज़ुअल स्टूडियो स्थापना में छोटे पथ भिन्नताएं हैं (विशेष रूप से x64 में होस्ट 64 में), तो ऊपर सूचीबद्ध पथों का उपयोग करके सही लक्ष्य फ़ोल्डरों का पता लगाएं (अर्थात x64 में होस्ट 64 में)। फिर उन पथों को पर्यावरण चर संपादित करें विंडो में चिपकाएं।
इसके बाद, कंप्यूटर को पुनरारंभ करें।
मुसुबी स्थापित करना
पीआईपी अपग्रेड करें
पीआईपी इंस्टॉलर का नवीनतम संस्करण उपयोग करने से स्थापना के कुछ चरणों को सुव्यवस्थित किया जा सकता है। एक विंडोज़ कमांड प्रॉम्प्ट में प्रशासक विशेषाधिकारों (नीचे एलिवेशन देखें) के साथ, टाइप करें और प्रवेश करें:
पिप इंस्टॉल करें --upgrade पिप
एलिवेशन
कुछ कमांड को बढ़े हुए विशेषाधिकारों की आवश्यकता हो सकती है (अर्थात उन्हें प्रशासक के रूप में चलाने की आवश्यकता है)। यदि आप बाद के चरणों में अनुमति संदेश प्राप्त करते हैं, तो कमांड प्रॉम्प्ट विंडो को बंद करें और इसे प्रशासक मोड में फिर से खोलें विंडोज़ खोज बॉक्स में सीएमडी टाइप करके, कमांड प्रॉम्प्ट पर राइट-क्लिक करके और प्रशासक के रूप में चलाएं का चयन करके:

आगे के चरणों के लिए, हम विंडोज़ कमांड प्रॉम्प्ट के बजाय विंडोज़ पावरशेल का उपयोग करेंगे। आप विंडोज़ खोज बॉक्स में पावरशेल दर्ज करके और (यदि आवश्यक हो) इसे प्रशासक के रूप में चलाने के लिए राइट-क्लिक करके इसे पा सकते हैं:

टॉर्च स्थापित करें
पावरशेल में, टाइप करें और प्रवेश करें:
पिप इंस्टॉल टॉर्च टॉर्चविज़न टॉर्चऑडियो --index-url https://download.pytorch.org/whl/cu118
धैर्य रखें क्योंकि कई पैकेज स्थापित हो रहे हैं।
जब पूरा हो जाए, तो जीपीयू-सक्षम पाइथन स्थापना की पुष्टि करने के लिए टाइप करें और प्रवेश करें:
पाइथन -c " आयात टॉर्च; प्रिंट (टॉर्च.सू.डी.है_अवेलेबल ())"
यह परिणाम सच होना चाहिए
सी: \ विंडोज़ \ सिस्टम 32 \ > पाइथन -c " आयात टॉर्च;
प्रिंट (torch.cuda.is_available ())"
सच
विंडोज़ के लिए ट्राइटन स्थापित करें
इसके बाद, विंडोज़ के लिए ट्राइटन घटक की स्थापना है। प्रशासक पावरशेल में, एक पंक्ति (एक पंक्ति) पर प्रवेश करें:
पिप इंस्टॉल https://github.com/woct0rdho/triton-windows/releases/download/v3.1.0-windows.post8/triton-3.1.0-cp310-cp310-win_amd64.whl
(इंस्टॉलर triton-3.1.0-cp310-cp310-win_amd64.whl 64- बिट आर्किटेक्चर और पाइथन संस्करण के मेल के साथ इंटेल और एएमडी सीपीयू दोनों के लिए काम करता है)
इसके बाद, यह परिणाम होगा:
ट्राइटन-3.1.0 सफलतापूर्वक स्थापित
हम ट्राइटन को पाइथन में आयात करके जांच सकते हैं कि यह काम कर रहा है:
पाइथन -c " आयात ट्राइटन; प्रिंट ('ट्राइटन काम कर रहा है') "
यह आउटपुट होगा:
ट्राइटन काम कर रहा है
जीपीयू-सक्षम ट्राइटन की जांच के लिए, प्रवेश करें:
पाइथन -c " आयात टॉर्च; प्रिंट (टॉर्च.सू.डी.है_अवेलेबल ())"
यह परिणाम सच होना चाहिए:

मुसुबी के लिए वर्चुअल एनवायरनमेंट बनाएं
अब से, हम किसी भी आगे के सॉफ़्टवेयर को एक पाइथन वर्चुअल एनवायरनमेंट (या वेनव ) में स्थापित करेंगे। इसका मतलब है कि आपको इन सभी बाद के सॉफ़्टवेयर को अनइंस्टॉल करने के लिए जो करना होगा वह है वेनव के स्थापना फ़ोल्डर को ट्रैश में खींचें।
आइए स्थापना फ़ोल्डर बनाएं: अपने डेस्कटॉप पर मुसुबी नाम का एक फ़ोल्डर बनाएं। निम्नलिखित उदाहरण मानते हैं कि यह फ़ोल्डर मौजूद है: सी: \ उपयोगकर्ता \ [आपका प्रोफ़ाइल नाम] \ डेस्कटॉप \ मुसुबी \ ।
पावरशेल में, उस फ़ोल्डर में नेविगेट करके प्रवेश करें:
सीडी सी: \ उपयोगकर्ता \ [आपका प्रोफ़ाइल नाम] \ डेस्कटॉप \ मुसुबी
हम चाहते हैं कि वर्चुअल एनवायरनमेंट के पास पहले से ही स्थापित किए गए लोगों तक पहुंच हो (विशेष रूप से ट्राइटन), इसलिए हम --system-site-packages फ्लैग का उपयोग करेंगे। प्रवेश करें:
पाइथन -म वेनव --system-site-packages मुसुबी
प्रतीक्षा करें कि एनवायरनमेंट बन जाए, और फिर इसे सक्रिय करें:
.\ मुसुबी \ स्क्रिप्ट \ एक्टिवेट
अब से, आप देख सकते हैं कि आप सक्रिय वर्चुअल एनवायरनमेंट में हैं क्योंकि (मुसुबी) प्रत्येक प्रॉम्प्ट की शुरुआत में दिखाई देता है।

रिपॉजिटरी क्लोन करें
नव निर्मित मुसुबी फ़ोल्डर में नेविगेट करें (जो आपके डेस्कटॉप पर मुसुबी फ़ोल्डर के भीतर है):
सीडी मुसुबी
अब हम सही स्थान पर हैं, प्रवेश करें:
गिट क्लोन https://github.com/kohya-ss/musubi-tuner.git
क्लोनिंग के पूरा होने की प्रतीक्षा करें (यह बहुत लंबा नहीं होगा).

आवश्यकताओं की स्थापना
स्थापना फ़ोल्डर में नेविगेट करें:
सीडी मुसुबी-ट्यूनर
प्रवेश करें:
पिप इंस्टॉल -r आवश्यकताएं.txt
कई स्थापनाओं के पूरा होने की प्रतीक्षा करें (यह लंबा समय ले सकता है)।

हन्युआन वीडियो वेनव तक स्वचालित पहुंच
भविष्य के सत्रों के लिए वेनव को सक्रिय और एक्सेस करना आसान बनाने के लिए, निम्नलिखित को नोटपैड में पेस्ट करें और इसे एक्टिवेट.बैट नाम से सहेजें (नीचे दी गई छवि देखें)।
@echo off
कॉल सी: \ उपयोगकर्ता \ [आपका प्रोफ़ाइल नाम] \ डेस्कटॉप \ मुसुबी \ मुसुबी \ स्क्रिप्ट \ एक्टिवेट.बैट
सीडी सी: \ उपयोगकर्ता \ [आपका प्रोफ़ाइल नाम] \ डेस्कटॉप \ मुसुबी \ मुसुबी \ मुसुबी-ट्यूनर
सीएमडी
( [आपका प्रोफ़ाइल नाम] को अपने विंडोज़ प्रोफ़ाइल फ़ोल्डर नाम से बदलें।)

इसके बाद यह फ़ाइल कहीं भी संग्रहीत की जा सकती है।
अब आप एक्टिवेट.बैट डबल-क्लिक करके तुरंत काम शुरू कर सकते हैं:

मुसुबी ट्यूनर का उपयोग करना
मॉडल डाउनलोड करना
हन्युआन वीडियो लोरा प्रशिक्षण प्रक्रिया में कम से कम सात मॉडल डाउनलोड करने की आवश्यकता होती है ताकि पूर्व-कैशिंग और हन्युआन वीडियो लोरा को प्रशिक्षित करने के लिए सभी संभावित अनुकूलन विकल्पों का समर्थन किया जा सके। इन मॉडलों का कुल वजन 60 जीबी से अधिक है।
वर्तमान में निम्नलिखित डाउनलोड निर्देश हैं:
क्लिप_ल.सफेटेंसर
llava_llama3_fp16.safetensors और
llava_llama3_fp8.safetensors
को डाउनलोड किया जा सकता है:
https://huggingface.co/Comfy-Org/HunyuanVideo_repackaged/tree/main/split_files/text_encoders
mp_rank_00_model_states.pt
mp_rank_00_model_states_fp8.pt और
mp_rank_00_model_states_fp8_map.pt
को डाउनलोड किया जा सकता है:
https://huggingface.co/tencent/HunyuanVideo/tree/main/hunyuan-video-t2v-720p/transformers
pytorch_model.pt
को डाउनलोड किया जा सकता है:
https://huggingface.co/tencent/HunyuanVideo/tree/main/hunyuan-video-t2v-720p/vae
आप इन्हें किसी भी निर्देशिका में रख सकते हैं, लेकिन स्थिरता के लिए, आइए उन्हें रखें:
सी: \ उपयोगकर्ता \ [आपका प्रोफ़ाइल नाम] \ डेस्कटॉप \ मुसुबी \ मुसुबी \ मुसुबी-ट्यूनर \ मॉडल \
यह पिछले बिंदुओं तक की निर्देशिका व्यवस्था के अनुरूप है। [आपका प्रोफ़ाइल नाम] को अपने विंडोज़ प्रोफ़ाइल फ़ोल्डर नाम से बदलें।
डेटासेट तैयारी
समुदाय के विवाद को दरकिनार करते हुए, यह कहना उचित है कि आपको अपने हन्युआन लोरा डेटासेट के लिए 10-100 फोटो की आवश्यकता होगी, हालांकि 15 छवियों के साथ अच्छे परिणाम प्राप्त किए जा सकते हैं, बशर्ते छवियां संतुलित और उच्च गुणवत्ता वाली हों।
हन्युआन लोरा को छवियों या बहुत छोटे और कम-रिज़ॉल्यूशन वाले वीडियो क्लिप पर प्रशिक्षित किया जा सकता है, या यहां तक कि प्रत्येक का मिश्रण भी – हालांकि प्रशिक्षण डेटा के रूप में वीडियो क्लिप का उपयोग करना भी 24 जीबी कार्ड के लिए चुनौतीपूर्ण है।
हालांकि, वीडियो क्लिप केवल तभी उपयोगी होती हैं जब आपका चरित्र एक असामान्य तरीके से चलता है जो हन्युआन वीडियो फाउंडेशन मॉडल के बारे में नहीं जानता है, या इसका अनुमान नहीं लगा सकता है।
उदाहरणों में रोजर रैबिट, एक ज़ेनोमॉर्फ, द मास्क, स्पाइडर-मैन, या अन्य व्यक्तित्व शामिल हैं जो विशिष्ट विशिष्ट आंदोलन की विशेषता रखते हैं।
चूंकि हन्युआन वीडियो पहले से ही जानता है कि सामान्य पुरुष और महिलाएं कैसे चलते हैं, वीडियो क्लिप मानव-प्रकार के हन्युआन वीडियो लोरा प्राप्त करने के लिए आवश्यक नहीं हैं। इसलिए हम स्थिर छवियों का उपयोग करेंगे।
छवि तैयारी
बाल्टी सूची
टीएलडीआर संस्करण:
यह सबसे अच्छा है कि आप अपने डेटासेट के लिए सभी छवियों का आकार एक जैसा रखें या दो अलग-अलग आकारों के बीच 50/50 विभाजन का उपयोग करें, अर्थात 10 छवियां जो 512x768px हैं और 10 जो 768x512px हैं।
प्रशिक्षण अच्छी तरह से चल सकता है, भले ही आप ऐसा न करें – हन्युआन वीडियो लोरास अप्रत्याशित रूप से क्षमाशील हो सकते हैं।
लंबा संस्करण
जैसा कि स्थिर जेनरेटिव सिस्टम जैसे स्टेबल डिफ्यूजन के लिए कोह्या-एसएस लोरास के साथ, बकेटिंग का उपयोग किया जाता है ताकि यह सुनिश्चित किया जा सके कि छवियों को जीपीयू द्वारा संभाला जा सकता है, जबकि पूरी छवि की सेमांटिक अखंडता को बनाए रखा जा सके।
प्रत्येक छवि आकार के लिए जिसे आप अपने प्रशिक्षण डेटासेट में शामिल करते हैं (अर्थात 512x768px), एक बकेट, या ‘सब-टास्क’ बनाया जाएगा जो उस आकार के लिए है। इसलिए, यदि आपके पास निम्नलिखित छवि वितरण है तो बकेट ध्यान असंतुलित हो जाएगा और जोखिम है कि कुछ फोटो प्रशिक्षण में अन्य लोगों की तुलना में अधिक विचार करेंगे:
2x 512x768px छवियां
7x 768x512px छवियां
1x 1000x600px छवि
3x 400x800px छवियां
हम देख सकते हैं कि बकेट ध्यान असमान रूप से छवियों के बीच विभाजित है:

इसलिए, या तो एक प्रारूप आकार के लिए चिपके रहें, या विभिन्न आकारों के वितरण को अपेक्षाकृत समान रखने का प्रयास करें।
किसी भी मामले में, बहुत बड़ी छवियों से बचें, क्योंकि इससे प्रशिक्षण को धीमा कर दिया जा सकता है, जो कि नगण्य लाभ के लिए है।
मैंने अपने डेटासेट में सभी फोटो के लिए 512x768px का उपयोग किया है।
मेरा डेटासेट 40 छवियों से बना है, पीएनजी प्रारूप में (हालांकि जेपीजी भी ठीक है)। मेरी छवियां संग्रहीत की गईं सी: \ उपयोगकर्ता \ मार्टिन \ डेस्कटॉप \ डेटासेट_हुन्युआन \ उदाहरणमहिला ।
प्रशिक्षण छवि फ़ोल्डर के भीतर एक कैश फ़ोल्डर बनाएं:

अब एक विशेष फ़ाइल बनाएं जो प्रशिक्षण को कॉन्फ़िगर करेगी।
टीओएमएल फ़ाइलें
हन्युआन वीडियो लोरा प्रशिक्षण और पूर्व-कैशिंग प्रक्रिया फ़ाइल पथों को एक समतल पाठ फ़ाइल से प्राप्त करती है जिसमें .toml एक्सटेंशन है।
मेरे परीक्षण के लिए, टीओएमएल फ़ाइल स्थित है सी: \ उपयोगकर्ता \ मार्टिन \ डेस्कटॉप \ डेटासेट_हुन्युआन \ प्रशिक्षण.टोमल ।
मेरी प्रशिक्षण टीओएमएल की सामग्री इस प्रकार है:
[सामान्य]
संकल्प = [512, 768]
कैप्शन_विस्तार = ".txt"
बैच_आकार = 1
सक्षम_बकेट = सच
बकेट_नो_अपस्केल = गलत
[[डेटासेट]]
छवि_निर्देशिका = "सी: \\ उपयोगकर्ता \\ मार्टिन \\ डेस्कटॉप \\ डेटासेट_हुन्युआन \\ उदाहरणमहिला"
कैश_निर्देशिका = "सी: \\ उपयोगकर्ता \\ मार्टिन \\ डेस्कटॉप \\ डेटासेट_हुन्युआन \\ उदाहरणमहिला \\ कैश"
नम_repeats = 1
(डबल बैक-स्लैश छवि और कैश निर्देशिकाओं के लिए हमेशा आवश्यक नहीं होते हैं, लेकिन वे पथ में स्थान के मामले में त्रुटियों से बचने में मदद कर सकते हैं। मैंने.toml फ़ाइलों के साथ प्रशिक्षित किया है जिनमें एकल-आगे और एकल-वापस स्लैश का उपयोग किया गया है।)
हम देख सकते हैं कि संकल्प खंड में दो संकल्पों पर विचार किया जाना है – 512px और 768px। आप इसे 512px पर भी छोड़ सकते हैं और अभी भी अच्छे परिणाम प्राप्त कर सकते हैं।
कैप्शन
हन्युआन वीडियो एक पाठ + दृश्य फाउंडेशन मॉडल है, इसलिए हमें इन छवियों के लिए विवरणात्मक कैप्शन की आवश्यकता होगी, जो प्रशिक्षण के दौरान विचार किया जाएगा। प्रशिक्षण प्रक्रिया कैप्शन के बिना विफल हो जाएगी।
खुले स्रोत कैप्शनिंग सिस्टम की बहुत सारे हैं जिन्हें हम इसके लिए उपयोग कर सकते हैं, लेकिन आइए इसे सरल रखें और टैगगुई सिस्टम का उपयोग करें। हालांकि यह गिटहब पर संग्रहीत है, और हालांकि यह पहले रन पर कुछ भारी गहरे शिक्षण मॉडल डाउनलोड करता है, यह एक सरल विंडोज़ कार्यकारी के रूप में आता है जो पाइथन लाइब्रेरी और एक सीधा जीयूआई लोड करता है।
टैगगुई शुरू करें, फ़ाइल > निर्देशिका लोड करें का उपयोग करके अपने छवि डेटासेट में नेविगेट करें, और वैकल्पिक रूप से एक टोकन पहचानकर्ता (इस मामले में उदाहरणमहिला ) जोड़ दें जो सभी कैप्शन में जोड़ा जाएगा:

(टैगगुई खुलते ही सुनिश्चित करें कि 4-बिट में लोड करें बंद है – यह कैप्शनिंग के दौरान त्रुटियों को फेंक देगा यदि यह छोड़ दिया जाता है)।
बाएं पूर्वावलोकन कॉलम में एक छवि का चयन करें और सभी छवियों का चयन करने के लिए सीटीएल + ए दबाएं। फिर दाएं में स्वचालित कैप्शनिंग शुरू करें बटन दबाएं:

आप देखेंगे कि टैगगुई पहले रन पर मॉडल डाउनलोड कर रहा है, लेकिन बाद में आप एक कैप्शन का पूर्वावलोकन देखेंगे।

अब, प्रत्येक फोटो के पास एक संबंधित.txt कैप्शन है जिसमें इसकी छवि सामग्री का विवरण है:

आप उन्नत विकल्प पर क्लिक करके कैप्शन की लंबाई और शैली को बढ़ा सकते हैं, लेकिन यह इस चलने वाले के दायरे से बाहर है।
टैगगुई बंद करें और आगे बढ़ें।
लेटेंट प्री-कैशिंग
प्रशिक्षण के समय जीपीयू लोड से बचने के लिए, दो प्रकार के पूर्व-कैश्ड फ़ाइलों का निर्माण करना आवश्यक है – एक जो छवियों से व्युत्पन्न लेटेंट छवि का प्रतिनिधित्व करता है, और दूसरा जो कैप्शन सामग्री से संबंधित पाठ एन्कोडिंग का मूल्यांकन करता है।
इन तीन प्रक्रियाओं (2x कैश + प्रशिक्षण) को सरल बनाने के लिए, आप प्रश्न पूछने वाले इंटरैक्टिव.बैट फ़ाइलों का उपयोग कर सकते हैं और जब आप आवश्यक जानकारी दे देंगे तो प्रक्रिया करेंगे।
लेटेंट प्री-कैशिंग के लिए, निम्नलिखित पाठ को नोटपैड में पेस्ट करें और इसे.बैट फ़ाइल के रूप में सहेजें (उदाहरण के लिए, इसे लेटेंट- प्रीकैश.बैट नाम दें), जैसा कि पहले (नीचे दी गई छवि देखें):
@echo off
रिमार्क वर्चुअल एनवायरनमेंट को सक्रिय करें
कॉल सी: \ उपयोगकर्ता \ [आपका प्रोफ़ाइल नाम] \ डेस्कटॉप \ मुसुबी \ मुसुबी \ स्क्रिप्ट \ एक्टिवेट.बैट
रिमार्क उपयोगकर्ता इनपुट प्राप्त करें
सेट / पी छवि_पथ = छवि निर्देशिका का पथ दर्ज करें:
सेट / पी कैश_पथ = कैश निर्देशिका का पथ दर्ज करें:
सेट / पी टोमल_पथ = टोमल फ़ाइल का पथ दर्ज करें:
एचो आप दर्ज किया है:
एचो छवि पथ: % छवि_पथ%
एचो कैश पथ: % कैश_पथ%
एचो टोमल फ़ाइल पथ: % टोमल_पथ%
सेट / पी पुष्टि = क्या आप लेटेंट प्री-कैशिंग (y / n) के साथ आगे बढ़ना चाहते हैं?
अगर / आई "% पुष्टि%" == "y" (
रिमार्क लेटेंट प्री-कैशिंग स्क्रिप्ट चलाएं
पाइथन सी: \ उपयोगकर्ता \ [आपका प्रोफ़ाइल नाम] \ डेस्कटॉप \ मुसुबी \ मुसुबी \ मुसुबी-ट्यूनर \ कैश_लेटेंट्स.पाइथन --डेटासेट_कॉन्फ़िग % टोमल_पथ% --वीए सी: \ उपयोगकर्ता \ [आपका प्रोफ़ाइल नाम] \ डेस्कटॉप \ मुसुबी \ मुसुबी \ मुसुबी-ट्यूनर \ मॉडल \ पाइथन_मॉडल.पीटी --वीए_चंक_साइज 32 --वीए_टाइलिंग
) अन्य (
एचो ऑपरेशन रद्द कर दिया गया।
)
रिमार्क विंडो को खुला रखें
पॉज़
([आपका प्रोफ़ाइल नाम] को अपने वास्तविक विंडोज़ प्रोफ़ाइल फ़ोल्डर नाम से बदलें।)

अब आप.बैट फ़ाइल को स्वचालित लेटेंट कैशिंग के लिए चला सकते हैं:

जब.बैट फ़ाइल से पूछा जाए, तो अपने डेटासेट, कैश फ़ोल्डर और टोमल फ़ाइल के पथ में पेस्ट या टाइप करें।
पाठ प्री-कैशिंग
हम एक दूसरा.बैट फ़ाइल बनाएंगे, इस बार पाठ प्री-कैशिंग के लिए।
@echo off
रिमार्क वर्चुअल एनवायरनमेंट को सक्रिय करें
कॉल सी: \ उपयोगकर्ता \ [आपका प्रोफ़ाइल नाम] \ डेस्कटॉप \ मुसुबी \ मुसुबी \ स्क्रिप्ट \ एक्टिवेट.बैट
रिमार्क उपयोगकर्ता इनपुट प्राप्त करें
सेट / पी छवि_पथ = छवि निर्देशिका का पथ दर्ज करें:
सेट / पी कैश_पथ = कैश निर्देशिका का पथ दर्ज करें:
सेट / पी टोमल_पथ = टोमल फ़ाइल का पथ दर्ज करें:
एचो आप दर्ज किया है:
एचो छवि पथ: % छवि_पथ%
एचो कैश पथ: % कैश_पथ%
एचो टोमल फ़ाइल पथ: % टोमल_पथ%
सेट / पी पुष्टि = क्या आप पाठ एनकोडर आउटपुट प्री-कैशिंग (y / n) के साथ आगे बढ़ना चाहते हैं?
अगर / आई "% पुष्टि%" == "y" (
रिमार्क पाइथन कार्यकारी का उपयोग करें
पाइथन सी: \ उपयोगकर्ता \ [आपका प्रोफ़ाइल नाम] \ डेस्कटॉप \ मुसुबी \ मुसुबी \ मुसुबी-ट्यूनर \ कैश_टेक्स्ट_एनकोडर_आउटपुट.पाइथन --डेटासेट_कॉन्फ़िग % टोमल_पथ% --टेक्स्ट_एनकोडर1 सी: \ उपयोगकर्ता \ [आपका प्रोफ़ाइल नाम] \ डेस्कटॉप \ मुसुबी \ मुसुबी \ मुसुबी-ट्यूनर \ मॉडल \ llava_llama3_fp16.safetensors --text_encoder2 सी: \ उपयोगकर्ता \ [आपका प्रोफ़ाइल नाम] \ डेस्कटॉप \ मुसुबी \ मुसुबी \ मुसुबी-ट्यूनर \ मॉडल \ क्लिप_ल.सफेटेंसर --बैच_साइज 16
) अन्य (
एचो ऑपरेशन रद्द कर दिया गया।
)
रिमार्क विंडो को खुला रखें
पॉज़
([आपका प्रोफ़ाइल नाम] को अपने वास्तविक विंडोज़ प्रोफ़ाइल फ़ोल्डर नाम से बदलें।)
इसे नोटपैड से ‘सब फ़ाइलें’ के रूप में सहेजें, पाठ-कैश.बैट (या आपको जो भी नाम पसंद है) नाम दें।
अब आप.बैट फ़ाइल चला सकते हैं और आवश्यक पाठ-एनकोडेड फ़ाइलें देख सकते हैं जो कैश फ़ोल्डर में दिखाई देंगी:

हन्युआन वीडियो लोरा प्रशिक्षण
वास्तविक लोरा प्रशिक्षण लेटेंट और पाठ प्री-कैशिंग प्रक्रिया की तुलना में काफी लंबा होगा।
हालांकि कई चर हैं जिनके बारे में हम चिंतित हो सकते हैं (जैसे कि बैच आकार, पुनरावृत्ति, युग, और क्या पूर्ण या संक्षिप्त मॉडल का उपयोग करना है, आदि), हम उन विचारों को एक और दिन के लिए और लोरा निर्माण की बारीकियों पर गहराई से देखेंगे।
अभी के लिए, आइए विकल्पों को थोड़ा कम करें और ‘मध्यम’ सेटिंग्स पर एक लोरा प्रशिक्षित करें।
हम एक तीसरा.बैट फ़ाइल बनाएंगे, इस बार प्रशिक्षण को प्रारंभ करने के लिए। नोटपैड में पेस्ट करें और इसे.बैट फ़ाइल के रूप में सहेजें (जैसे प्रशिक्षण.बैट नाम दें):
@echo off
रिमार्क वर्चुअल एनवायरनमेंट को सक्रिय करें
कॉल सी: \ उपयोगकर्ता \ [आपका प्रोफ़ाइल नाम] \ डेस्कटॉप \ मुसुबी \ मुसुबी \ स्क्रिप्ट \ एक्टिवेट.बैट
रिमार्क उपयोगकर्ता इनपुट प्राप्त करें
सेट / पी डेटासेट_कॉन्फ़िग = डेटासेट कॉन्फ़िग फ़ाइल का पथ दर्ज करें:
सेट / पी युग = प्रशिक्षण के लिए युग संख्या दर्ज करें:
सेट / पी आउटपुट_नाम = आउटपुट मॉडल नाम (उदाहरण के लिए, उदाहरण0001) दर्ज करें:
सेट / पी लर्निंग_रेट = सीखने की दर चुनें (1 के लिए 1e-3, 2 के लिए 5e-3, डिफ़ॉल्ट 1e-3):
अगर "% लर्निंग_रेट%" == "1" सेट एलआर = 1e-3
अगर "% लर्निंग_रेट%" == "2" सेट एलआर = 5e-3
अगर "% लर्निंग_रेट%" == "" सेट एलआर = 1e-3
सेट / पी सेव_स्टेप्स = प्रशिक्षण पूर्वावलोकन छवियों को कितनी बार (चरणों में) सहेजना है:
सेट / पी नमूना_प्रॉम्प्ट = प्रशिक्षण पूर्वावलोकन के लिए पाठ-प्रॉम्प्ट फ़ाइल का स्थान क्या है:
एचो आप दर्ज किया है:
एचो डेटासेट कॉन्फ़िग फ़ाइल: % डेटासेट_कॉन्फ़िग%
एचो युग संख्या: % युग%
एचो आउटपुट नाम: % आउटपुट_नाम%
एचो लर्निंग दर: % एलआर%
एचो प्रशिक्षण पूर्वावलोकन छवियों को % सेव_स्टेप्स% चरणों में सहेजना।
एचो प्रशिक्षण पूर्वावलोकन के लिए पाठ-प्रॉम्प्ट फ़ाइल: % नमूना_प्रॉम्प्ट%
रिमार्क कमांड तैयार करें
सेट सीएमडी = त्वरण लॉन्च --num_cpu_threads_per_process 1 --मिश्रित_सटीकता bf16 ^
सी: \ उपयोगकर्ता \ [आपका प्रोफ़ाइल नाम] \ डेस्कटॉप \ मुसुबी \ मुसुबी \ मुसुबी-ट्यूनर \ hv_train_network.py ^
--dit सी: \ उपयोगकर्ता \ [आपका प्रोफ़ाइल नाम] \ डेस्कटॉप \ मुसुबी \ मुसुबी \ मुसुबी-ट्यूनर \ मॉडल \ mp_rank_00_model_states.pt ^
--डेटासेट_कॉन्फ़िग % डेटासेट_कॉन्फ़िग% ^
--sdpa ^
--मिश्रित_सटीकता bf16 ^
--fp8_base ^
--ऑप्टिमाइज़र_प्रकार adamw8bit ^
--लर्निंग_रेट % एलआर% ^
--ग्रेडिएंट_चेकपॉइंटिंग ^
--मैक्स_डेटा_लोडर_n_वर्कर्स 2 ^
--स्थायी_डेटा_लोडर_वर्कर्स ^
--नेटवर्क_मॉड्यूल = नेटवर्क.लोरा ^
--नेटवर्क_आयाम = 32 ^
--टाइमस्टेप_सैंपलिंग सिग्मॉइड ^
--डिस्क्रीट_फ्लो_शिफ्ट 1.0 ^
--मैक्स_ट्रेन_युग % युग% ^
--सेव_हर_n_युग = 1 ^
--बीज 42 ^
--आउटपुट_निर्देशिका "सी: \ उपयोगकर्ता \ [आपका प्रोफ़ाइल नाम] \ डेस्कटॉप \ मुसुबी \ आउटपुट मॉडल" ^
--आउटपुट_नाम % आउटपुट_नाम% ^
--वीए सी: / उपयोगकर्ता / [आपका प्रोफ़ाइल नाम] / डेस्कटॉप / मुसुबी / मुसुबी / मुसुबी-ट्यूनर / मॉडल / पाइथन_मॉडल.पीटी ^
--वीए_चंक_साइज 32 ^
--वीए_स्पेशल_टाइल_सैंपल_मिन_साइज 128 ^
--टेक्स्ट_एनकोडर1 सी: / उपयोगकर्ता / [आपका प्रोफ़ाइल नाम] / डेस्कटॉप / मुसुबी / मुसुबी / मुसुबी-ट्यूनर / मॉडल / llava_llama3_fp16.safetensors ^
--टेक्स्ट_एनकोडर2 सी: / उपयोगकर्ता / [आपका प्रोफ़ाइल नाम] / डेस्कटॉप / मुसुबी / मुसुबी / मुसुबी-ट्यूनर / मॉडल / क्लिप_ल.सफेटेंसर ^
--नमूना_प्रॉम्प्ट % नमूना_प्रॉम्प्ट% ^
--नमूना_हर_n_चरण % सेव_स्टेप्स% ^
--नमूना_पहले
एचो कमांड निम्नलिखित होगा:
एचो % सीएमडी%
सेट / पी पुष्टि = क्या आप प्रशिक्षण (y / n) के साथ आगे बढ़ना चाहते हैं?
अगर / आई "% पुष्टि%" == "y" (
% सीएमडी%
) अन्य (
एचो ऑपरेशन रद्द कर दिया गया।
)
रिमार्क विंडो को खुला रखें
सीएमडी
([आपका प्रोफ़ाइल नाम] को अपने वास्तविक विंडोज़ प्रोफ़ाइल फ़ोल्डर नाम से बदलें।)
सुनिश्चित करें कि सी: \ उपयोगकर्ता \ [आपका प्रोफ़ाइल नाम] \ डेस्कटॉप \ मुसुबी \ आउटपुट मॉडल \ निर्देशिका मौजूद है, और यदि नहीं है तो उस स्थान पर इसे बनाएं।
प्रशिक्षण पूर्वावलोकन
मुसुबी ट्यूनर में एक बहुत ही बुनियादी प्रशिक्षण पूर्वावलोकन सुविधा है जो आपको प्रशिक्षण मॉडल को रोकने और प्रॉम्प्ट पर आधारित छवियों को उत्पन्न करने की अनुमति देती है। ये छवियां स्वचालित रूप से एक नाम नमूना वाले फ़ोल्डर में सहेजी जाती हैं, जो उसी निर्देशिका में होती हैं जहां प्रशिक्षित मॉडल सहेजे जाते हैं।

इसका उपयोग करने के लिए, आपको कम से कम एक प्रॉम्प्ट को एक फ़ाइल में सहेजना होगा जो प्रशिक्षण बैट फ़ाइल द्वारा मांगी जाएगी। इसलिए, आप प्रॉम्प्ट फ़ाइल को किसी भी नाम से सहेज सकते हैं और इसे कहीं भी रख सकते हैं।
यहां कुछ प्रॉम्प्ट उदाहरण दिए गए हैं जो एक फ़ाइल में आउटपुट तीन अलग-अलग छवियां देंगे जब प्रशिक्षण द्वारा अनुरोध किया जाएगा:

जैसा कि आप ऊपर दी गई छवि में देख सकते हैं, आप प्रॉम्प्ट के अंत में फ़्लैग जोड़ सकते हैं जो छवियों को प्रभावित करेंगे:
–w चौड़ाई (डिफ़ॉल्ट रूप से 256px यदि निर्धारित नहीं किया गया है, डॉक्स के अनुसार)
–h ऊंचाई (डिफ़ॉल्ट रूप से 256px यदि निर्धारित नहीं किया गया है)
–f फ्रेम संख्या। यदि 1 पर सेट किया गया है, तो एक छवि उत्पन्न की जाएगी; एक से अधिक, एक वीडियो।
–d बीज। यदि निर्धारित नहीं किया गया है, तो यह यादृच्छिक होगा; हालांकि, आपको एक निर्धारित करना चाहिए ताकि आप एक प्रॉम्प्ट के विकास को देख सकें।
–s पीढ़ी में चरणों की संख्या (डिफ़ॉल्ट 20)।
अधिक फ़्लैग के लिए आधिकारिक दस्तावेज़ देखें।
प्रशिक्षण पूर्वावलोकन जल्दी से कुछ मुद्दों को प्रकट कर सकते हैं जो आपको प्रशिक्षण रोकने और डेटा या सेटअप को फिर से देखने का कारण बन सकते हैं, इस प्रकार समय बचा सकते हैं।
हालांकि, प्रत्येक अतिरिक्त प्रॉम्प्ट प्रशिक्षण को थोड़ा धीमा कर देगा।
प्रशिक्षण पूर्वावलोकन छवि की चौड़ाई और ऊंचाई (ऊपर सूचीबद्ध फ़्लैग में) जितनी बड़ी होगी, प्रशिक्षण को उतनी ही अधिक धीमा कर देगी।
प्रशिक्षण.बैट फ़ाइल चलाएं।
प्रश्न #1 डेटासेट कॉन्फ़िग फ़ाइल का पथ है। अपने टोमल फ़ाइल के पथ में पेस्ट या टाइप करें।
प्रश्न #2 प्रशिक्षण के लिए युग संख्या है। यह एक परीक्षण और त्रुटि चर है जो छवियों और कैप्शन की संख्या और गुणवत्ता जैसे कारकों से प्रभावित होता है, साथ ही अन्य कारकों से भी। सामान्य तौर पर, यह सबसे अच्छा है कि इसे बहुत कम न रखें क्योंकि आप प्रशिक्षण को रोक सकते हैं यदि आप महसूस करते हैं कि मॉडल आगे बढ़ गया है Ctrl + C के साथ प्रशिक्षण विंडो में। इसे पहले 100 में सेट करें और देखें कि यह कैसा चल रहा है।
प्रश्न #3 आउटपुट मॉडल नाम है। अपने मॉडल को नाम दें! शायद सबसे अच्छा यह है कि नाम को काफी छोटा और सरल रखा जाए।
प्रश्न #4 सीखने की दर है, जो डिफ़ॉल्ट रूप से 1e-3 (विकल्प 1) पर सेट है। यह एक अच्छी जगह है जहां से शुरू करना है।
प्रश्न #5 प्रशिक्षण पूर्वावलोकन छवियों को कितनी बार (चरणों में) सहेजना है। यदि आप इसे बहुत कम सेट करते हैं, तो आप प्रशिक्षण पूर्वावलोकन छवि सहेजने के बीच बहुत कम प्रगति देखेंगे, और यह प्रशिक्षण को धीमा कर देगा।
प्रश्न #6 प्रशिक्षण पूर्वावलोकन के लिए पाठ-प्रॉम्प्ट फ़ाइल का स्थान क्या है। अपने प्रॉम्प्ट्स टेक्स्ट फ़ाइल के पथ में पेस्ट या टाइप करें।
.बैट तब आपको दिखाएगा कि यह हन्युआन मॉडल को कौन सा कमांड भेजेगा, और पूछेगा कि क्या आप प्रशिक्षण शुरू करना चाहते हैं, y / n।
प्रशिक्षण शुरू करें:

इस दौरान, यदि आप विंडोज़ टास्क मैनेजर के प्रदर्शन टैब के जीपीयू अनुभाग की जांच करते हैं, तो आप देखेंगे कि प्रक्रिया लगभग 16 जीबी वीआरएएम का उपयोग कर रही है।

यह संख्या यादृच्छिक नहीं हो सकती है, क्योंकि यह कई एनवीआईडीआईए ग्राफिक्स कार्ड पर उपलब्ध वीआरएएम की मात्रा है, और अपस्ट्रीम कोड को 16 जीबी में फिट करने के लिए अनुकूलित किया जा सकता है जो इन कार्डों के मालिकों के लिए लाभ के लिए है।
हालांकि, यह बहुत आसान है कि इस उपयोग को बढ़ाया जाए, जटिल फ़्लैग को प्रशिक्षण कमांड में भेजा जाए।
प्रशिक्षण के दौरान, आप कमांड विंडो के निचले दाएं कोने में देखेंगे कि कितना समय बीत चुका है और अनुमानित कुल प्रशिक्षण समय (जो फ़्लैग के आधार पर, प्रशिक्षण छवियों की संख्या, प्रशिक्षण पूर्वावलोकन छवियों की संख्या, और कई अन्य कारकों के आधार पर बहुत भिन्न हो सकता है)।

एक विशिष्ट प्रशिक्षण समय 3-4 घंटे है मध्यम सेटिंग्स पर, उपलब्ध हार्डवेयर, छवि संख्या, फ़्लैग सेटिंग्स, और अन्य कारकों पर निर्भर करता है।
अपने प्रशिक्षित लोरा मॉडल का उपयोग हन्युआन वीडियो में
चेकपॉइंट चुनना
जब प्रशिक्षण पूरा हो जाता है, तो आपके पास प्रत्येक प्रशिक्षण युग के लिए एक मॉडल चेकपॉइंट होगा।

यह बचत आवृत्ति को बदला जा सकता है; उपयोगकर्ता द्वारा --सेव_हर_n_युग [एन] नंबर को संशोधित करके प्रशिक्षण बैट फ़ाइल में। यदि आपने प्रशिक्षण के दौरान पूर्वावलोकन छवियों को सहेजने के लिए एक कम संख्या सेट की है, तो कई चेकपॉइंट फ़ाइलें होंगी।
कौन सा चेकपॉइंट चुनना है?
जैसा कि पहले उल्लेख किया गया है, सबसे पहले प्रशिक्षित मॉडल सबसे लचीले होंगे, जबकि बाद के चेकपॉइंट सबसे विस्तृत हो सकते हैं। इन कारकों के बीच सबसे अच्छा संतुलन खोजने का एकमात्र तरीका है कि कुछ लोरा चलाएं और कुछ वीडियो बनाएं। इस तरह आप देख सकते हैं कि कौन से चेकपॉइंट सबसे उत्पादक हैं और लचीलेपन और विवरण के बीच सबसे अच्छा संतुलन प्रदान करते हैं।
कॉम्फ़ूआई
वर्तमान में हन्युआन वीडियो लोरा का उपयोग करने के लिए सबसे लोकप्रिय (हालांकि एकमात्र नहीं) वातावरण कॉम्फ़ूआई है, जो एक नोड-आधारित संपादक है जिसमें एक जटिल ग्रेडियो इंटरफ़ेस है जो आपके वेब ब्राउज़र में चलता है।

स्थापना निर्देश आधिकारिक गिटहब रिपॉजिटरी (अतिरिक्त मॉडल डाउनलोड करने होंगे) पर उपलब्ध हैं।
कॉम्फ़ूआई के लिए मॉडल को परिवर्तित करना
आपके प्रशिक्षित मॉडल डिफ्यूजर्स प्रारूप में सहेजे जाते हैं जो अधिकांश कॉम्फ़ूआई कार्यान्वयन के साथ संगत नहीं हैं। मुसुबी एक मॉडल को कॉम्फ़ूआई-संगत प्रारूप में परिवर्तित करने में सक्षम है। आइए एक.बैट फ़ाइल स्थापित करें जो इसे लागू करेगा।
@echo off
रिमार्क वर्चुअल एनवायरनमेंट को सक्रिय करें
कॉल सी: \ उपयोगकर्ता \ [आपका प्रोफ़ाइल नाम] \ डेस्कटॉप \ मुसुबी \ मुसुबी \ स्क्रिप्ट \ एक्टिवेट.बैट
: शुरू
रिमार्क उपयोगकर्ता इनपुट प्राप्त करें
सेट / पी इनपुट_पथ = मुसुबी सेफटेंसर फ़ाइल का पथ दर्ज करें (या 'एक्जिट' टाइप करें और बाहर निकलें):
रिमार्क यदि उपयोगकर्ता 'एक्जिट' टाइप करता है तो बाहर निकलें
अगर / आई "% इनपुट_पथ%" == "exit" जाओ अंत
रिमार्क फ़ाइल नाम को इनपुट पथ से निकालें और 'परिवर्तित' जोड़ें
for %% F in ("% input_path%") do set FILENAME = %% ~ nF
सेट आउटपुट_पथ = सी: \ उपयोगकर्ता \ [आपका प्रोफ़ाइल नाम] \ डेस्कटॉप \ मुसुबी \ आउटपुट मॉडल \ परिवर्तित \ % फ़ाइल नाम%_परिवर्तित.सफेटेंसर
सेट लक्ष्य = अन्य
एचो आप दर्ज किया है:
एचो इनपुट फ़ाइल: % इनपुट_पथ%
एचो आउटपुट फ़ाइल: % आउटपुट_पथ%
एचो लक्ष्य प्रारूप: % लक्ष्य%
सेट / पी पुष्टि = क्या आप रूपांतरण (y / n) के साथ आगे बढ़ना चाहते हैं?
अगर / आई "% पुष्टि%" == "y" (
रिमार्क रूपांतरण स्क्रिप्ट चलाएं
पाइथन सी: \ उपयोगकर्ता \ [आपका प्रोफ़ाइल नाम] \ ड












