एआई मॉडल और प्लेटफ़ॉर्म
ओपनएआई ने एक नए एआई प्रोग्राम को विकसित किया है जो जेनर्स के आधार पर संगीत बनाता है
स्वतंत्र अनुसंधान संगठन ओपनएआई ने हाल ही में एक नए प्रकार के जेनरेटिव एआई को जारी किया है, जिसे जुकबॉक्स नाम दिया गया है, जो इसकी संगीत उत्पन्न करने की क्षमता के कारण है। जुकबॉक्स एआई विभिन्न विशेषताओं जैसे कि वाद्य और गीत के बोल के आधार पर ध्वनि उत्पन्न कर सकता है, और ओपनएआई अनुसंधान टीम ने इस एआई को संपीडित ऑडियो क्लिप और विभिन्न गीत के बोल के टुकड़ों पर प्रशिक्षित करके बनाया है।
टेकक्रंच की रिपोर्ट के अनुसार, ओपनएआई शोधकर्ताओं ने मॉडल को कच्चे ऑडियो क्लिप का उपयोग करके प्रशिक्षित किया, जिससे मॉडल को ऑडियो उत्पन्न करने की क्षमता मिली। यह अन्य संगीत उत्पन्न करने वाले अनुप्रयोगों के निर्माण के लिए उपयोग की जाने वाली विधियों से अलग है, जो अक्सर “प्रतीकात्मक संगीत” (जैसे एमआईडीआई संगीत) पर निर्भर करते हैं, जो नोट्स और स्वरों के बारे में जानकारी है, लेकिन वास्तविक ऑडियो नहीं है। शोधकर्ताओं की टीम ने मॉडल को प्रशिक्षित करने के लिए कन्वोल्यूशनल न्यूरल नेटवर्क का उपयोग किया, ऑडियो को संपीड़ित किया, और इसे एक प्रारूप में एन्कोड किया जिसे न्यूरल नेटवर्क व्याख्या कर सकता था। इसके बाद, एक ट्रांसफॉर्मर का उपयोग संपीड़ित ऑडियो को उत्पन्न करने के लिए किया गया था, जिसे ऑडियो प्रारूप में परिवर्तित करने के लिए अपसैंपल किया गया था।
जुकबॉक्स बनाते समय, ओपनएआई को ऑडियो की जटिल, घनी प्रकृति से निपटने का एक तरीका बनाना था। शोधकर्ताओं ने ऑडियो की निरंतर प्रकृति से निपटने के लिए इसे अधिक विच्छिन्न, पचने योग्य खंडों में तोड़ दिया, गीतों को 1/128 वें सेकंड लंबे टुकड़ों में विभाजित किया। लक्ष्य एक ऐसा एआई मॉडल बनाना था जो गीतों को इतने बड़े टुकड़ों में तोड़ सके कि समस्या असाध्य न हो, लेकिन इतने छोटे और सटीक कि मॉडल गीत के पैटर्न को सीख सके और उस पैटर्न को पुनर्निर्माण कर सके।
ओपनएआई द्वारा उपयोग की जाने वाली तकनीक कंपनी द्वारा पहले निर्मित एक पुराने संगीत-उत्पन्न करने वाले एआई के साथ कुछ समानताएं साझा करती है, जिसे म्यूज़नेट कहा जाता है। म्यूज़नेट को एमआईडीआई फ़ाइलों पर प्रशिक्षित किया गया था और विभिन्न शैलियों में संगीत उत्पन्न करने में सक्षम था, हालांकि यह गीत की समग्र धुन पर केंद्रित था और गीत के बोल नहीं बना सकता था। इसके विपरीत, जुकबॉक्स संगीत के साथ अपने गीत लिखने में सक्षम है। गीत “सह-लिखे” जाते हैं ओपनएआई शोधकर्ताओं द्वारा, मॉडल को निश्चित शैलियों में गीत लिखने के लिए मार्गदर्शन करते हैं। जुकबॉक्स प्रणाली को लिरिकविकी से स्क्रैप किए गए गीतों के साथ प्रशिक्षित किया गया था, जिसमें 1.2 मिलियन गीतों के लिए पाठ और मेटाडेटा शामिल था।
मॉडल के गीतों के संबंध में, शोधकर्ताओं ने पहले एक सरल ह्यूरिस्टिक का उपयोग करने की कोशिश की जो गीत की अवधि के दौरान गीतों को फैलाता है, विशिष्ट गीत/खंड के साथ मेल खाने वाले पाठ का विश्लेषण करता है। यह सरल दृष्टिकोण一般 रूप से अच्छा काम करता था, हालांकि शोधकर्ताओं ने पाया कि जब गीत विशेष रूप से तेज थे तो यह टूट जाता था। इस समस्या से निपटने के लिए, गीत से वोकल्स को निकाला गया और गीत के पाठ के साथ संरेखित किया गया ताकि गीतों के लिए शब्द-स्तरीय संरेखण प्राप्त किया जा सके। इसके बाद, गीतों के लिए एक एन्कोडिंग परत का उपयोग किया गया था, साथ ही एक ध्यान परत जो संगीत के खंडों को गीतों के साथ मैप करती थी, जो कि की-मूल्य जोड़े का उपयोग करती थी। परिणाम यह था कि गीत और वोकल्स का एक相当 सटीक मिलान था।
पेपर के लेखकों का भी उल्लेख है कि जुकबॉक्स में कई सीमाएं हैं, और भविष्य के काम में एआई की क्षमता में सुधार करने का लक्ष्य है। जैसा कि लेखक एक ब्लॉग पोस्ट में लिखते हैं:
“जुकबॉक्स संगीत की गुणवत्ता, संगति, ऑडियो नमूने की लंबाई और कलाकार, शैली और गीतों पर सशर्त होने की क्षमता में एक कदम आगे है, लेकिन मानव निर्मित संगीत और इन उत्पन्नों के बीच एक महत्वपूर्ण अंतर है। उदाहरण के लिए, जबकि उत्पन्न गीत स्थानीय संगीत संरचना दिखाते हैं, पारंपरिक कॉर्ड पैटर्न का पालन करते हैं और यहां तक कि प्रभावशाली सोलोस भी प्रदर्शित कर सकते हैं, हम बड़े संगीत संरचनाओं जैसे पुनरावृत्ति चोरस को नहीं सुनते हैं जो परिचित हैं।”
वर्तमान में, मॉडल एक गीत का उत्पादन करने में सक्षम है जो एक विशिष्ट शैली या यहां तक कि एक विशिष्ट कलाकार की शैली में पहचानने योग्य है। उदाहरण के लिए, यह एल्विस प्रेस्ली, कैटी पेरी या रेज अगेंस्ट द मशीन की शैली में गीत बना सकता है। हालांकि गीत एक शैली या गायक की शैली में पहचानने योग्य हैं, वे अक्सर एक परोडी या एक गीत के खराब कवर संस्करण की तरह लगते हैं। फिर भी, तकनीकी उपलब्धि प्रभावशाली है। जुकबॉक्स को बनाने के लिए जिम्मेदार शोधकर्ताओं ने संगीत उत्पन्न करने में सक्षम एक कार्यक्रम पर काम करने का विकल्प चुना क्योंकि यह कार्य कठिन था, और शोधकर्ता अपनी तकनीकों को और परिष्कृत करने की योजना बना रहे हैं। आप यहां कुछ गीत सुन सकते हैं।












