एआई मॉडल और प्लेटफ़ॉर्म
ऑडियोसेप: आप जो वर्णन करते हैं उसे अलग करें

LASS या लैंग्वेज-queried ऑडियो सोर्स सेपरेशन CASA या कम्प्यूटेशनल ऑडिटरी सीन एनालिसिस के लिए एक नया परिदृश्य है जो एक प्राकृतिक भाषा क्वेरी का उपयोग करके एक दिए गए ऑडियो मिश्रण से एक लक्ष्य ध्वनि को अलग करने का लक्ष्य रखता है जो डिजिटल ऑडियो कार्यों और अनुप्रयोगों के लिए एक प्राकृतिक लेकिन स्केलेबल इंटरफेस प्रदान करता है। हालांकि पिछले कुछ वर्षों में LASS फ्रेमवर्क ने विशिष्ट ऑडियो स्रोतों जैसे संगीत वाद्यों पर वांछित प्रदर्शन प्राप्त करने के मामले में काफी प्रगति की है, वे खुले डोमेन में लक्ष्य ऑडियो को अलग नहीं कर पाते हैं।
ऑडियोसेप एक फाउंडेशनल मॉडल है जो LASS फ्रेमवर्क की वर्तमान सीमाओं को हल करने का लक्ष्य रखता है जो प्राकृतिक भाषा क्वेरी का उपयोग करके लक्ष्य ऑडियो पृथक्करण को सक्षम बनाता है। ऑडियोसेप फ्रेमवर्क के विकासकर्ताओं ने मॉडल को व्यापक रूप से बड़े पैमाने पर मल्टीमॉडल डेटासेट पर प्रशिक्षित किया है, और उन्होंने संगीत वाद्य पृथक्करण, ऑडियो इवेंट पृथक्करण और भाषण में सुधार जैसे विभिन्न ऑडियो कार्यों सहित प्रदर्शन का मूल्यांकन किया है। ऑडियोसेप के प्रारंभिक प्रदर्शन ने बेंचमार्क को संतुष्ट किया क्योंकि यह प्रभावशाली शून्य-शॉट लर्निंग क्षमता प्रदर्शित करता है और मजबूत ऑडियो पृथक्करण प्रदर्शन प्रदान करता है।
इस लेख में, हम ऑडियोसेप फ्रेमवर्क के कार्यों में गहराई से जाने का लक्ष्य रखते हैं क्योंकि हम मॉडल की वास्तुकला, प्रशिक्षण और मूल्यांकन के लिए उपयोग किए जाने वाले डेटासेट और ऑडियोसेप मॉडल के कार्य में शामिल आवश्यक अवधारणाओं का मूल्यांकन करेंगे। तो आइए CASA फ्रेमवर्क की एक मूलभूत परिचय से शुरू करें।
CASA, USS, QSS, LASS फ्रेमवर्क: ऑडियोसेप के लिए आधार
CASA या कम्प्यूटेशनल ऑडिटरी सीन एनालिसिस फ्रेमवर्क एक फ्रेमवर्क है जिसका उपयोग डेवलपर्स द्वारा मशीन लिसनिंग सिस्टम डिजाइन करने के लिए किया जाता है जो जटिल ध्वनि पर्यावरण को मानवों द्वारा ध्वनि की अपनी श्रवण प्रणाली का उपयोग करके ध्वनि की धारणा के समान तरीके से ध्वनि की धारणा कर सकते हैं। ध्वनि पृथक्करण, लक्ष्य ध्वनि पृथक्करण पर विशेष ध्यान देने के साथ, CASA फ्रेमवर्क के भीतर एक मूलभूत क्षेत्र है, और यह “कॉकटेल पार्टी समस्या” या वास्तविक दुनिया की ऑडियो रिकॉर्डिंग से व्यक्तिगत ऑडियो स्रोत रिकॉर्डिंग या फ़ाइलों को अलग करने की समस्या का समाधान करने का लक्ष्य रखता है। ध्वनि पृथक्करण का महत्व मुख्य रूप से इसके व्यापक अनुप्रयोगों के कारण है, जिनमें संगीत स्रोत पृथक्करण, ऑडियो स्रोत पृथक्करण, भाषण सुधार, लक्ष्य ध्वनि पहचान और बहुत कुछ शामिल हैं।
ध्वनि पृथक्करण पर अधिकांश काम जो अतीत में किया गया है, मुख्य रूप से संगीत पृथक्करण या भाषण पृथक्करण जैसे एक या एक से अधिक ऑडियो स्रोतों को अलग करने पर केंद्रित है। एक नया मॉडल जिसे USS या यूनिवर्सल साउंड सेपरेशन कहा जाता है, वास्तविक दुनिया की ऑडियो रिकॉर्डिंग में मनमानी ध्वनियों को अलग करने का लक्ष्य रखता है। हालांकि, यह एक चुनौतीपूर्ण और प्रतिबंधित कार्य है कि ऑडियो मिश्रण से हर ध्वनि स्रोत को अलग करना मुख्य रूप से दुनिया में मौजूद विभिन्न ध्वनि स्रोतों की विस्तृत श्रृंखला के कारण है, जो मुख्य कारण है कि USS विधि वास्तविक दुनिया के अनुप्रयोगों के लिए व्यावहारिक नहीं है जो वास्तविक समय में काम करते हैं।
USS विधि का एक व्यावहारिक विकल्प QSS या क्वेरी-आधारित साउंड सेपरेशन विधि है जो एक विशिष्ट सेट के आधार पर ऑडियो मिश्रण से एक व्यक्तिगत या लक्ष्य ध्वनि स्रोत को अलग करने का लक्ष्य रखता है। इसके लिए धन्यवाद, QSS फ्रेमवर्क डेवलपर्स और उपयोगकर्ताओं को अपनी आवश्यकताओं के आधार पर ऑडियो मिश्रण से वांछित स्रोतों को निकालने की अनुमति देता है, जो QSS विधि को मल्टीमीडिया सामग्री संपादन या ऑडियो संपादन जैसे डिजिटल वास्तविक दुनिया के अनुप्रयोगों के लिए एक अधिक व्यावहारिक समाधान बनाता है।
इसके अलावा, डेवलपर्स ने हाल ही में QSS फ्रेमवर्क का एक विस्तार प्रस्तावित किया है, LASS फ्रेमवर्क या लैंग्वेज-queried ऑडियो सोर्स सेपरेशन फ्रेमवर्क जो लक्ष्य ध्वनि स्रोतों को ऑडियो मिश्रण से अलग करने के लिए प्राकृतिक भाषा विवरणों का उपयोग करता है। चूंकि LASS फ्रेमवर्क उपयोगकर्ताओं को प्राकृतिक भाषा निर्देशों के सेट का उपयोग करके लक्ष्य ऑडियो स्रोतों को निकालने की अनुमति देता है, यह डिजिटल ऑडियो अनुप्रयोगों में एक शक्तिशाली उपकरण बन सकता है। पारंपरिक ऑडियो-queried या दृश्य-queried विधियों की तुलना में प्राकृतिक भाषा निर्देशों का उपयोग करके ध्वनि पृथक्करण का लाभ यह है कि यह लचीलापन जोड़ता है और क्वेरी जानकारी प्राप्त करना आसान और अधिक सुविधाजनक बनाता है। इसके अलावा, लेबल क्वेरी आधारित ऑडियो पृथक्करण फ्रेमवर्क की तुलना में जो पूर्वनिर्धारित निर्देशों या क्वेरी के सेट का उपयोग करते हैं, LASS फ्रेमवर्क इनपुट क्वेरी की संख्या को सीमित नहीं करता है और खुले डोमेन में सुगम रूप से सामान्यीकृत किया जा सकता है।
मूल रूप से, LASS फ्रेमवर्क पर्यवेक्षित लर्निंग पर निर्भर करता है जिसमें मॉडल को लेबल वाले ऑडियो-टेक्स्ट जोड़े गए डेटा पर प्रशिक्षित किया जाता है। हालांकि, इस दृष्टिकोण के साथ मुख्य समस्या यह है कि लेबल वाले ऑडियो-टेक्स्ट डेटा की सीमित उपलब्धता है। LASS फ्रेमवर्क पर लेबल वाले ऑडियो-टेक्स्ट डेटा पर निर्भरता को कम करने के लिए, मॉडल को मल्टीमॉडल पर्यवेक्षण लर्निंग दृष्टिकोण का उपयोग करके प्रशिक्षित किया जाता है। मल्टीमॉडल पर्यवेक्षण दृष्टिकोण का मुख्य उद्देश्य CLIP या कंट्रास्टिव लैंग्वेज इमेज प्री-ट्रेनिंग मॉडल जैसे मल्टीमॉडल कंट्रास्टिव प्री-प्रशिक्षण मॉडल का उपयोग करके फ्रेमवर्क के लिए क्वेरी एनकोडर के रूप में उपयोग करना है। चूंकि CLIP फ्रेमवर्क पाठ्य सामग्री को अन्य मोडलिटी जैसे ऑडियो या दृष्टि के साथ संरेखित करने में सक्षम है, यह डेवलपर्स को डेटा-समृद्ध मोडलिटी का उपयोग करके LASS मॉडल को प्रशिक्षित करने और शून्य-शॉट सेटिंग में पाठ्य सामग्री के साथ हस्तक्षेप करने की अनुमति देता है। हालांकि, वर्तमान LASS फ्रेमवर्क छोटे पैमाने पर डेटासेट का उपयोग करके प्रशिक्षित किए जाते हैं, और LASS फ्रेमवर्क के सैकड़ों संभावित डोमेन में अनुप्रयोग अभी तक अन्वेषण नहीं किए गए हैं।
LASS फ्रेमवर्क की वर्तमान सीमाओं को हल करने के लिए, डेवलपर्स ने ऑडियोसेप की शुरुआत की है, जो एक फाउंडेशनल मॉडल है जो प्राकृतिक भाषा विवरणों का उपयोग करके ध्वनि को ऑडियो मिश्रण से अलग करने का लक्ष्य रखता है। ऑडियोसेप के लिए वर्तमान फोकस एक पूर्व-प्रशिक्षित ध्वनि पृथक्करण मॉडल विकसित करना है जो मौजूदा बड़े पैमाने पर मल्टीमॉडल डेटासेट का लाभ उठाकर LASS मॉडल को खुले डोमेन में सामान्यीकृत करने में सक्षम बनाता है। सारांश में, ऑडियोसेप मॉडल है: ” खुले डोमेन में सार्वभौमिक ध्वनि पृथक्करण के लिए एक फाउंडेशनल मॉडल जो प्राकृतिक भाषा क्वेरी या विवरणों का उपयोग करता है और बड़े पैमाने पर ऑडियो और मल्टीमॉडल डेटासेट पर प्रशिक्षित किया जाता है “।
ऑडियोसेप: कुंजी घटक और वास्तुकला
ऑडियोसेप फ्रेमवर्क की वास्तुकला में दो मुख्य घटक होते हैं: एक टेक्स्ट एनकोडर और एक पृथक्करण मॉडल।
टेक्स्ट एनकोडर
ऑडियोसेप फ्रेमवर्क एक प्राकृतिक भाषा क्वेरी में टेक्स्ट एम्बेडिंग निकालने के लिए CLIP या कंट्रास्टिव लैंग्वेज इमेज प्री-ट्रेनिंग मॉडल या CLAP या कंट्रास्टिव लैंग्वेज ऑडियो प्री-ट्रेनिंग मॉडल के टेक्स्ट एनकोडर का उपयोग करता है। इनपुट टेक्स्ट क्वेरी में ” एन ” टोकन की एक श्रृंखला होती है जिसे टेक्स्ट एनकोडर द्वारा संसाधित किया जाता है ताकि दिए गए इनपुट भाषा क्वेरी के लिए टेक्स्ट एम्बेडिंग निकाली जा सके। टेक्स्ट एनकोडर ट्रांसफॉर्मर ब्लॉक के एक स्टैक का उपयोग करके इनपुट टेक्स्ट टोकन को एनकोड करता है, और आउटपुट प्रतिनिधित्व ट्रांसफॉर्मर परतों से गुजरने के बाद एकत्र किए जाते हैं जो एक निश्चित लंबाई के साथ एक डी-आयामी वेक्टर प्रतिनिधित्व के विकास को परिणामित करता है, जहां डी CLAP या CLIP मॉडल के आयामों को संदर्भित करता है और टेक्स्ट एनकोडर प्रशिक्षण अवधि के दौरान जमे हुए होते हैं।
CLIP मॉडल को एक बड़े पैमाने पर इमेज-टेक्स्ट जोड़े गए डेटा पर कंट्रास्टिव लर्निंग का उपयोग करके पूर्व-प्रशिक्षित किया जाता है, जो मुख्य कारण है कि इसका टेक्स्ट एनकोडर पाठ्य सामग्री को सेमेंटिक स्पेस पर मैप करता है जो दृश्य प्रतिनिधित्वों द्वारा साझा की जाती है। ऑडियोसेप द्वारा CLIP के टेक्स्ट एनकोडर का उपयोग करने से मिलने वाला लाभ यह है कि यह अब दृश्य एम्बेडिंग के विकल्प के रूप में उपयोग करके बिना लेबल वाले ऑडियो-विज़ुअल डेटा से LASS मॉडल को प्रशिक्षित करने में सक्षम है।
CLAP मॉडल CLIP मॉडल के समान काम करता है और कंट्रास्टिव लर्निंग उद्देश्य का उपयोग करता है क्योंकि यह एक पाठ और एक ऑडियो एनकोडर का उपयोग करके ऑडियो और भाषा को जोड़ता है, जो पाठ और ऑडियो विवरणों को एक ऑडियो-पाठ लेटेंट स्पेस पर एक साथ लाता है।
पृथक्करण मॉडल
ऑडियोसेप फ्रेमवर्क एक आवृत्ति-डोमेन ResUNet मॉडल का उपयोग करता है जो फ्रेमवर्क के लिए पृथक्करण बैकबोन के रूप में एक ऑडियो क्लिप के मिश्रण को खिलाता है। फ्रेमवर्क तब वेवफॉर्म से जटिल स्पेक्ट्रोग्राम निकालने के लिए एक STFT या शॉर्ट-टाइम फूरियर ट्रांसफॉर्म लागू करता है, स्पेक्ट्रोग्राम की परिमाण, और एक्स का चरण। मॉडल तब एक एनकोडर-डिकोडर नेटवर्क का निर्माण करता है ताकि परिमाण स्पेक्ट्रोग्राम को संसाधित किया जा सके।
ResUNet एनकोडर-डिकोडर नेटवर्क में 6 अवशेष ब्लॉक, 6 डिकोडर ब्लॉक और 4 बोतलनेक ब्लॉक होते हैं। प्रत्येक एनकोडर ब्लॉक में 4 अवशेष परंपरागत ब्लॉक होते हैं जो एक बोतलनेक सुविधा में खुद को नीचे की ओर नमूना लेते हैं, जबकि डिकोडर ब्लॉक 4 अवशेष डीकॉन्वोल्यूशनल ब्लॉक का उपयोग करके सुविधाओं को अपसैम्पल करके पृथक्करण घटकों को प्राप्त करते हैं। इसके बाद, प्रत्येक एनकोडर ब्लॉक और इसके संबंधित डिकोडर ब्लॉक एक स्किप कनेक्शन स्थापित करते हैं जो एक ही अपसैम्पलिंग या डाउनसैम्पलिंग दर पर काम करता है। फ्रेमवर्क का अवशेष ब्लॉक 2 लीकी-रीलू एक्टिवेशन परतें, 2 बैच सामान्यीकरण परतें और 2 सीएनएन परतें होती हैं, और इसके अलावा, फ्रेमवर्क में प्रत्येक अवशेष ब्लॉक के इनपुट और आउटपुट को जोड़ने वाला एक अतिरिक्त अवशेष शॉर्टकट भी पेश करता है। ResUNet मॉडल जटिल स्पेक्ट्रोग्राम एक्स को इनपुट के रूप में लेता है और टेक्स्ट एम्बेडिंग पर सशर्त चरण अवशेष के साथ परिमाण मास्क एम को आउटपुट के रूप में उत्पन्न करता है, जो स्पेक्ट्रोग्राम की परिमाण को स्केल करने और कोण को घुमाने की दिशा को नियंत्रित करता है। अलग किए गए जटिल स्पेक्ट्रोग्राम को तब अनुमानित परिमाण मास्क और चरण अवशेष को एसटीएफटी (शॉर्ट-टाइम फूरियर ट्रांसफॉर्म) के साथ गुणा करके निकाला जा सकता है।

अपने फ्रेमवर्क में, ऑडियोसेप पृथक्करण मॉडल और टेक्स्ट एनकोडर को जोड़ने के लिए ResUNet में कन्वोल्यूशनल ब्लॉक की तैनाती के बाद एक FiLm या फीचर-वाइज लीनियरली मॉड्यूलेटेड लेयर का उपयोग करता है।
प्रशिक्षण और नुकसान
ऑडियोसेप मॉडल के प्रशिक्षण के दौरान, डेवलपर्स लाउडनेस ऑगमेंटेशन विधि का उपयोग करते हैं और एक L1 नुकसान कार्य का उपयोग करके शोर-शोर तरंगों के बीच अंत-से-अंत प्रशिक्षण द्वारा फ्रेमवर्क को प्रशिक्षित करते हैं।
डेटासेट और बेंचमार्क
जैसा कि पिछले खंडों में उल्लेख किया गया है, ऑडियोसेप एक फाउंडेशनल मॉडल है जो LASS मॉडल की वर्तमान निर्भरता को हल करने का लक्ष्य रखता है जो लेबल वाले ऑडियो-टेक्स्ट जोड़े गए डेटा पर निर्भर करता है। ऑडियोसेप मॉडल को मल्टीमॉडल लर्निंग क्षमताओं से लैस करने के लिए विभिन्न डेटासेट पर प्रशिक्षित किया जाता है, और यहाँ डेटासेट और बेंचमार्क का एक विस्तृत विवरण है जिसका उपयोग डेवलपर्स द्वारा ऑडियोसेप फ्रेमवर्क को प्रशिक्षित करने के लिए किया जाता है।
ऑडियोसेट
ऑडियोसेट एक कमजोर रूप से लेबल वाला बड़े पैमाने पर ऑडियो डेटासेट है जिसमें 2 मिलियन से अधिक 10-सेकंड के ऑडियो स्निपेट शामिल हैं जो सीधे YouTube से निकाले जाते हैं। ऑडियोसेट डेटासेट में प्रत्येक ऑडियो स्निपेट को ध्वनि वर्गों की अनुपस्थिति या उपस्थिति द्वारा वर्गीकृत किया जाता है बिना ध्वनि घटनाओं के विशिष्ट समय विवरण के। ऑडियोसेट डेटासेट में 500 से अधिक विभिन्न ऑडियो वर्ग हैं, जिनमें प्राकृतिक ध्वनियाँ, मानव ध्वनियाँ, वाहन ध्वनियाँ और बहुत कुछ शामिल हैं।
VGGSound
VGGSound डेटासेट एक बड़े पैमाने पर दृश्य-ऑडियो डेटासेट है जो ऑडियोसेट की तरह YouTube से सीधे सोर्स किया जाता है, और इसमें 2,00,000 से अधिक वीडियो क्लिप होती हैं, प्रत्येक 10 सेकंड की लंबाई की होती हैं। VGGSound डेटासेट को 300 से अधिक ध्वनि वर्गों में वर्गीकृत किया जाता है, जिनमें मानव ध्वनियाँ, प्राकृतिक ध्वनियाँ, पक्षी ध्वनियाँ और बहुत कुछ शामिल हैं। VGGSound डेटासेट का उपयोग यह सुनिश्चित करने के लिए किया जाता है कि लक्ष्य ध्वनि को उत्पन्न करने वाला वस्तु भी संबंधित दृश्य क्लिप में वर्णन योग्य है।
ऑडियोकैप्स
ऑडियोकैप्स सार्वजनिक रूप से उपलब्ध सबसे बड़ा ऑडियो कैप्शनिंग डेटासेट है, और इसमें ऑडियोसेट डेटासेट से निकाले गए 50,000 से अधिक 10-सेकंड के ऑडियो क्लिप शामिल हैं। ऑडियोकैप्स डेटा को तीन श्रेणियों में विभाजित किया जाता है: प्रशिक्षण डेटा, परीक्षण डेटा और सत्यापन डेटा, और ऑडियो क्लिप को अमेज़न मैकेनिकल टर्क प्लेटफ़ॉर्म का उपयोग करके प्राकृतिक भाषा विवरणों के साथ मानव द्वारा एनोटेट किया जाता है। यह ध्यान देने योग्य है कि प्रशिक्षण डेटासेट में प्रत्येक ऑडियो क्लिप में एक एकल कैप्शन है, जबकि परीक्षण और सत्यापन डेटासेट में प्रत्येक क्लिप में 5 मूल कैप्शन होते हैं।
क्लोथोवी2
क्लोथोवी2 एक ऑडियो कैप्शनिंग डेटासेट है जिसमें फ्रीसाउंड प्लेटफ़ॉर्म से सोर्स किए गए क्लिप शामिल हैं, और ऑडियोकैप्स की तरह, प्रत्येक ऑडियो क्लिप को अमेज़न मैकेनिकल टर्क प्लेटफ़ॉर्म का उपयोग करके प्राकृतिक भाषा विवरणों के साथ मानव द्वारा एनोटेट किया जाता है।
वेवकैप्स
वेवकैप्स ऑडियोसेट की तरह एक कमजोर रूप से लेबल वाला बड़े पैमाने पर ऑडियो डेटासेट है जिसमें 400,000 से अधिक ऑडियो क्लिप शामिल हैं जिनमें कैप्शन होते हैं, और कुल रनटाइम लगभग 7568 घंटे के प्रशिक्षण डेटा के बराबर होता है। वेवकैप्स डेटासेट में ऑडियो क्लिप विभिन्न ऑडियो स्रोतों से सोर्स किए जाते हैं, जिनमें बीबीसी साउंड इफेक्ट्स, ऑडियोसेट, फ्रीसाउंड, साउंडबाइबिल और बहुत कुछ शामिल हैं।

प्रशिक्षण विवरण
प्रशिक्षण चरण के दौरान, ऑडियोसेप मॉडल प्रशिक्षण डेटासेट से दो अलग-अलग ऑडियो क्लिप से दो ऑडियो खंडों को यादृच्छिक रूप से नमूना लेता है, और फिर उन्हें एक प्रशिक्षण मिश्रण बनाने के लिए मिलाता है जहां प्रत्येक ऑडियो खंड की लंबाई लगभग 5 सेकंड होती है। मॉडल तब वेवफॉर्म से जटिल स्पेक्ट्रोग्राम निकालने के लिए एक हान विंडो के आकार 1024 के साथ 320 हॉप आकार का उपयोग करके वेवफॉर्म सिग्नल से जटिल स्पेक्ट्रोग्राम निकालता है।
मॉडल तब CLIP/CLAP मॉडल के टेक्स्ट एनकोडर का उपयोग करके टेक्स्ट पर्यवेक्षण के साथ टेक्स्ट एम्बेडिंग निकालता है, जो ऑडियोसेप के लिए डिफ़ॉल्ट कॉन्फ़िगरेशन है। पृथक्करण मॉडल के लिए, ऑडियोसेप फ्रेमवर्क एक ResUNet परत का उपयोग करता है जिसमें 30 परतें, 6 एनकोडर ब्लॉक और 6 डिकोडर ब्लॉक होते हैं जो सार्वभौमिक ध्वनि पृथक्करण फ्रेमवर्क में अनुसरण की गई वास्तुकला के समान होते हैं। इसके अलावा, प्रत्येक एनकोडर ब्लॉक में दो संवोल्यूशनल परतें होती हैं जिनका कर्नल आकार 3×3 होता है, और एनकोडर ब्लॉक के आउटपुट फीचर मैप की संख्या क्रमशः 32, 64, 128, 256, 512 और 1024 होती है। डिकोडर ब्लॉक एनकोडर ब्लॉक के साथ सममिति साझा करते हैं, और डेवलपर्स ऑडियोसेप मॉडल को प्रशिक्षित करने के लिए एडम ऑप्टिमाइज़र को लागू करते हैं जिसमें 96 का बैच आकार होता है।
मूल्यांकन परिणाम
देखे गए डेटासेट पर
निम्नलिखित आंकड़ा ऑडियोसेप फ्रेमवर्क के प्रदर्शन की तुलना देखे गए डेटासेट पर प्रशिक्षण चरण के दौरान करता है, जिसमें प्रशिक्षण डेटासेट शामिल हैं। नीचे दिया गया आंकड़ा ऑडियोसेप फ्रेमवर्क के मूल्यांकन परिणामों को बेंचमार्क प्रणालियों के खिलाफ तुलना करता है, जिनमें भाषण सुधार मॉडल, LASS और CLIP शामिल हैं। CLIP टेक्स्ट एनकोडर के साथ ऑडियोसेप मॉडल को ऑडियोसेप-CLIP के रूप में दर्शाया गया है, जबकि CLAP टेक्स्ट एनकोडर के साथ ऑडियोसेप मॉडल को ऑडियोसेप-CLAP के रूप में दर्शाया गया है।

जैसा कि आंकड़े में देखा जा सकता है, ऑडियोसेप फ्रेमवर्क ऑडियो कैप्शन या टेक्स्ट लेबल का उपयोग करके इनपुट क्वेरी के रूप में अच्छा प्रदर्शन करता है, और परिणाम पिछले बेंचमार्क LASS और ऑडियो-क्वेरीड साउंड सेपरेशन मॉडल की तुलना में ऑडियोसेप फ्रेमवर्क के श्रेष्ठ प्रदर्शन को दर्शाते हैं।
अनदेखे डेटासेट पर
ऑडियोसेप के प्रदर्शन का मूल्यांकन करने के लिए एक शून्य-शॉट सेटिंग में, डेवलपर्स ने अनदेखे डेटासेट पर मूल्यांकन जारी रखा, और ऑडियोसेप फ्रेमवर्क शून्य-शॉट सेटिंग में प्रभावशाली पृथक्करण प्रदर्शन प्रदान करता है, और परिणाम नीचे दिए गए आंकड़े में दिखाए गए हैं।

इसके अलावा, नीचे दी गई छवि वॉइसबैंक-डिमांड स्पीच एन्हांसमेंट के खिलाफ ऑडियोसेप मॉडल के मूल्यांकन के परिणामों को दर्शाती है।

ऑडियोसेप फ्रेमवर्क के मूल्यांकन से पता चलता है कि अनदेखे डेटासेट पर शून्य-शॉट सेटिंग में मजबूत और वांछित प्रदर्शन होता है, जो नए डेटा वितरण पर ध्वनि संचालन कार्यों को करने के लिए मार्ग प्रशस्त करता है।
पृथक्करण परिणामों का दृश्यीकरण
नीचे दिया गया आंकड़ा ऑडियोसेप-CLAP फ्रेमवर्क का उपयोग करके विभिन्न ऑडियो या ध्वनियों के लिए टेक्स्ट क्वेरी का उपयोग करके ग्राउंड-ट्रुथ लक्ष्य ऑडियो स्रोत, ऑडियो मिश्रण और पृथक्करण ऑडियो स्रोतों के स्पेक्ट्रोग्राम के दृश्यीकरण के परिणामों को दर्शाता है। परिणामों से पता चलता है कि पृथक्करण स्रोत का स्पेक्ट्रोग्राम पैटर्न मूल स्रोत के करीब है, जो प्रयोगों के दौरान प्राप्त वस्तुनिष्ठ परिणामों का समर्थन करता है।

टेक्स्ट क्वेरी की तुलना
डेवलपर्स ने ऑडियोकैप्स मिनी पर ऑडियोसेप-CLAP और ऑडियोसेप-CLIP के प्रदर्शन का मूल्यांकन किया है, और डेवलपर्स ने विभिन्न क्वेरी के प्रभावों की जांच के लिए ऑडियोसेट इवेंट लेबल, ऑडियोकैप्स कैप्शन और पुनः एनोटेटेड प्राकृतिक भाषा विवरण का उपयोग किया है। नीचे दिया गया आंकड़ा ऑडियोकैप्स मिनी के एक उदाहरण को दर्शाता है।

निष्कर्ष
ऑडियोसेप एक फाउंडेशनल मॉडल है जो खुले डोमेन में सार्वभौमिक ध्वनि पृथक्करण के लिए विकसित किया गया है जो ध्वनि पृथक्करण के लिए प्राकृतिक भाषा विवरणों का उपयोग करता है। मूल्यांकन के दौरान देखा गया है, ऑडियोसेप फ्रेमवर्क शून्य-शॉट और अनपर्यवेक्षित लर्निंग को सुगम रूप से करने में सक्षम है जो ऑडियो कैप्शन या टेक्स्ट लेबल का उपयोग करके क्वेरी के रूप में करता है। ऑडियोसेप के परिणाम और मूल्यांकन प्रदर्शन एक मजबूत प्रदर्शन को दर्शाते हैं जो वर्तमान राज्य के साथ-साथ ध्वनि पृथक्करण फ्रेमवर्क जैसे LASS को पार करता है, और यह लोकप्रिय ध्वनि पृथक्करण फ्रेमवर्क की वर्तमान सीमाओं को हल करने में सक्षम हो सकता है।












