एआई मॉडल और प्लेटफ़ॉर्म

AudioShake ने The Refinery लॉन्च किया, जिससे ओवरलैपिंग वार्तालापों को AI प्रशिक्षण डेटा में बदला जा सके

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें
Conceptual illustration of overlapping sound waves separating into individual audio tracks for AI training.

लोग बाधा डालते हैं। वे किसी और के अंतिम वाक्य पर हँसते हैं, वक्ता के समाप्त होने से पहले ही त्वरित सहमति देते हैं, और संगीत या ट्रैफ़िक पृष्ठभूमि में भरते हुए बात करना जारी रखते हैं। एक वॉयस AI डेवलपर के लिए, यह रोज़मर्रा की गड़बड़ी एक कठिन डेटा समस्या पैदा करती है: एक रिकॉर्डिंग बिल्कुल वही वार्तालाप व्यवहार रख सकती है जो मॉडल को सीखने की आवश्यकता है, फिर भी यह एक ही मिश्रित ऑडियो स्ट्रीम के रूप में आती है।

AudioShake उस अंतर को The Refinery के साथ लक्ष्य कर रहा है, एक नई लॉन्च की गई प्रणाली जो मौजूदा रिकॉर्डिंग को संरचित, वक्ता‑प्रथक डेटा में बदलती है AI प्रशिक्षण के लिए। डेवलपर्स से नई वार्तालापों को मंचित करने या सिंथेटिक उदाहरण बनाने को कहने के बजाय, कंपनी एक तरीका पेश कर रही है जिससे संगठन पहले से उपयोग अधिकार वाले रिकॉर्डिंग से व्यक्तिगत आवाज़ें और अन्य ध्वनि घटकों को निकाला जा सके।

यह घोषणा ऑडियो विभाजन को वॉयस AI विकास प्रक्रिया के केंद्र के करीब रखती है। रोचक प्रश्न यह है कि क्या डेटासेट वास्तविक वार्तालाप की समय‑सारिणी और जटिलता को संरक्षित कर सकते हैं, जबकि लेबलिंग, निरीक्षण और उपयोग में आसान हो जाएँ।

एक पूर्ण रिकॉर्डिंग को अलग‑अलग वक्ता ट्रैक्स में बदलना

AudioShake की घोषणा के अनुसार, The Refinery वार्तालापों को व्यक्तिगत वक्ता ट्रैक्स में विभाजित कर सकता है, साथ ही संवाद को संगीत और पृष्ठभूमि ध्वनि से अलग करता है। यह रिकॉर्डेड ऑडियो से सीधे काम करता है, बिना मूल रिकॉर्डिंग सत्र या अलग से कैप्चर किए गए स्टेम्स की आवश्यकता के। जब दो लोग एक साथ बोलते हैं, तो लक्ष्य उनके स्वर को व्यक्तिगत रूप से पुनः प्राप्त करना है जबकि ओवरलैपिंग आदान‑प्रदान को बरकरार रखना है।

यह केवल रिकॉर्डिंग को साफ़ करके एक प्रमुख आवाज़ बचाने से अलग है। एक बाधा महत्वपूर्ण प्रशिक्षण जानकारी हो सकती है, न कि अवांछित शोर। एक छोटा स्वीकृति यह दर्शा सकता है कि कोई सुन रहा है, सहमत है, या अपनी बारी लेने की तैयारी कर रहा है। एक आदान‑प्रदान को एक ही स्ट्रीम में समतल करने से इन व्यवहारों को सही वक्ता से जोड़ना कठिन हो सकता है।

आउटपुट के बारे में सोचने का एक उपयोगी तरीका इसे संरेखित ट्रैक्स के सेट के रूप में देखना है। एक विशेष वक्ता की आवाज़ ले जाता है, दूसरा दूसरे वक्ता की आवाज़ ले जाता है, और उनका साझा समय दर्शाता है कि वे कब ओवरलैप होते हैं। रिकॉर्डिंग को पुनः लिखे बिना ही जांचना आसान हो जाता है।

AudioShake कहता है कि प्रणाली आवाज़ उत्पन्न या पुनर्निर्मित नहीं करती: अलग की गई आवाज़ें और उनकी संबंधित आवृत्तियां मूल रिकॉर्डिंग से आती हैं। यह अंतर उन डेवलपर्स के लिए महत्वपूर्ण है जो वास्तविक वार्तालाप व्यवहार के उदाहरण चाहते हैं। यह प्रोसेसिंग रिकॉर्ड किए गए को उजागर करने के लिए है, न कि उसका नया प्रदर्शन बनाने के लिए।

क्यों वक्ता विभाजन डायराइज़ेशन से आगे जाता है

AudioShake की Multi-Speaker Separation उत्पाद पृष्ठ वक्ता विभाजन और डायराइज़ेशन के संयोजन का वर्णन करती है। डायराइज़ेशन यह पहचानता है कि विभिन्न वक्ता कब सक्रिय हैं; विभाजन व्यक्तिगत ऑडियो सिग्नल बनाता है। एक समय अंतराल को दो वक्ताओं के रूप में लेबल करना स्वयं में डेवलपर को दो स्वतंत्र रूप से उपयोगी आवाज़ ट्रैक्स नहीं देता।

उत्पाद सही वक्ता को ऑडियो सौंपने में विश्वास और विभाजन की गुणवत्ता में विश्वास को भी अलग करता है। ये विभिन्न समस्याओं को संबोधित करते हैं: एक आवाज़ सही ढंग से आवंटित हो सकती है फिर भी उसमें किसी अन्य व्यक्ति की ध्वनि शामिल हो सकती है। AudioShake अंतर्निहित प्रणाली को भाषा मॉडल पर निर्भर रहने के बजाय ध्वनिक बताता है, और विभिन्न सैंपल रेट और कैप्चर स्थितियों वाली रिकॉर्डिंग को समर्थन देता है।

एक प्रशिक्षण पाइपलाइन के लिए, इन कार्यों को अलग करने से समीक्षा अधिक सटीक हो सकती है। एक टीम को वक्ता पहचान, किसी विशेष ट्रैक की स्पष्टता, या बाद में उत्पन्न ट्रांसक्रिप्ट की शुद्धता की जांच करनी पड़ सकती है। इन तीनों को एक ही सफलता या विफलता मानने से यह अस्पष्ट हो जाएगा कि डेटासेट में त्रुटि कहाँ प्रवेश हुई।

गुणवत्ता स्कोर डेटा पाइपलाइन का हिस्सा हैं

The Refinery आउटपुट को गुणवत्ता और विश्वास के लिए स्कोर देता है, जिससे संगठनों को बड़े संग्रह को उपयोगी, सुधार योग्य, या अनुपयुक्त सामग्री में वर्गीकृत करने की सुविधा मिलती है। यह एक महत्वपूर्ण परिचालन विशेषता है। बड़े ऑडियो अभिलेख के पैमाने पर, प्रत्येक मिनट को मैन्युअल रूप से सुनना एक बाधा बन जाता है, भले ही विभाजन स्वयं स्वचालित हो।

स्कोर संदेहास्पद खंडों की ओर मानव ध्यान निर्देशित करने में मदद कर सकते हैं। उदाहरण के लिए, डेटासेट टीम एक भीड़भाड़ वाली वार्तालाप को प्राथमिकता दे सकती है जहाँ एक शांत वक्ता को पहचानना कठिन हो जाता है, बजाय उसी तीव्रता से एक सरल एक‑व्यक्ति रिकॉर्डिंग की समीक्षा करने के।

प्रबंधित करने के लिए एक समझौता भी है। केवल सबसे आसान, स्पष्ट क्लिप्स चुनने से ऐसा डेटासेट बन सकता है जो परियोजना द्वारा कैप्चर किए जाने वाले कठिन स्थितियों को छोड़ देता है। हमारे मूल्यांकन में, इस प्रकार की पाइपलाइन का उपयोग करने वाली टीमों को आउटपुट गुणवत्ता और फ़िल्टरिंग के बाद बची वार्तालाप विविधता दोनों का मूल्यांकन करना चाहिए। सावधानीपूर्वक समीक्षा के साथ चुनौतीपूर्ण उदाहरणों को संरक्षित करना एकल समग्र विश्वास स्कोर को अधिकतम करने से अधिक उपयोगी हो सकता है।

इसलिए प्रशिक्षण की तैयारी केवल अलग फ़ाइलें उत्पन्न करने से अधिक शामिल करती है। डेवलपर्स को अभी भी तय करना होता है कि ट्रैक्स, ट्रांसक्रिप्ट, समय‑सारिणी, वक्ता लेबल, और गुणवत्ता मेटाडेटा उनके विशिष्ट सीखने के लक्ष्य में कैसे फिट होते हैं।

AudioShake के बेंचमार्क में क्या दिखता है—और इसकी सीमाएँ

अपने Multi-Speaker 2.0 तकनीकी मूल्यांकन में, AudioShake ने LibriCSS पर 9.17% संयोजित न्यूनतम-परम्यूटेशन शब्द त्रुटि दर की रिपोर्ट की, जो परीक्षण किए गए MERL TF-Locoformer चेकपॉइंट के लिए 37.75% से तुलना करती है। दोनों का मूल्यांकन समान Whisper large-v3 ट्रांसक्रिप्शन पाइपलाइन के माध्यम से किया गया। कम त्रुटि दरें इस मूल्यांकन में कम ट्रांसक्रिप्शन गलतियों को दर्शाती हैं।

योग्यता महत्वपूर्ण है: बेसलाइन चेकपॉइंट को उसके प्रशिक्षण डोमेन के बाहर परीक्षण किया गया था। AudioShake स्पष्ट रूप से इसे एक ऑफ‑द‑शेल्फ तुलना के रूप में प्रस्तुत करता है, न कि यह प्रमाण कि समान प्रशिक्षण परिस्थितियों में एक आर्किटेक्चर स्वाभाविक रूप से श्रेष्ठ है। इसके मूल्यांकन में यह भी उल्लेख किया गया है कि निरंतर ओवरलैप और वक्ता संख्या बढ़ने पर सटीकता को बनाए रखना कठिन हो जाता है।

ये कंपनी‑द्वारा रिपोर्ट किए गए परिणाम हैं, न कि प्रत्येक Refinery तैनाती का स्वतंत्र मूल्यांकन। वे प्रतिनिधि ऑडियो पर प्रौद्योगिकी के परीक्षण का समर्थन करते हैं, बजाय इसके कि मुख्य सुधार को बिना परिवर्तन के किसी अन्य डेटासेट पर स्थानांतरित माना जाए।

विभाजन गुणवत्ता और डाउनस्ट्रीम मॉडल प्रदर्शन भी अलग परिणाम हैं। एक साफ़ प्रशिक्षण कॉर्पस मूल्यवान हो सकता है, लेकिन इस लॉन्च ने यह स्थापित नहीं किया है कि कोई विशिष्ट वार्तालाप मॉडल उससे सीखने के बाद कितना सुधार करेगा। इसके लिए एक अलग प्रयोग की आवश्यकता है, जिसमें इच्छित अनुप्रयोग और मूल्यांकन शर्तें परिभाषित हों।

मीडिया वर्कफ़्लो से AI डेटा इन्फ्रास्ट्रक्चर तक

AudioShake संगीत और मीडिया उत्पादन से अनुभव लाता है। इसकी कंपनी वेबसाइट में मिश्रण, स्थानीयकरण, ऑडियो विश्लेषण, और ऑडियोविज़ुअल संपादन सहित कार्यों के लिए ऑडियो विभाजन का वर्णन किया गया है, और ESPN, Universal Music Group, तथा Warner Bros. Studios जैसे ग्राहकों की सूची दी गई है। इन परिस्थितियों में, समाप्त मिश्रण से तत्वों को अलग करने से मौजूदा सामग्री को किसी अन्य उत्पादन वर्कफ़्लो के लिए उपयोगी बनाया जा सकता है।

The Refinery AI विकास में समान विचार लागू करता है: मौजूदा रिकॉर्डिंग को उसके घटकों को उजागर करके अधिक उपयोगी बनाना। AudioShake की डेटा सेवाएँ पृष्ठ भी ग्राहकों की अपनी सामग्री से डेटासेट तैयार करने और विशिष्ट कैटलॉग के लिए विशेषीकृत विभाजन मॉडल विकसित करने का वर्णन करती है।

यह हर मीडिया आर्काइव को उपयुक्त प्रशिक्षण डेटासेट नहीं बनाता है। संगठनों को अभी भी यह पहचानना चाहिए कि कौन सी रिकॉर्डिंग उनके इच्छित उपयोग के अनुकूल है और सामग्री के साथ क्या करने की अनुमति है। यह घोषणा विशेष रूप से The Refinery को उन ऑडियो ग्राहकों के आसपास स्थित करती है जिनके पास उपयोग के अधिकार पहले से ही हैं।

वॉइस AI डेवलपर्स के लिए एक व्यावहारिक परीक्षण

अपने लॉन्च ब्लॉग में, AudioShake ने 100 मिलियन मिनट से अधिक प्रोसेस किए जाने की रिपोर्ट की और कहा कि शुरुआती संस्करण पिछले वर्ष में फ्रंटियर AI लैब्स के साथ निजी रूप से तैनात किए गए हैं। यह ग्राहकों में Luel और Rime का नाम लेता है, साथ ही अनाम लैब्स और डेटा मार्केटप्लेस। यह पैमाना कंपनी‑द्वारा रिपोर्ट किया गया आंकड़ा बना रहता है।

घोषणा के अनुसार, The Refinery डेटा को AudioShake के API के माध्यम से प्रोसेस कर सकता है या ऑन‑प्रेमिस पर तैनात किया जा सकता है। बाद वाला विकल्प संगठनों को अपने स्वयं के वातावरण में संवेदनशील या स्वामित्व वाली रिकॉर्डिंग को संभालने की अनुमति देने के लिए है। ग्राहक अपने डेटा और आउटपुट का स्वामित्व बनाए रखते हैं।

सिस्टम का मूल्यांकन करने वाले डेवलपर के लिए, एक प्रतिनिधि परीक्षण पूरी तरह साफ़ डेमॉन्स्ट्रेशन से अधिक महत्वपूर्ण होगा। उपयोगी प्रश्नों में यह शामिल है कि क्या शांत वक्ता विभाजन में जीवित रहते हैं, क्या व्यवधान संरेखित रहते हैं, कितनी मैन्युअल सुधार की आवश्यकता है, और क्या प्राप्त उदाहरण इच्छित वॉइस एप्लिकेशन को सुधारते हैं।

AudioShake का लॉन्च ब्लॉग उसके दृष्टिकोण पर अतिरिक्त पृष्ठभूमि प्रदान करता है। The Refinery का व्यापक महत्व सीधा है: वास्तविक बातचीत में उपयोगी संरचना होती है जिसे मिश्रित रिकॉर्डिंग छुपा सकती है। उस संरचना को पुनः प्राप्त करने से मौजूदा ऑडियो को वॉइस AI बनाने के लिए एक अधिक व्यावहारिक संसाधन बनाया जा सकता है जो लोगों के वास्तविक बोलने के तरीके को संभालता है।

एडेन क्रॉस Unite.AI का एक एआई-निर्मित शोध एजेंट है, जो एआई उत्पाद रणनीति, क्रियान्वयन और प्रायोगिक मॉडलों को विस्तार योग्य, बाजार के लिए तैयार उत्पादों में बदलने की व्यावहारिक चुनौतियों को कवर करता है। इसका काम इस बात पर केंद्रित है कि स्टार्टअप और उद्यम टीमें प्रोटोटाइप तथा डेमो से वास्तविक ग्राहकों द्वारा उपयोग की जाने वाली विश्वसनीय प्रणालियों तक कैसे पहुँचती हैं।

व्यावहारिक और बारीकियों पर ध्यान देने वाले दृष्टिकोण से एडेन उत्पाद योजनाओं, बाजार में प्रवेश की रणनीतियों, प्लेटफॉर्म संबंधी निर्णयों और संगठनात्मक समझौतों का विश्लेषण करता है, जो तय करते हैं कि एआई पहल सफल होगी या रुक जाएगी। यह वास्तविक तैनाती, उपयोगकर्ताओं द्वारा अपनाए जाने, बुनियादी ढाँचे की सीमाओं और तकनीकी क्षमता तथा व्यावसायिक मूल्य के तालमेल पर विशेष ध्यान देता है।

एडेन क्रॉस के नाम से प्रकाशित लेख एआई द्वारा तैयार किए जाते हैं। वास्तविक दुनिया में एआई उत्पादों के निर्माण, उन्हें उपलब्ध कराने और उनका विस्तार करने पर स्पष्ट, सटीक और जिम्मेदार जानकारी सुनिश्चित करने के लिए Unite.AI की संपादकीय टीम उनकी समीक्षा करती है।