एआई मॉडल और प्लेटफ़ॉर्म

एआई हेडफ़ोन आपको भीड़ में एक व्यक्ति की बात सुनने की अनुमति देते हैं

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

एक भीड़भाड़ वाले, शोरगुल वाले वातावरण में, क्या आपने कभी यह इच्छा की है कि आप सभी पृष्ठभूमि की बातचीत को बाहर निकाल सकें और केवल उस व्यक्ति पर ध्यान केंद्रित कर सकें जिसे आप सुनने की कोशिश कर रहे हैं? जबकि शोर-रद्द करने वाले हेडफ़ोन एक श्रवण शून्य स्थान बनाने में महान प्रगति कर चुके हैं, वे अभी भी विशिष्ट ध्वनियों को पहनने वाले के आसपास के वातावरण से फिल्टर करने में संघर्ष करते हैं। लेकिन अगर आपके हेडफ़ोन एक व्यक्ति की आवाज़ को उठाने और बढ़ाने के लिए प्रशिक्षित किए जा सकते हैं, भले ही आप एक कमरे में अन्य बातचीत के साथ घूम रहे हों?

टार्गेट स्पीच हियरिंग (टीएसएच), वाशिंगटन विश्वविद्यालय के शोधकर्ताओं द्वारा विकसित एक नए युग की एआई प्रणाली, इस क्षेत्र में प्रगति कर रही है।

टार्गेट स्पीच हियरिंग कैसे काम करता है

टीएसएच का उपयोग करने के लिए, एक व्यक्ति को विशेष रूप से सुसज्जित हेडफ़ोन पहनने होते हैं और केवल उन्हें देखने की जरूरत होती है जिसे वे सुनना चाहते हैं कुछ सेकंड के लिए। यह संक्षिप्त “नामांकन” अवधि एआई प्रणाली को लक्ष्य वक्ता के विशिष्ट वोकल पैटर्न पर सीखने और कब्जा करने की अनुमति देती है।

यहाँ यह कैसे काम करता है:

  1. उपयोगकर्ता एक बटन दबाता है जबकि वे वांछित वक्ता की ओर अपना सिर मोड़ते हैं 3-5 सेकंड के लिए।
  2. हेडसेट के दोनों ओर माइक्रोफोन एक ही समय में वक्ता की आवाज़ की ध्वनि तरंगें उठाते हैं (16-डिग्री मार्जिन ऑफ एरर के साथ)।
  3. हेडफ़ोन इस ऑडियो सिग्नल को एक एम्बेडेड कंप्यूटर पर प्रसारित करते हैं।
  4. मशीन लर्निंग सॉफ्टवेयर आवाज़ का विश्लेषण करता है और वक्ता के विशिष्ट वोकल विशेषताओं का एक मॉडल बनाता है।
  5. एआई प्रणाली इस मॉडल का उपयोग करती है ताकि वह वास्तविक समय में नामांकित वक्ता की आवाज़ को अलग कर सके और बढ़ा सके, भले ही उपयोगकर्ता एक शोरगुल वाले वातावरण में घूम रहा हो।

जितना अधिक समय तक लक्ष्य वक्ता बोलता है, उतना ही अधिक प्रशिक्षण डेटा प्रणाली प्राप्त करती है, जिससे यह वांछित आवाज़ पर ध्यान केंद्रित करने और स्पष्टता में सुधार करने में सक्षम होती है। यह “चयनात्मक सुनवाई” के लिए एक अभिनव दृष्टिकोण है, जो चुनौतीपूर्ण श्रवण वातावरण में संचार और सुलभता में सुधार के लिए एक नए युग की संभावनाओं को खोलता है।

श्याम गोल्लाकोटा इस पत्र के वरिष्ठ लेखक हैं और पॉल जी एलन स्कूल ऑफ कंप्यूटर साइंस एंड इंजीनियरिंग में यूडब्ल्यू प्रोफेसर हैं

“हम अब एआई को वेब-आधारित चैटबॉट के रूप में सोचते हैं जो प्रश्नों का उत्तर देते हैं। लेकिन इस परियोजना में, हम एआई को विकसित करते हैं ताकि वह हेडफ़ोन पहनने वाले की श्रवण धारणा को उनकी पसंद के अनुसार संशोधित कर सके। हमारे उपकरणों के साथ आप अब एक शोरगुल वाले वातावरण में अन्य लोगों की बातचीत के बीच एक व्यक्ति की आवाज़ सुन सकते हैं।” – गोल्लाकोटा

टीएसएच के साथ एआई हेडफ़ोन का परीक्षण

टार्गेट स्पीच हियरिंग को अपनी क्षमता का परीक्षण करने के लिए, शोध दल ने 21 प्रतिभागियों के साथ एक अध्ययन किया। प्रत्येक विषय ने टीएसएच-सक्षम हेडफ़ोन पहने और एक शोरगुल वाले वातावरण में एक लक्ष्य वक्ता को नामांकित किया। परिणाम प्रभावशाली थे – औसतन, उपयोगकर्ताओं ने नामांकित वक्ता की आवाज़ की स्पष्टता को लगभग दोगुना उच्च दर्जा दिया जितना कि अनफिल्टर्ड ऑडियो फीड के लिए।

यह सफलता टीम के पिछले काम पर आधारित है “सेमेंटिक सुनवाई” पर, जिसने उपयोगकर्ताओं को उनके श्रवण वातावरण को पूर्वनिर्धारित ध्वनि वर्गीकरण के आधार पर फिल्टर करने की अनुमति दी थी, जैसे कि पक्षियों की चहचहाहट या मानव आवाजें। टीएसएच इस अवधारणा को एक कदम आगे ले जाता है और एक विशिष्ट व्यक्ति की आवाज़ को चुनिंदा रूप से बढ़ाने की अनुमति देता है।

निहितार्थ महत्वपूर्ण हैं, जो ऊंचे सेटिंग्स में व्यक्तिगत बातचीत को बढ़ाने से लेकर श्रवण अक्षमता वाले लोगों के लिए सुलभता में सुधार करने तक हैं। जैसे-जैसे प्रौद्योगिकी विकसित होती है, यह हमारे श्रवण जगत के साथ हमारे अनुभव और बातचीत को मूल रूप से बदल सकती है।

एआई हेडफ़ोन में सुधार और सीमाओं को दूर करना

जबकि टार्गेट स्पीच हियरिंग श्रवण एआई में एक बड़ा कदम है, प्रणाली में अभी भी कुछ सीमाएं हैं:

  • एकल वक्ता नामांकन: वर्तमान में, टीएसएच को केवल एक वक्ता पर प्रशिक्षित किया जा सकता है। एक ही समय में कई वक्ताओं को नामांकित करना अभी तक संभव नहीं है।
  • समान ऑडियो स्रोतों से हस्तक्षेप: यदि नामांकन प्रक्रिया के दौरान लक्ष्य वक्ता की दिशा से एक अन्य जोरदार आवाज़ आ रही है, तो प्रणाली वांछित व्यक्ति के वोकल पैटर्न को अलग करने में संघर्ष कर सकती है।
  • मैनुअल पुनः-नामांकन: यदि उपयोगकर्ता प्रारंभिक प्रशिक्षण के बाद ऑडियो गुणवत्ता से संतुष्ट नहीं है, तो उन्हें स्पष्टता में सुधार के लिए लक्ष्य वक्ता को मैनुअल रूप से पुनः नामांकित करना होगा।

इन प्रतिबंधों के बावजूद, वाशिंगटन विश्वविद्यालय की टीम टीएसएच की क्षमताओं को परिष्कृत और विस्तारित करने पर सक्रिय रूप से काम कर रही है। उनके प्राथमिक लक्ष्यों में से एक यह प्रौद्योगिकी को छोटा करना है ताकि इसे उपभोक्ता उत्पादों जैसे कान की बूंदों और श्रवण यंत्रों में निर्बाध रूप से एकीकृत किया जा सके।

जैसे ही शोधकर्ता श्रवण एआई की संभावनाओं की सीमाओं को आगे बढ़ाते हैं, संभावित अनुप्रयोग व्यापक हैं, जो व्यस्त कार्यालय वातावरण में उत्पादकता में सुधार से लेकर उच्च जोखिम वाली स्थितियों में प्रथम प्रतिक्रियाकर्ताओं और सैन्य कर्मियों के लिए स्पष्ट संचार की सुविधा प्रदान करने तक हैं। चयनात्मक सुनवाई का भविष्य उज्ज्वल दिख रहा है, और टार्गेट स्पीच हियरिंग इसके आकार में एक महत्वपूर्ण भूमिका निभाने के लिए तैयार है।

एलेक्स मैकफारलैंड एक एआई पत्रकार और लेखक हैं जो कृत्रिम बुद्धिमत्ता में नवीनतम विकासों का अन्वेषण कर रहे हैं। उन्होंने विश्वभर के कई एआई स्टार्टअप्स और प्रकाशनों के साथ सहयोग किया है।