फंडिंग
Modulate ने वॉइस एआई के लिए इंटेलिजेंस लेयर बनाने हेतु $25 मिलियन जुटाए

Modulate ने नई फंडिंग में $25 मिलियन जुटाए हैं क्योंकि बॉस्टन स्थित कंपनी कृत्रिम बुद्धिमत्ता में बढ़ती चुनौती का लाभ उठाना चाहती है: मशीनों को यह सिखाना कि वे केवल लोगों के कहे शब्द ही नहीं, बल्कि उनके कहने के तरीके को भी समझें।
Future Ventures ने इस राउंड का नेतृत्व किया, जिसमें Hyperplane और Lakestar ने भाग लिया। इस वित्तपोषण से Modulate की कुल फंडिंग $60 मिलियन हो गई है और इसे AI अनुसंधान, इंजीनियरिंग टीमों, डेवलपर टूल्स, साझेदारियों और डिप्लॉयमेंट विकल्पों को विस्तारित करने के लिए उपयोग किया जाएगा।
यह निवेश तब आया है जब वॉइस धीरे-धीरे AI एजेंटों, ग्राहक सेवा प्लेटफ़ॉर्म, गेमिंग वातावरण और सुरक्षा प्रणालियों के लिए इंटरफ़ेस बनती जा रही है। जबकि स्पीच‑टू‑टेक्स्ट तकनीक ने उल्लेखनीय रूप से सुधार किया है, Modulate का मानना है कि केवल प्रतिलिपियों से मानव भाषण में निहित कई जानकारी छूट जाती है।
इसके बजाय इसकी तकनीक ऑडियो के मूलभूत संकेतों जैसे भावनाएँ, स्वर, इरादा, विराम, सिंथेटिक स्पीच और संवादात्मक व्यवहार का विश्लेषण करती है।
स्पीच‑टू‑टेक्स्ट से आगे बढ़ते हुए
आज के वॉइस एआई स्टैक का अधिकांश भाग एक अपेक्षाकृत सरल आर्किटेक्चर का पालन करता है: आवाज़ को टेक्स्ट में बदलना और फिर प्राप्त प्रतिलिपि को बड़े भाषा मॉडल (LLM) को भेजना।
यह तब अच्छा काम करता है जब शब्द स्वयं अधिकांश प्रासंगिक जानकारी रखते हैं। यह तब सीमित हो जाता है जब अर्थ व्यंग्य, निराशा, हिचकिचाहट, तनाव, व्यवधान या स्वर परिवर्तन पर निर्भर करता है।
Modulate ने अपने प्रमुख Velma प्लेटफ़ॉर्म को इस विचार के इर्द‑गिर्द बनाया है कि इन संकेतों का विश्लेषण सीधे ऑडियो से किया जाना चाहिए, न कि प्रतिलिपि से बाद में पुनर्निर्मित किया जाए।
कंपनी Velma को एक ऑडियो‑नेटिव संवाद इंटेलिजेंस सिस्टम के रूप में वर्णित करती है जो प्रतिलिपियां उत्पन्न करने के साथ-साथ वक्ताओं, भावनाओं, संवाद विषयों, भावना और 150 से अधिक व्यवहारों की पहचान करने में सक्षम है। डेवलपर्स प्राकृतिक भाषा विवरणों का उपयोग करके कस्टम व्यवहार भी परिभाषित कर सकते हैं।
यह तकनीक उन अनुप्रयोगों के लिए खुलती है जो एक निराश ग्राहक को कॉल बिगड़ने से पहले पहचानने से लेकर वित्तीय लेन‑देन के दौरान संदिग्ध व्यवहार का पता लगाने या यह पहचानने तक हैं कि कब AI वॉइस एजेंट अप्रत्याशित रूप से व्यवहार कर रहा है।
जून में, Modulate ने Velma को सीधे डेवलपर्स के लिए API के माध्यम से खोल दिया, जिससे पहले के एंटरप्राइज़ डिप्लॉयमेंट्स से परे पहुंच विस्तारित हुई।
Modulate ऑडियो एआई में एन्सेम्बल दृष्टिकोण अपना रहा है
Velma के नीचे की आर्किटेक्चर को Modulate Ensemble Listening Model, या ELM कहता है।
हर कार्य को करने के लिए एक विशाल मॉडल उपयोग करने के बजाय, ELM 100 से अधिक विशिष्ट मॉडलों का समन्वय करता है, जहाँ व्यक्तिगत घटक ऑडियो स्ट्रीम की विभिन्न विशेषताओं का विश्लेषण करते हैं।
ये मॉडल मूलभूत गुणों जैसे वक्ता परिवर्तन और विराम के साथ-साथ उच्च‑स्तरीय संकेतों जैसे भावनाएँ, अनुमानित इरादा, सिंथेटिक आवाज़ संकेतक, भ्रम या व्यवहार पैटर्न का भी परीक्षण कर सकते हैं। एक ऑर्केस्ट्रेशन लेयर फिर इन अवलोकनों को मिलाकर संवाद की व्यापक व्याख्या बनाती है।
यह ऑडियो पर लगातार बड़े मल्टीमॉडल फाउंडेशन मॉडल लागू करने की बढ़ती सामान्य रणनीति से स्पष्ट रूप से अलग सिद्धांत है।
Modulate तर्क देता है कि विशेषज्ञता उसकी आर्किटेक्चर को अधिक पारदर्शी आउटपुट प्रदान करने और आवश्यक गणना को कम करने की अनुमति देती है। धोखाधड़ी पहचान और अनुपालन जैसे एंटरप्राइज़ अनुप्रयोगों के लिए, यह समझना कि सिस्टम ने अलर्ट क्यों उठाया, अलर्ट जितना ही महत्वपूर्ण हो सकता है।
कंपनी के अनुसार, यह दृष्टिकोण कुछ ऑडियो‑विश्लेषण कार्यभारों के लिए एक बड़े मॉडल के उपयोग की तुलना में 1,000 गुना अधिक गणनात्मक रूप से कुशल हो सकता है।
वॉइस एआई एक नई मॉनिटरिंग समस्या उत्पन्न करता है
वित्तपोषण का समय भी एंटरप्राइज़ AI में हो रहे व्यापक बदलाव को दर्शाता है।
AI सिस्टम अब ग्राहक के साथ पूर्ण वॉइस संवाद करने में अधिक सक्षम होते जा रहे हैं। इसका अर्थ है कि कंपनियों को अब उन इंटरैक्शन की निगरानी करनी होगी जिसमें न केवल मानव कर्मचारी, बल्कि हजारों या संभावित रूप से लाखों संवादों में कार्यरत स्वायत्त एजेंट भी शामिल हैं।
एक वॉइस एजेंट तकनीकी रूप से स्क्रिप्ट का पालन कर सकता है, फिर भी बार‑बार ग्राहकों को बाधित कर सकता है, निराशा को पहचानने में विफल, इरादा समझने में गलती, या भावनात्मक स्थितियों पर खराब प्रतिक्रिया दे सकता है।
Modulate इन एजेंटों के साथ-साथ एक स्वतंत्र लिसनिंग लेयर बनने का अवसर देखता है।
इसकी वॉइस‑एजेंट तकनीक को व्यवधान, विराम, भावनाएँ, लहजे और अन्य विशेषताओं जैसे संकेतों की पहचान करने के लिए डिज़ाइन किया गया है, जिन्हें केवल टेक्स्ट से पकड़ना कठिन है, जिससे डेवलपर्स को संवाद के दौरान एजेंट के व्यवहार को समायोजित करने की सुविधा मिलती है।
वही बुनियादी ढांचा मानव संवादों पर भी लागू किया जा सकता है जहाँ संगठनों को वास्तविक समय में धोखाधड़ी, अनुपालन जोखिम, उत्पीड़न या अन्य संभावित महत्वपूर्ण घटनाओं की पहचान करनी होती है।
गेमिंग मॉडरेशन से व्यापक वॉइस इंटेलिजेंस तक
Modulate की वर्तमान महत्वाकांक्षाएँ ऑनलाइन गेमिंग पर उसके पहले के फोकस से एक महत्वपूर्ण विस्तार दर्शाती हैं।
उसके सबसे प्रसिद्ध उत्पादों में से एक, ToxMod, को गेमिंग और सामाजिक प्लेटफ़ॉर्म पर लाइव आवाज़ संचार का विश्लेषण करने और उत्पीड़न, धमकी, गूमिंग, तथा अन्य हानिकारक व्यवहार की पहचान करने के लिए विकसित किया गया था।
यह व्यवसाय का एक महत्वपूर्ण हिस्सा बना हुआ है। Modulate कहता है कि ToxMod मौजूदा आवाज़ इन्फ्रास्ट्रक्चर के साथ सीधे एकीकृत हो सकता है, जबकि संभावित समस्याग्रस्त इंटरैक्शन को मॉडरेशन सिस्टम या मानव समीक्षकों तक रूट करता है।
कंपनी ने Activision, Riot Games, Rockstar Games, और Rec Room सहित प्रमुख गेमिंग कंपनियों के साथ काम किया है।
हालाँकि मल्टीप्लेयर गेम में विषाक्तता को समझने के लिए आवश्यक मूलभूत तकनीक को उन अन्य परिवेशों में भी अनुकूलित किया जा सकता है जहाँ संदर्भ महत्वपूर्ण होता है।
Modulate अब अपनी तकनीक को धोखाधड़ी रोकथाम, संपर्क केंद्र, AI-एजेंट पर्यवेक्षण, डीपफेक पहचान, ग्राहक अनुभव, और भरोसा एवं सुरक्षा के क्षेत्रों में स्थापित कर रहा है।
इसका डेवलपर प्लेटफ़ॉर्म वर्तमान में ट्रांसक्रिप्शन, डीपफेक पहचान, ऑडियो रिडैक्शन, वार्तालाप बुद्धिमत्ता, और अन्य ऑडियो‑विश्लेषण क्षमताओं को कवर करने वाले कई मॉडल परिवार प्रदान करता है।
डीपफेक्स ऑडियो को सीधे समझने का एक और कारण जोड़ते हैं
सिंथेटिक आवाज़ उस अवसर का एक और महत्वपूर्ण हिस्सा बन रहा है।
जैसे-जैसे अधिक विश्वसनीय आवाज़ क्लोनिंग उपलब्ध हो रही है, वित्तीय लेन‑देनों या संवेदनशील जानकारी संभालने वाले संगठनों को न केवल यह निर्धारित करना होता है कि कॉल करने वाला क्या कह रहा है, बल्कि यह भी कि आवाज़ स्वयं प्रामाणिक है या नहीं।
परिणामस्वरूप Modulate ने डीपफेक पहचान में विस्तार किया है, जिसमें सिंथेटिक आवाज़ विश्लेषण को उसके ऑडियो मॉडलों के माध्यम से उपलब्ध व्यापक संदर्भ जानकारी के साथ जोड़ा गया है।
कंपनी के अनुसार, उसकी तकनीक वर्तमान में प्रति माह 10 मिलियन घंटे से अधिक ऑडियो का विश्लेषण करती है और कुल मिलाकर 600 मिलियन घंटे से अधिक प्रोसेस कर चुकी है।
AI‑जनित संगीत पहचान जैसे क्षेत्रों में इसका विस्तार यह भी दर्शाता है कि मूल एन्सेम्बल आर्किटेक्चर कितनी व्यापक रूप से लागू किया जा सकता है। उदाहरण के लिए, Modulate की संगीत पहचान प्रणाली संगीत की उपस्थिति, AI‑जनित वोकल्स और AI‑जनित इंस्ट्रूमेंटेशन को अलग‑अलग मूल्यांकित करती है, फिर संकेतों को मिलाकर एक समझने योग्य परिणाम प्रदान करती है।
वॉयस AI के लिए अगली चुनौती समझना है, न कि बोलना
$25 मिलियन का निवेश Modulate को अपने शोध, इंजीनियरिंग, डेवलपर टूल्स और साझेदारियों को विस्तारित करने के लिए अतिरिक्त संसाधन प्रदान करता है। व्यापक रूप से देखें तो यह वॉयस AI के लिए बढ़ती चुनौती को दर्शाता है: स्वाभाविक रूप से बोलना केवल बातचीत का आधा हिस्सा है।
जैसे ही वॉयस एजेंट ग्राहक सेवा, स्वास्थ्य देखभाल, वित्तीय सेवाओं और अन्य क्षेत्रों में प्रवेश करते हैं, सिस्टम को उन संकेतों को समझना होगा जो ट्रांसक्रिप्ट अक्सर चूक जाते हैं, जैसे निराशा, हिचकिचाहट, ज़ोर, स्वर, और संभावित सिंथेटिक आवाज़।
यह वॉयस इंटरैक्शन के आसपास एक नई इंटेलिजेंस लेयर बना सकता है, जो सिस्टम को धोखाधड़ी का पता लगाने, ग्राहक असंतुष्ट होने पर पहचानने, या यह निर्धारित करने में मदद करेगी कि AI एजेंट बातचीत को समझने या संभालने में गलती कर रहा है या नहीं।
हालाँकि यह तकनीक गोपनीयता, सटीकता और पक्षपात के संबंध में प्रश्न भी उठाती है। आवाज़ से भावनाओं या इरादों का अनुमान लगाना शब्दों के ट्रांसक्रिप्शन से अधिक व्यक्तिपरक है, विशेष रूप से विभिन्न उच्चारण, भाषाओं और संस्कृतियों में।
जैसे ही AI व्यक्ति की तरह बोलने में अधिक सक्षम होता जा रहा है, अगला चरण यह निर्धारित करना हो सकता है कि मशीनें वास्तव में कितनी अच्छी तरह सुन सकती हैं—और इन क्षमताओं का उपयोग कितनी ज़िम्मेदारी से किया जाता है।












