साक्षात्कार

जीन-लुईस क्यूगुइनर, ग्लेडिया के संस्थापक और सीईओ – साक्षात्कार श्रृंखला

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

जीन-लुईस क्यूगुइनर ग्लेडिया के संस्थापक और सीईओ हैं। उन्होंने पहले ओवीएचक्लाउड में डेटा, एआई और क्वांटम कंप्यूटिंग के समूह उपाध्यक्ष के रूप में कार्य किया, जो यूरोप के प्रमुख क्लाउड प्रदाताओं में से एक है। उन्होंने कनाडा में क्यूबेक विश्वविद्यालय और पेरिस में आर्ट्स एट मेटियर्स पेरिसटेक से प्रतीकात्मक एआई में मास्टर डिग्री प्राप्त की है। अपने करियर के दौरान, उन्होंने विभिन्न उद्योगों में महत्वपूर्ण पदों पर कार्य किया है, जिनमें वित्तीय डेटा विश्लेषण, मशीन लर्निंग अनुप्रयोग वास्तविक समय डिजिटल विज्ञापन के लिए और भाषण एआई एपीआई के विकास शामिल हैं।

ग्लेडिया उद्योगों, भाषाओं और प्रौद्योगिकी स्टैक में उत्पादों के लिए उन्नत ऑडियो ट्रांसक्रिप्शन और वास्तविक समय एआई समाधान प्रदान करता है। राज्य के अत्याधुनिक एएसआर और जेनरेटिव एआई मॉडल को अनुकूलित करके, यह सटीक, लैग-मुक्त भाषण और भाषा प्रसंस्करण सुनिश्चित करता है। ग्लेडिया का प्लेटफ़ॉर्म कॉल और बैठकों से अंतर्दृष्टि और मेटाडेटा को वास्तविक समय में निकालने की भी अनुमति देता है, जो बिक्री सहायता और स्वचालित ग्राहक सहायता जैसे प्रमुख उद्यम उपयोग के मामलों का समर्थन करता है।

आपको स्पीच-टू-टेक्स्ट (एसटीटी) प्रौद्योगिकी में चुनौतियों का सामना करने के लिए क्या प्रेरित किया, और बाजार में आपने कौन से अंतराल देखे?

जब मैंने ग्लेडिया की स्थापना की, तो शुरुआती लक्ष्य व्यापक था – एक एआई कंपनी जो जटिल प्रौद्योगिकी को सुलभ बनाएगी। लेकिन जैसे ही हम गहराई से जांच की, तो यह स्पष्ट हो गया कि वॉयस टेक्नोलॉजी सबसे अधिक टूटी हुई और अभी भी सबसे महत्वपूर्ण क्षेत्र थी जिस पर ध्यान केंद्रित करने की आवश्यकता थी।

वॉइस हमारे दैनिक जीवन में केंद्रीय है, और हमारा अधिकांश संचार भाषण के माध्यम से होता है। फिर भी, विकासकर्ताओं के लिए वॉयस डेटा के साथ काम करने के लिए उपलब्ध उपकरण गति, सटीकता और मूल्य के मामले में अपर्याप्त थे – विशेष रूप से भाषाओं में।

मैं इसे ठीक करना चाहता था, वॉयस टेक्नोलॉजी की जटिलता को खोलना और इसे सरल, कुशल, शक्तिशाली और सुलभ बनाने के लिए पुनः पैकेज करना। विकासकर्ताओं को एआई मॉडल की जटिलताओं या भाषण पहचान में संदर्भ लंबाई की बारीकियों के बारे में चिंतित नहीं होना चाहिए। मेरा लक्ष्य एक उद्यम-ग्रेड स्पीच-टू-टेक्स्ट एपीआई बनाना था जो बिना किसी समस्या के काम करे, चाहे वह कोई भी अंतर्निहित मॉडल या प्रौद्योगिकी हो।

उद्यम उपयोग के लिए एक ट्रांसक्रिप्शन समाधान बनाते समय आपको कुछ अनोखी चुनौतियों का सामना करना पड़ा?

भाषण पहचान में, गति और सटीकता – इस क्षेत्र में दो प्रमुख प्रदर्शन संकेतक – डिजाइन द्वारा विपरीत हैं। इसका अर्थ है कि एक में सुधार करने से दूसरे में समझौता होगा, कम से कम कुछ हद तक। लागत कारक, एक बड़े पैमाने पर, प्रदाता की गति और गुणवत्ता के बीच चुनाव का परिणाम है।

ग्लेडिया बनाते समय, हमारा लक्ष्य इन दोनों कारकों के बीच सही संतुलन खोजना था, साथ ही साथ यह सुनिश्चित करना था कि प्रौद्योगिकी स्टार्टअप और एसएमई के लिए उपलब्ध रहे। इस प्रक्रिया में, हमने महसूस किया कि ओपनएआई के व्हिस्पर जैसे मूल एएसआर मॉडल, जिसके साथ हम व्यापक रूप से काम करते हैं, प्रशिक्षण डेटा के कारण अंग्रेजी की ओर झुके हुए हैं, जो कई भाषाओं को कम प्रतिनिधित्व देते हैं।

इसलिए, गति-सटीकता व्यापार-बंद को हल करने के अलावा, यह महत्वपूर्ण था – एक यूरोपीय, बहुभाषी टीम के रूप में – हमारे मूल मॉडल को अनुकूलित और ठीक करने के लिए एक वास्तविक वैश्विक एपीआई बनाने के लिए जो व्यवसायों को भाषाओं में संचालित करने में मदद करता है।

ग्लेडिया भीड़भाड़ वाले एआई ट्रांसक्रिप्शन बाजार में खुद को कैसे अलग करता है? आपका व्हिस्पर-ज़ीरो एएसआर क्या है?

हमारा नया रियल-टाइम इंजन (ग्लेडिया रियल टाइम) 300 मिलीसेकंड की उद्योग-अग्रणी विलंबता हासिल करता है। इसके अलावा, यह कॉल या बैठक से अंतर्दृष्टि निकालने में सक्षम है जिसे “ऑडियो इंटेलिजेंस” ऐड-ऑन या सुविधाओं के साथ कहा जाता है, जैसे कि नामित इकाई पहचान (एनईआर) या भावना विश्लेषण।

हमारे ज्ञान के अनुसार, कुछ प्रतिस्पर्धी वास्तविक समय में दोनों ट्रांसक्रिप्शन और अंतर्दृष्टि प्रदान करने में सक्षम हैं – और यह सब अंग्रेजी के अलावा अन्य भाषाओं में सटीक रूप से करते हैं। हमारी भाषा समर्थन आज 100 से अधिक भाषाओं तक बढ़ गया है।

हमने उत्पाद को वास्तव में स्टैक-एज्नोस्टिक बनाने पर विशेष जोर दिया है। हमारा एपीआई सभी मौजूदा टेक स्टैक और टेलीफोनी प्रोटोकॉल के साथ संगत है, जिनमें एसआईपी, वोआईपी, फ्रीस्विच और एस्टरिस्क शामिल हैं। टेलीफोनी प्रोटोकॉल विशेष रूप से जटिल एकीकरण के लिए हैं, इसलिए हम मानते हैं कि यह उत्पाद का पहलू बाजार में महत्वपूर्ण मूल्य ला सकता है।

वास्तविक समय ट्रांसक्रिप्शन में एआई मॉडल में हॉलुसिनेशन एक महत्वपूर्ण चिंता का विषय है। आप एसटीटी के संदर्भ में हॉलुसिनेशन की व्याख्या कर सकते हैं और ग्लेडिया इस समस्या का समाधान कैसे करता है?

हॉलुसिनेशन आमतौर पर तब होता है जब मॉडल को ज्ञान की कमी होती है या विषय पर पर्याप्त संदर्भ नहीं होता है। हालांकि मॉडल आउटपुट उत्पन्न कर सकते हैं जो अनुरोध के अनुकूल हैं, वे केवल अपने प्रशिक्षण के समय में मौजूद जानकारी का संदर्भ दे सकते हैं, जो अद्यतन नहीं हो सकती है। मॉडल संदर्भ के आधार पर संभावित लेकिन गलत जानकारी के साथ अंतराल को भरकर सुसंगत प्रतिक्रियाएं उत्पन्न करेगा।

व्हिस्पर जैसे भाषण पहचान मॉडल में हॉलुसिनेशन, जो क्षेत्र में एक अग्रणी मॉडल है, एलएलएम के समान हैं क्योंकि वे एक समान वास्तुकला साझा करते हैं, इसलिए यह एक समस्या है जो उत्पन्न मॉडल को प्रभावित करती है, जो संदर्भ के आधार पर अगले शब्दों की भविष्यवाणी करने में सक्षम हैं। यह दृष्टिकोण अधिक पारंपरिक, ध्वनि-आधारित एएसआर वास्तुकला से अलग है जो इनपुट ध्वनि को आउटपुट में अधिक यांत्रिक तरीके से मेल खाता है।

परिणामस्वरूप, आप एक प्रतिलेख में शब्द पा सकते हैं जो वास्तव में नहीं कहे गए थे, जो विशेष रूप से चिकित्सा जैसे क्षेत्रों में गंभीर परिणामों का कारण बन सकता है।

हॉलुसिनेशन को प्रबंधित और पहचानने के लिए कई तरीके हैं। एक सामान्य दृष्टिकोण रिट्रीवल-ऑगमेंटेड जेनरेशन (आरएजी) प्रणाली का उपयोग करना है, जो मॉडल की उत्पन्न करने वाली क्षमताओं को एक पुनर्प्राप्ति तंत्र के साथ जोड़ती है जो तथ्यों की जांच करती है। एक अन्य विधि मॉडल को एक श्रृंखला में पूर्वनिर्धारित चरणों या चेकपॉइंट के माध्यम से मार्गदर्शन करने के लिए “चेन ऑफ थॉट” दृष्टिकोण का उपयोग करना शामिल है।

एक और रणनीति हॉलुसिनेशन का पता लगाने के लिए मॉडल के आउटपुट की सत्यता का मूल्यांकन करने वाली प्रणालियों का उपयोग करना है। हॉलुसिनेशन का मूल्यांकन करने के लिए विशिष्ट बेंचमार्क हैं जो मॉडल द्वारा उत्पन्न विभिन्न उम्मीदवार प्रतिक्रियाओं की तुलना करने और निर्धारित करने में शामिल हैं कि कौन सी सबसे सटीक है।

हमने ग्लेडिया में व्हिस्पर-ज़ीरो बनाने के लिए कई तकनीकों के संयोजन के साथ प्रयोग किया है, हमारी प्रोप्राइटरी एएसआर जो लगभग सभी हॉलुसिनेशन को हटा देती है। यह असिंक्रोनस ट्रांसक्रिप्शन में उत्कृष्ट परिणाम दिखाता है, और हम इसे वास्तविक समय के लिए 99.9% सूचना विश्वासworthiness हासिल करने के लिए अनुकूलित कर रहे हैं।

एसटीटी तकनीक को एक्सेंट, शोर और बहु-भाषा बातचीत जैसी व्यापक जटिलताओं को संभालना होगा। ग्लेडिया इन चुनौतियों का सामना करने और उच्च सटीकता सुनिश्चित करने के लिए कैसे दृष्टिकोण अपनाता है?

एएसआर में भाषा का पता लगाना एक अत्यधिक जटिल कार्य है। प्रत्येक वक्ता के पास एक अनोखी वोकल हस्ताक्षर होती है, जिसे हम विशेषताओं के रूप में बुलाते हैं। ध्वनि स्पेक्ट्रम का विश्लेषण करके, मशीन लर्निंग एल्गोरिदम वर्गीकरण कर सकते हैं, मेल फ्रीक्वेंसी सेप्ट्रल कॉफिसिएंट्स (एमएफसीसी) का उपयोग करके मुख्य आवृत्ति विशेषताओं को निकाल सकते हैं।

एमएफसी एक मनो-श्रवण क्षेत्र से प्रेरित विधि है, जो ध्वनि की हमारी धारणा पर केंद्रित है। यह कम आवृत्तियों पर जोर देता है और सामान्यीकृत फोरियर विघटन जैसी तकनीकों का उपयोग करके ऑडियो को आवृत्ति स्पेक्ट्रम में परिवर्तित करता है।

हालांकि, इस दृष्टिकोण में एक सीमा है: यह शुद्ध रूप से अकουσ्टिक पर आधारित है। इसलिए, यदि आप एक मजबूत उच्चारण के साथ अंग्रेजी बोलते हैं, तो प्रणाली सामग्री को समझने के बजाय आपकी प्रोसोडी (लय, तनाव, स्वर) के आधार पर निर्णय ले सकती है।

यहीं पर ग्लेडिया का नवाचारी समाधान आता है। हमने एक हाइब्रिड दृष्टिकोण विकसित किया है जो मनो-श्रवण विशेषताओं को सामग्री समझ के साथ जोड़ता है डायनामिक भाषा का पता लगाने के लिए।

हमारी प्रणाली केवल यह नहीं सुनती कि आप कैसे बोलते हैं, बल्कि यह भी समझती है कि आप क्या कह रहे हैं। यह दोहरा दृष्टिकोण कोड-स्विचिंग को कुशलता से संभावित बनाता है और मजबूत उच्चारण को गलत या गलत समझने से रोकता है।

कोड-स्विचिंग – जो हमारे मुख्य अंतरों में से एक है – बहु-भाषा बातचीत को संभालने के लिए एक महत्वपूर्ण सुविधा है। वक्ता बातचीत के दौरान (या यहां तक कि वाक्य के बीच में) भाषा बदल सकते हैं, और मॉडल की यह क्षमता वास्तविक समय में सटीक रूप से लिप्यंतरण करने के लिए महत्वपूर्ण है।

ग्लेडिया एपीआई कई भाषा जोड़ियों के साथ कोड-स्विचिंग को संभालने में अद्वितीय है, जो शोर वाले वातावरण में भी उच्च स्तर की सटीकता के साथ प्रदर्शन करता है, जो अक्सर लिप्यंतरण की गुणवत्ता को कम कर देता है।

वास्तविक समय ट्रांसक्रिप्शन के लिए अल्ट्रा-लो लेटेंसी की आवश्यकता होती है। आपका एपीआई 300 मिलीसेकंड से कम लेटेंसी को बनाए रखते हुए सटीकता कैसे हासिल करता है?

300 मिलीसेकंड से कम लेटेंसी को बनाए रखने और सटीकता को बनाए रखने के लिए एक बहुस्तरीय दृष्टिकोण की आवश्यकता होती है जो हार्डवेयर विशेषज्ञता, एल्गोरिदम अनुकूलन और वास्तुकला डिजाइन को मिलाता है।

वास्तविक समय एआई पारंपरिक कंप्यूटिंग की तरह नहीं है – यह जीपीजीपीयू की शक्ति और दक्षता से जुड़ा हुआ है। मैं इस स्थान में लगभग एक दशक से काम कर रहा हूं, ओवीएचक्लाउड में एआई डिवीजन का नेतृत्व कर रहा हूं (यूरोप में सबसे बड़ा क्लाउड प्रदाता), और मैंने पहले से ही सीखा है कि यह हमेशा सही संतुलन खोजने के बारे में है: आपको कितनी हार्डवेयर शक्ति की आवश्यकता है, यह कितना खर्च करता है, और आप अपने एल्गोरिदम को उस हार्डवेयर के साथ कैसे सहजता से काम करने के लिए अनुकूलित करते हैं।

वास्तविक समय एआई में प्रदर्शन हार्डवेयर की क्षमताओं के साथ एल्गोरिदम को प्रभावी ढंग से संरेखित करने से आता है, यह सुनिश्चित करते हुए कि प्रत्येक ऑपरेशन थ्रूपुट को अधिकतम करता है और देरी को कम करता है।

लेकिन यह केवल एआई और हार्डवेयर नहीं है। प्रणाली की वास्तुकला भी एक बड़ी भूमिका निभाती है, विशेष रूप से नेटवर्क, जो विलंबता पर बहुत प्रभाव डाल सकता है। हमारे सीटीओ, जिन्हें सिगफॉक्स (एक आईओटी अग्रणी) में कम-विलंबता नेटवर्क डिजाइन में गहरा अनुभव है, ने हमारी नेटवर्क सेटअप को मूल्यवान मिलीसेकंड को काटने के लिए अनुकूलित किया है।

इसलिए, यह वास्तव में हार्डवेयर चुनाव, एल्गोरिदम और नेटवर्क डिजाइन के बीच का मिश्रण है जो हमें लगातार 300 मिलीसेकंड से कम विलंबता हासिल करने की अनुमति देता है, सटीकता से समझौता किए बिना।

ग्लेडिया ट्रांसक्रिप्शन से परे जाता है जैसे स्पीकर डायराइजेशन, सेंटिमेंट एनालिटिक्स और टाइम-स्टैम्प्ड ट्रांसक्रिप्ट्स जैसी सुविधाओं के साथ। आपने अपने ग्राहकों को इन टूल्स का उपयोग करके विकसित करने के लिए कुछ नवाचारी अनुप्रयोग देखे हैं?

एएसआर एक विस्तृत श्रृंखला के अनुप्रयोगों को अनलॉक करता है, और यह देखना आश्चर्यजनक रहा है कि पिछले दो वर्षों में कितनी वास्तविक अग्रणी कंपनियां एलएलएम और हमारे एपीआई का लाभ उठाकर अत्याधुनिक, प्रतिस्पर्धी उत्पाद बनाने के लिए उभरी हैं। यहां कुछ उदाहरण हैं:

  • स्मार्ट नोट-टेकिंग: कई ग्राहक काम की बैठकों, छात्र व्याख्यानों या चिकित्सा परामर्श से जानकारी को जल्दी से पकड़ने और व्यवस्थित करने के लिए उपकरण बना रहे हैं। स्पीकर डायराइजेशन के साथ, हमारा एपीआई यह पहचानने में सक्षम है कि किसने क्या कहा, जिससे बातचीत का पालन करना और कार्रवाई के आइटम सौंपना आसान हो जाता है। समय-चिह्नित लिप्यंतरण के साथ, उपयोगकर्ता रिकॉर्डिंग में विशिष्ट क्षणों पर सीधे कूद सकते हैं, समय और सुनिश्चित करते हैं कि कुछ भी खो नहीं जाता है।
  • बिक्री सक्षमीकरण: बिक्री में, ग्राहक की भावना को समझना सब कुछ है। टीमें हमारी भावना विश्लेषण सुविधा का उपयोग करके कॉल या डेमो के दौरान संभावित ग्राहकों की प्रतिक्रिया में वास्तविक समय के अंतर्दृष्टि प्राप्त करने के लिए कर रही हैं। समय-चिह्नित लिप्यंतरण बिक्री टीमों को बातचीत के महत्वपूर्ण हिस्सों को फिर से देखने में मदद करता है ताकि वे अपनी पिच को परिष्कृत कर सकें या ग्राहक की चिंताओं को अधिक प्रभावी ढंग से संबोधित कर सकें। इस विशेष उपयोग के मामले के लिए, नामित इकाई पहचान (एनईआर) भी महत्वपूर्ण है ताकि नाम, कंपनी विवरण और अन्य जानकारी को स्वचालित रूप से सीआरएम में निकाला जा सके।
  • कॉल सेंटर सहायता: कॉन्ट्रैक्ट सेंटर स्पेस में कंपनियां हमारे एपीआई का उपयोग लाइव एजेंट सहायता प्रदान करने और ग्राहक भावना को कॉल के दौरान झंडा देने के लिए कर रही हैं। स्पीकर डायराइजेशन सुनिश्चित करता है कि जो कहा जा रहा है वह सही व्यक्ति को असाइन किया जाता है, जबकि समय-चिह्नित लिप्यंतरण पर्यवेक्षकों को महत्वपूर्ण क्षणों या अनुपालन मुद्दों की समीक्षा करने में सक्षम बनाता है। यह न केवल ग्राहक अनुभव में सुधार करता है – बेहतर ऑन-कॉल रिजॉल्यूशन दर और गुणवत्ता निगरानी के साथ – लेकिन एजेंट उत्पादकता और संतुष्टि को भी बढ़ाता है।

कस्टम वोकेबुलरी और इकाई पहचान की भूमिका उद्यम उपयोगकर्ताओं के लिए ट्रांसक्रिप्शन विश्वसनीयता में सुधार करने में क्या है?

अनेक उद्योग विशिष्ट शब्दावली, ब्रांड नाम और भाषा की विशिष्टताओं पर निर्भर करते हैं। कस्टम शब्दावली एकीकरण ट्रांसक्रिप्शन समाधान को विशिष्ट आवश्यकताओं के अनुरूप बनाने की अनुमति देता है, जो संदर्भ की बारीकियों को पकड़ने और व्यवसाय की जरूरतों को प्रतिबिंबित करने वाले आउटपुट को वितरित करने के लिए महत्वपूर्ण है। उदाहरण के लिए, यह आपको एक विशिष्ट भाषा में डोमेन-विशिष्ट शब्दों की सूची बनाने की अनुमति देता है, जैसे कि ब्रांड नाम।

क्यों यह उपयोगी है: विशिष्ट ऊर्ध्वाधर के लिए ट्रांसक्रिप्शन को अनुकूलित करने से लिप्यंतरण में त्रुटियों को कम करने में मदद मिलती है, जिससे उपयोगकर्ता अनुभव में सुधार होता है। यह सुविधा विशेष रूप से चिकित्सा या वित्त जैसे क्षेत्रों में महत्वपूर्ण है।

नामित इकाई पहचान (एनईआर) असंरचित ऑडियो डेटा से महत्वपूर्ण जानकारी निकालती है, जैसे लोगों, संगठनों, स्थानों और अधिक के नाम। असंरचित डेटा के साथ एक सामान्य चुनौती यह है कि यह महत्वपूर्ण जानकारी प्रतिलिपि में दफन है।

इसे हल करने के लिए, ग्लेडिया ने एक संरचित कुंजी डेटा निष्कर्षण (केडीई) दृष्टिकोण विकसित किया है। हमारी व्हिस्पर-आधारित वास्तुकला की उत्पन्न करने वाली क्षमताओं का लाभ उठाकर – एलएलएम के समान – ग्लेडिया केडीई संदर्भ को पकड़ने के लिए संदर्भ का उपयोग करके प्रासंगिक जानकारी को सीधे निकालता है।

इस प्रक्रिया को कस्टम शब्दावली और एनईआर जैसी सुविधाओं के साथ और बेहतर बनाया जा सकता है, जो व्यवसायों को सीआरएम को जल्दी और कुशलता से आबाद करने में मदद करता है।

आपके विचार में, वास्तविक समय ट्रांसक्रिप्शन ग्राहक सहायता, बिक्री और सामग्री निर्माण जैसे उद्योगों को कैसे बदल रहा है?

वास्तविक समय ट्रांसक्रिप्शन इन उद्योगों को गहराई से प्रभावित कर रहा है, उत्पादकता में अविश्वसनीय लाभ और वास्तविक व्यावसायिक लाभ प्रदान कर रहा है।

सबसे पहले, वास्तविक समय ट्रांसक्रिप्शन समर्थन टीमों के लिए एक खेल परिवर्तक है। वास्तविक समय सहायता गुणवत्ता और हैंडल समय जैसे मेट्रिक्स में सुधार के लिए महत्वपूर्ण है, जो बेहतर परिणामों की ओर ले जाता है। जैसा कि एएसआर सिस्टम बेहतर और बेहतर होते जा रहे हैं और वास्तविक समय में गैर-अंग्रेजी भाषाओं का अनुवाद कर रहे हैं, कонтैक्ट सेंटर वास्तविक रूप से वैश्विक ग्राहक अनुभव प्राप्त कर सकते हैं और कम मार्जिन पर।

बिक्री में, गति और सटीक अंतर्दृष्टि सब कुछ है। इसी तरह जो कॉल एजेंटों के साथ होता है, वास्तविक समय ट्रांसक्रिप्शन बिक्री टीमों को सही समय पर सही अंतर्दृष्टि प्रदान करता है, जो उन्हें सौदों को बंद करने पर ध्यान केंद्रित करने में सक्षम बनाता है।

सामग्री निर्माताओं के लिए, वास्तविक समय ट्रांसक्रिप्शन कम से कम आज कम प्रासंगिक है, लेकिन मीडिया आयोजनों के दौरान लाइव कैप्शनिंग और अनुवाद के लिए इसकी संभावना है। हमारे अधिकांश मीडिया ग्राहक अभी भी समय-चिह्नित लिप्यंतरण के लिए प्राथमिकता देते हैं क्योंकि गति कम महत्वपूर्ण है जबकि सटीकता समय-चिह्नित वीडियो संपादन और उपशीर्षक पीढ़ी जैसे अनुप्रयोगों के लिए महत्वपूर्ण है।

वास्तविक समय एआई ट्रांसक्रिप्शन एक बढ़ती हुई प्रवृत्ति लगती है। अगले 5-10 वर्षों में आप इस प्रौद्योगिकी को कहां देखते हैं?

मुझे लगता है कि यह जो हम अब वास्तविक समय एआई कहते हैं, वह हर जगह होगा। मूल रूप से, हम जिन मशीनों के साथ बातचीत करते हैं उन्हें मानवों के साथ बातचीत करने की क्षमता की बात कर रहे हैं।

और यदि आप किसी भी हॉलीवुड फिल्म (जैसे हर) को देखें जो भविष्य में सेट है, तो आप कभी भी किसी को कीबोर्ड के माध्यम से बुद्धिमान प्रणालियों के साथ बातचीत करते हुए नहीं देखेंगे। मेरे लिए, यह मानवता की सामूहिक कल्पना में वॉयस की प्राथमिकता का प्रमाण है।

वॉइस, मानव संस्कृति और इतिहास में लेखन से बहुत लंबे समय से मौजूद है, क्योंकि यह हमारे ज्ञान को अधिक प्रभावी ढंग से संरक्षित करने की अनुमति देता है। तब लेखन ने हमारी जरूरतों को पूरा करने के लिए कदम रखा।

जेनएआई प्रणाली, जो भाषण को समझने, प्रतिक्रिया उत्पन्न करने और हमारे इंटरैक्शन को संग्रहीत करने में सक्षम हैं, ने इस स्थान में कुछ पूरी तरह से नया लाया है। यह दोनों दुनिया का सर्वश्रेष्ठ है और वास्तव में मानवता का सर्वश्रेष्ठ है। यह हमें वॉयस के माध्यम से मानव संचार की अनोखी शक्ति और ऊर्जा प्रदान करता है, जो पहले केवल लिखित मीडिया के लिए सुरक्षित थी। यही कारण है कि मुझे लगता है कि यह हर जगह होगा – यह हमारा अंतिम सामूहिक सपना है।

इस महान साक्षात्कार के लिए धन्यवाद, पाठक जो अधिक जानना चाहते हैं उन्हें ग्लेडिया पर जाना चाहिए।

एंटोनी एक दूरदर्शी नेता और यूनाइट.एआई के संस्थापक भागीदार हैं, जो कि एआई और रोबोटिक्स के भविष्य को आकार देने और बढ़ावा देने के लिए एक अटूट जुनून से प्रेरित हैं। एक连续 उद्यमी, वह मानता है कि एआई समाज के लिए उतना ही विघटनकारी होगा जितना कि बिजली, और अक्सर विघटनकारी प्रौद्योगिकियों और एजीआई की संभावना के बारे में उत्साहित होता है।

एक भविष्यवाणी के रूप में, वह इन नवाचारों के बारे में जानने के लिए समर्पित है कि वे हमारी दुनिया को कैसे आकार देंगे। इसके अलावा, वह सिक्योरिटीज़.io के संस्थापक हैं, जो एक मंच है जो भविष्य को फिर से परिभाषित करने और पूरे क्षेत्रों को पुनः आकार देने वाली नवीनतम प्रौद्योगिकियों में निवेश पर केंद्रित है।