साक्षात्कार

डॉ राम श्रीहर्षा, पाइनकोन में इंजीनियरिंग के वीपी – साक्षात्कार श्रृंखला

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

डॉ राम श्रीहर्षा पाइनकोन में इंजीनियरिंग और अनुसंधान के वीपी हैं।

पाइनकोन में शामिल होने से पहले, राम ने याहू, डेटाब्रिक्स और स्प्लंक में वीपी की भूमिका निभाई थी। याहू में, वह एक प्रमुख सॉफ्टवेयर इंजीनियर और फिर अनुसंधान वैज्ञानिक थे; डेटाब्रिक्स में, वह जेनोमिक्स के लिए एकीकृत विश्लेषण मंच के उत्पाद और इंजीनियरिंग लीड थे; और स्प्लंक में अपने तीन सालों में, उन्होंने कई भूमिकाएं निभाईं, जिनमें सीनियर प्रिंसिपल वैज्ञानिक, वीपी इंजीनियरिंग और डिस्टिंग्विश्ड इंजीनियर शामिल थे।

पाइनकोन एक पूरी तरह से प्रबंधित वेक्टर डेटाबेस है जो उत्पादन अनुप्रयोगों में वेक्टर खोज जोड़ना आसान बनाता है। यह वेक्टर खोज लाइब्रेरी, फिल्टरिंग जैसी क्षमताओं और वितरित बुनियादी ढांचे को जोड़ती है ताकि किसी भी स्तर पर उच्च प्रदर्शन और विश्वसनीयता प्रदान की जा सके।

आपको मशीन लर्निंग में शुरू में क्या आकर्षित किया?

उच्च आयामी सांख्यिकी, सीखने की सिद्धांत और इस तरह के विषय मुझे मशीन लर्निंग में आकर्षित करते थे। वे गणितीय रूप से अच्छी तरह से परिभाषित हैं, तर्कसंगत हो सकते हैं और सीखने के अर्थ और कुशलता से सीखने वाले एल्गोरिदम को डिज़ाइन करने के लिए कुछ मूलभूत अंतर्दृष्टि प्रदान करते हैं।

आपने पहले स्प्लंक में इंजीनियरिंग के वीपी के रूप में काम किया था, जो एक डेटा प्लेटफ़ॉर्म है जो डेटा को ऑब्जर्वेबिलिटी, आईटी, सुरक्षा और अधिक के लिए कार्रवाई में बदलने में मदद करता है। इस अनुभव से आपके कुछ प्रमुख निष्कर्ष क्या थे?

मुझे तब तक एहसास नहीं हुआ था जब तक मैं स्प्लंक नहीं गया था कि उद्यम खोज में उपयोग के मामले कितने विविध हैं: लोग लॉग विश्लेषण, दृश्यता, सुरक्षा विश्लेषण और कई अन्य उपयोग के मामलों के लिए स्प्लंक का उपयोग करते हैं। और इनमें से अधिकांश उपयोग के मामलों में सामान्य बात यह है कि असंरचित डेटा में समान घटनाओं या अत्यधिक असमान (या असामान्य) घटनाओं का पता लगाने का विचार है। यह निकलता है कि यह एक कठिन समस्या है और ऐसे डेटा के माध्यम से खोज करने के पारंपरिक साधन बहुत स्केलेबल नहीं हैं। स्प्लंक में अपने समय के दौरान, मैंने लॉ माइनिंग, सुरक्षा विश्लेषण आदि के लिए मशीन लर्निंग (और गहरे शिक्षण) के उपयोग पर इन क्षेत्रों में अनुसंधान शुरू किया। उस काम के माध्यम से, मुझे एहसास हुआ कि वेक्टर एम्बेडिंग और वेक्टर खोज नए दृष्टिकोण के लिए मौलिक प्रिमिटिव होंगे।

आप हमें वेक्टर खोज क्या है, इसका वर्णन कर सकते हैं?

पारंपरिक खोज (जिसे कीवर्ड खोज भी कहा जाता है) में, आप एक प्रश्न और दस्तावेजों के बीच कीवर्ड मेल खाते हैं (यह ट्वीट, वेब दस्तावेज, कानूनी दस्तावेज, आदि हो सकते हैं)। ऐसा करने के लिए, आप अपने प्रश्न को उसके टोकन में विभाजित करते हैं, दिए गए टोकन वाले दस्तावेज़ प्राप्त करते हैं और मिलान और रैंकिंग करते हैं ताकि एक दिए गए प्रश्न के लिए सबसे प्रासंगिक दस्तावेज़ निर्धारित किए जा सकें।

मुख्य समस्या यह है कि प्रासंगिक परिणाम प्राप्त करने के लिए, आपका प्रश्न दस्तावेज़ में कीवर्ड मेल खाना चाहिए। पारंपरिक खोज की एक क्लासिक समस्या यह है: यदि आप “पॉप” के लिए खोजते हैं, तो आप “पॉप संगीत” से मेल खाएंगे, लेकिन “सोडा” से नहीं मिलेंगे, क्योंकि “पॉप” और “सोडा” वाले दस्तावेजों के बीच कोई कीवर्ड ओवरलैप नहीं है, भले ही हम जानते हैं कि कई क्षेत्रों में संयुक्त राज्य अमेरिका में, “पॉप” का अर्थ “सोडा” है।

वेक्टर खोज में, आप प्रश्नों और दस्तावेजों को कुछ उच्च आयामी स्थान में एक वेक्टर में परिवर्तित करके शुरू करते हैं। यह आमतौर पर पाठ को ओपनएआई के एलएलएम या अन्य भाषा मॉडल जैसे गहरे शिक्षण मॉडल के माध्यम से पारित करके किया जाता है। जो आपको परिणामस्वरूप मिलता है वह एक उच्च आयामी स्थान में एक वेक्टर के रूप में सोचा जा सकता है।

मूल विचार यह है कि इस उच्च आयामी स्थान में निकट वेक्टर भी सेमेंटिक रूप से समान होते हैं। “सोडा” और “पॉप” के हमारे उदाहरण पर वापस जाते हुए, यदि मॉडल सही कॉर्पस पर प्रशिक्षित किया गया है, तो यह संभवतः “पॉप” और “सोडा” को सेमेंटिक रूप से समान मानेगा और इसलिए संबंधित एम्बेडिंग एक दूसरे के करीब होंगी। यदि ऐसा है, तो एक दिए गए प्रश्न के लिए निकटतम पड़ोसी दस्तावेज़ खोजना इस उच्च आयामी स्थान में संबंधित प्रश्न वेक्टर के निकटतम पड़ोसियों की खोज करने की समस्या बन जाती है।

आप वेक्टर डेटाबेस का वर्णन कर सकते हैं और यह उच्च-प्रदर्शन वेक्टर खोज अनुप्रयोगों के निर्माण को कैसे सक्षम बनाता है?

एक वेक्टर डेटाबेस इन एम्बेडिंग (या वेक्टर) को संग्रहीत, अनुक्रमित और प्रबंधित करता है। एक वेक्टर डेटाबेस द्वारा हल की जाने वाली मुख्य चुनौतियां हैं:

  • वेक्टर पर एक कुशल खोज सूचकांक बनाना जो निकटतम पड़ोसी प्रश्नों का उत्तर दे सके
  • क्वेरी फिल्टरिंग का समर्थन करने के लिए कुशल सहायक सूचकांक और डेटा संरचनाएं बनाना। उदाहरण के लिए, मान लें कि आप केवल निगम के एक उपसेट पर खोज करना चाहते हैं, तो आपको मौजूदा खोज सूचकांक का लाभ उठाने में सक्षम होना चाहिए बिना इसे पुनः बनाए

डेटा और खोज सूचकांक दोनों को ताज़ा रखने के लिए कुशल अद्यतनों का समर्थन करें, सुसंगत, स्थिर, आदि।

पाइनकोन में उपयोग किए जाने वाले विभिन्न प्रकार के मशीन लर्निंग एल्गोरिदम क्या हैं?

हम आमतौर पर अनुमानित निकटतम पड़ोसी खोज एल्गोरिदम पर काम करते हैं और बड़ी मात्रा में डेटा के साथ कुशलता से अपडेट, प्रश्न और निपटने के लिए नए एल्गोरिदम विकसित करते हैं जितना संभव हो उतना लागत प्रभावी तरीके से।

हम घने और पतले पुनर्प्राप्ति को मिलाने वाले एल्गोरिदम पर भी काम करते हैं जो खोज प्रासंगिकता में सुधार करते हैं।

स्केलेबल खोज बनाने के पीछे कुछ चुनौतियां क्या हैं?

जबकि अनुमानित निकटतम पड़ोसी खोज पर दशकों से शोध किया जा रहा है, हमारा मानना है कि इसमें अभी भी बहुत कुछ खोजा जाना बाकी है।

विशेष रूप से, जब यह बड़े पैमाने पर निकटतम पड़ोसी खोज को डिज़ाइन करने की बात आती है जो लागत प्रभावी है, बड़े पैमाने पर फिल्टरिंग करने में, या एल्गोरिदम डिज़ाइन करने में जो उच्च मात्रा में अद्यतनों का समर्थन करते हैं और आम तौर पर ताज़ा सूचकांक होते हैं, तो वे आज चुनौतीपूर्ण समस्याएं हैं।

इस प्रौद्योगिकी का उपयोग करने के लिए विभिन्न प्रकार के उपयोग के मामले क्या हैं?

वेक्टर डेटाबेस के उपयोग के मामलों का स्पेक्ट्रम दिन-ब-दिन बढ़ रहा है। सेमेंटिक खोज में इसके उपयोग के अलावा, हम इसे छवि खोज, छवि पुनर्प्राप्ति, जनरेटिव एआई, सुरक्षा विश्लेषण आदि में भी उपयोग किया जाते हुए देख रहे हैं।

आपकी खोज के भविष्य के लिए आपकी दृष्टि क्या है?

मुझे लगता है कि खोज का भविष्य एआई से चलेगा, और मुझे नहीं लगता कि यह बहुत दूर है। उस भविष्य में, मुझे उम्मीद है कि वेक्टर डेटाबेस एक मूल प्रिमिटिव होगा। हम वेक्टर डेटाबेस को एआई की दीर्घकालिक स्मृति (या बाहरी ज्ञान आधार) के रूप में सोचते हैं।

धन्यवाद इस शानदार साक्षात्कार के लिए, पाठक जो अधिक जानना चाहते हैं उन्हें पाइनकोन पर जाना चाहिए।

एंटोनी एक दूरदर्शी नेता और यूनाइट.एआई के संस्थापक भागीदार हैं, जो कि एआई और रोबोटिक्स के भविष्य को आकार देने और बढ़ावा देने के लिए एक अटूट जुनून से प्रेरित हैं। एक连续 उद्यमी, वह मानता है कि एआई समाज के लिए उतना ही विघटनकारी होगा जितना कि बिजली, और अक्सर विघटनकारी प्रौद्योगिकियों और एजीआई की संभावना के बारे में उत्साहित होता है।

एक भविष्यवाणी के रूप में, वह इन नवाचारों के बारे में जानने के लिए समर्पित है कि वे हमारी दुनिया को कैसे आकार देंगे। इसके अलावा, वह सिक्योरिटीज़.io के संस्थापक हैं, जो एक मंच है जो भविष्य को फिर से परिभाषित करने और पूरे क्षेत्रों को पुनः आकार देने वाली नवीनतम प्रौद्योगिकियों में निवेश पर केंद्रित है।