साक्षात्कार

अनैस डॉटिस-जॉर्जियू, इन्फ्लक्सडाटा में डेवलपर एडवोकेट – साक्षात्कार श्रृंखला

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

अनैस डॉटिस-जॉर्जियू इन्फ्लक्सडाटा के लिए एक डेवलपर एडवोकेट हैं, जो डेटा एनालिटिक्स, एआई और मशीन लर्निंग का उपयोग करके डेटा को सुंदर बनाने के लिए जुनून रखते हैं। वह जिस डेटा को इकट्ठा करती है, उसमें शोध, अन्वेषण और इंजीनियरिंग का मिश्रण करती है ताकि डेटा को कुछ कार्यशील, मूल्य और सुंदरता में अनुवाद किया जा सके। जब वह स्क्रीन के पीछे नहीं होती है, तो आप उसे बाहर निकाल सकते हैं, ड्राइंग, स्ट्रेचिंग, बोर्डिंग या सॉकर बॉल के पीछे दौड़ सकते हैं।

इन्फ्लक्सडाटा वह कंपनी है जो इन्फ्लक्सडीबी बना रही है, जो दुनिया भर के एक मिलियन से अधिक डेवलपर्स द्वारा उपयोग किया जाने वाला ओपन सोर्स समय श्रृंखला डेटाबेस है। उनका मिशन डेवलपर्स को अपने समय श्रृंखला डेटा के साथ बुद्धिमान, वास्तविक समय प्रणाली बनाने में मदद करना है।

क्या आप एक शोध सहायक से इन्फ्लक्सडाटा में लीड डेवलपर एडवोकेट बनने के अपने सफर के बारे में थोड़ा बता सकते हैं? आपकी डेटा एनालिटिक्स और मशीन लर्निंग में पृष्ठभूमि ने आपकी वर्तमान भूमिका को कैसे आकार दिया है?

मैंने रासायनिक इंजीनियरिंग में स्नातक की डिग्री प्राप्त की जिसमें जैव चिकित्सा इंजीनियरिंग पर ध्यान केंद्रित किया गया और अंततः प्रयोगशालाओं में टीका विकास और प्रसव पूर्व ऑटिज्म का पता लगाने का काम किया। वहां से, मैं तरल हैंडलिंग रोबोटों को प्रोग्राम करने और डेटा वैज्ञानिकों को विचलन का पता लगाने के लिए मापदंडों को समझने में मदद करने लगा, जिससे मुझे प्रोग्रामिंग में अधिक रुचि हो गई।

मैं फिर ऑरेकल में एक बिक्री विकास प्रतिनिधि बन गया और महसूस किया कि मुझे वास्तव में कोडिंग पर ध्यान केंद्रित करने की आवश्यकता है। मैंने टेक्सास विश्वविद्यालय में डेटा एनालिटिक्स में एक कोडिंग बूटकैम्प लिया और तकनीक में प्रवेश करने में सक्षम हो गया, विशेष रूप से डेवलपर संबंध।

(ORCL )

मैं एक तकनीकी पृष्ठभूमि से आया था, इसलिए इससे मेरी वर्तमान भूमिका को आकार देने में मदद मिली। हालांकि मेरे पास विकास अनुभव नहीं था, लेकिन मैं उन लोगों के साथ संबंधित और सहानुभूति रख सकता था जिनकी इंजीनियरिंग पृष्ठभूमि और दिमाग थे लेकिन सॉफ्टवेयर सीखने की कोशिश कर रहे थे। इसलिए, जब मैं सामग्री या तकनीकी ट्यूटोरियल बनाता था, तो मैं नए उपयोगकर्ताओं को तकनीकी चुनौतियों को दूर करने में मदद कर सकता था जबकि बातचीत को उनके लिए प्रासंगिक और दिलचस्प बना सकता था।

आपका काम रचनात्मकता के साथ तकनीकी विशेषज्ञता को मिलाता है। आप अपने दैनिक कार्य में इन्फ्लक्सडाटा में डेटा को ‘सुंदर’ बनाने के अपने जुनून को कैसे शामिल करते हैं?

हाल ही में, मैं डेटा एनालिटिक्स की तुलना में डेटा इंजीनियरिंग पर अधिक ध्यान केंद्रित कर रहा हूं। जबकि मैं डेटा एनालिटिक्स पर उतना ध्यान नहीं देता जितना मैं करता था, मैं अभी भी गणित से प्यार करता हूं – मुझे लगता है कि गणित सुंदर है, और मैं एक एल्गोरिदम के पीछे के गणित को समझाने का अवसर पाने के लिए कूद पड़ता हूं।

इन्फ्लक्सडीबी समय श्रृंखला डेटा स्थान में एक कोने का पत्थर रहा है। आप इन्फ्लक्सडीबी के विकास और विकास पर ओपन सोर्स समुदाय के प्रभाव को कैसे देखते हैं?

इन्फ्लक्सडाटा ओपन डेटा आर्किटेक्चर और एपाचे इकोसिस्टम के लिए बहुत प्रतिबद्ध है। पिछले साल हमने इन्फ्लक्सडीबी 3.0 की घोषणा की, जो रास्ट में लिखा गया और एपाचे फ्लाइट, डेटाफ्यूजन, एरो और पार्क्वेट – जिसे हम एफडीएपी स्टैक कहते हैं – के साथ बनाया गया था। जैसे ही इन्फ्लक्सडाटा के इंजीनियर उन अपस्ट्रीम परियोजनाओं में योगदान करते हैं, समुदाय बढ़ता है और एपाचे एरो सेट की परियोजनाएं अधिक सुविधाजनक, अधिक सुविधाओं और कार्यक्षमता के साथ और व्यापक अंतरOPERability के साथ आसान हो जाती हैं।

समय श्रृंखला डेटा और एआई के संदर्भ में हाल ही में आपको कौन से सबसे रोमांचक ओपन-सोर्स परियोजनाएं या योगदान दिखाई दिए हैं?

यह देखना दिलचस्प है कि एलएलएम को समय श्रृंखला के लिए शून्य-शॉट पूर्वानुमान के लिए पुनः उपयोग या लागू किया जा रहा है। ऑटोलैब में खुले समय श्रृंखला भाषा मॉडल का संग्रह है, और टाइमजीपीटी एक और उत्कृष्ट उदाहरण है।

इसके अलावा, विभिन्न ओपन सोर्स स्ट्रीम प्रोसेसिंग लाइब्रेरी, जिनमें बाइटवैक्स और मैज.एआई शामिल हैं, जो उपयोगकर्ताओं को हगिंग फेस से मॉडल का लाभ उठाने और एकीकृत करने की अनुमति देते हैं, बहुत उत्साहजनक हैं।

इन्फ्लक्सडाटा अपने ओपन सोर्स पहलों को विकसित करने और उन्हें डेवलपर समुदाय के लिए प्रासंगिक और लाभकारी बनाने के लिए क्या करता है, खासकर एआई और मशीन लर्निंग में तेजी से प्रगति के साथ?

इन्फ्लक्सडाटा की पहल ओपन सोर्स परियोजनाओं में योगदान देकर प्रासंगिक और लाभकारी बनी रहती है जिन्हें एआई-विशिष्ट कंपनियां भी लाभ उठाती हैं। उदाहरण के लिए, हर बार जब इन्फ्लक्सडीबी एपाचे एरो, पार्क्वेट या डेटाफ्यूजन में योगदान करता है, तो यह हर उस एआई प्रौद्योगिकी और कंपनी को लाभान्वित करता है जो इसका लाभ उठाती है, जिनमें एपाचे स्पार्क, डेटाब्रिक्स, रैपिड्स.एआई, स्नोफ्लेक, बिगक्वेरी, हगिंग फेस और अधिक शामिल हैं।

समय श्रृंखला भाषा मॉडल पूर्वानुमानिक विश्लेषण में बढ़ते महत्व को देखते हुए, आप इन मॉडलों द्वारा समय श्रृंखला पूर्वानुमान और विचलन का पता लगाने को कैसे बदलते हुए देखते हैं?

समय श्रृंखला एलएम रेखीय और सांख्यिकीय मॉडल को पार करते हुए शून्य-शॉट पूर्वानुमान प्रदान करते हैं। इसका मतलब है कि आपको मॉडल को अपने डेटा पर प्रशिक्षित करने की आवश्यकता नहीं है इससे पहले कि आप इसका उपयोग करें। इसके अलावा, कोई सांख्यिकीय मॉडल को ट्यून करने की आवश्यकता नहीं है, जिसके लिए समय श्रृंखला सांख्यिकी में गहरी विशेषज्ञता की आवश्यकता होती है।

हालांकि, प्राकृतिक भाषा प्रसंस्करण के विपरीत, समय श्रृंखला क्षेत्र में बड़े पैमाने पर सार्वजनिक रूप से सुलभ डेटासेट का अभाव है। अधिकांश मौजूदा पूर्व-प्रशिक्षित मॉडल समय श्रृंखला के लिए केवल कुछ हजार – या शायद कुछ सौ – नमूनों पर प्रशिक्षित होते हैं। हालांकि इन बेंचमार्क डेटासेट ने समय श्रृंखला समुदाय की प्रगति में महत्वपूर्ण भूमिका निभाई है, लेकिन उनके सीमित नमूना आकार और सामान्यीकरण की कमी गहरे शिक्षण मॉडल के पूर्व-प्रशिक्षण के लिए चुनौतियां प्रस्तुत करती हैं।

यही कारण है कि मुझे लगता है कि ओपन सोर्स समय श्रृंखला एलएम कठिन हैं । गूगल के टाइम्सएफएम और आईबीएम के टिनीटाइम मिक्सर को बड़े डेटासेट पर प्रशिक्षित किया गया है जिसमें सैकड़ों अरब डेटा बिंदु हैं। टाइम्सएफएम के साथ, उदाहरण के लिए, पूर्व-प्रशिक्षण प्रक्रिया गूगल क्लाउड टीपीयू वी3 -256 पर की जाती है, जिसमें 256 टीपीयू कोर और कुल 2 टेराबाइट्स मेमोरी होती है। पूर्व-प्रशिक्षण प्रक्रिया में लगभग दस दिन लगते हैं और इसके परिणामस्वरूप 1.2 बिलियन पैरामीटर वाला मॉडल होता है। पूर्व-प्रशिक्षित मॉडल को तब विशिष्ट डाउनस्ट्रीम कार्यों और डेटासेट पर कम सीखने की दर और कम एपोच का उपयोग करके ठीक किया जाता है।

(GOOGL )

उम्मीद है, यह परिवर्तन यह意味ा है कि अधिक लोग गहरे डोमेन ज्ञान के बिना सटीक पूर्वानुमान लगा सकते हैं। हालांकि, समय श्रृंखला एलएम जैसे गणनात्मक रूप से महंगे मॉडल का लाभ उठाने के लिए वित्तीय और पर्यावरणीय लागत के परिप्रेक्ष्य से पेशेवरों और विपक्षों को तौलने के लिए बहुत काम करने की आवश्यकता है।

यह हगिंग फेस ब्लॉग पोस्ट समय श्रृंखला पूर्वानुमान का एक और उत्कृष्ट उदाहरण है।

पारंपरिक तरीकों की तुलना में समय श्रृंखला एलएम का उपयोग करने के मुख्य लाभ क्या हैं, विशेष रूप से जटिल पैटर्न और शून्य-शॉट प्रदर्शन को संभालने के संदर्भ में?

महत्वपूर्ण लाभ यह है कि आपको अपने समय श्रृंखला डेटा पर मॉडल को प्रशिक्षित और पुनः प्रशिक्षित करने की आवश्यकता नहीं है। यह आशा है कि यह ऑनलाइन मशीन लर्निंग समस्या को समाप्त कर देता है जिसमें मॉडल की ड्रिफ्ट की निगरानी करना और पुनः प्रशिक्षण को ट्रिगर करना शामिल है, आदर्श रूप से पूर्वानुमान पाइपलाइन की जटिलता को समाप्त करता है।

आपको बहुस्वरीय सांख्यिकीय मॉडल के लिए क्रॉस-श्रृंखला संबंधों या संबंधों का अनुमान लगाने के लिए संघर्ष नहीं करना पड़ता है। अनुमानों द्वारा जोड़ा गया अतिरिक्त परिवर्तनशीलता अक्सर परिणामी पूर्वानुमानों को नुकसान पहुंचा सकती है और मॉडल को झूठे संबंध सीखने का कारण बन सकती है।

क्या आप गूगल के टाइम्सएफएम, आईबीएम के टिनीटाइममिक्सर और ऑटोलैब के मोमेंट जैसे मॉडल के वास्तविक दुनिया के दृश्यों में कार्यान्वयन के कुछ व्यावहारिक उदाहरण प्रदान कर सकते हैं?

यह उत्तर देना मुश्किल है; चूंकि ये मॉडल अपनी अपेक्षाकृत प्रारंभिक अवस्था में हैं, इसलिए यह ज्ञात नहीं है कि कंपनियां वास्तविक दुनिया के दृश्यों में उनका उपयोग कैसे करती हैं।

आपके अनुभव में, संगठन आमतौर पर अपने मौजूदा डेटा बुनियादी ढांचे में समय श्रृंखला एलएम को एकीकृत करने का सामना किन चुनौतियों का करते हैं, और वे उन्हें कैसे पार कर सकते हैं?

समय श्रृंखला एलएम इतने नए हैं कि मुझे नहीं पता कि संगठनों को किन विशिष्ट चुनौतियों का सामना करना पड़ता है। हालांकि, मुझे लगता है कि वे जेनएआई मॉडल को अपने डेटा पाइपलाइन में शामिल करते समय उन्हीं चुनौतियों का सामना करेंगे जो चुनौतियां हैं:

  • डेटा संगतता और एकीकरण समस्याएं: समय श्रृंखला एलएम अक्सर विशिष्ट डेटा प्रारूप, सुसंगत टाइमस्टैम्पिंग और नियमित अंतराल की आवश्यकता होती है, लेकिन मौजूदा डेटा बुनियादी ढांचे में असंरचित या असंगत समय श्रृंखला डेटा शामिल हो सकता है जो विभिन्न प्रणालियों में फैला हुआ है, जैसे कि विरासत डेटाबेस, क्लाउड स्टोरेज या रियल-टाइम स्ट्रीम। इसे दूर करने के लिए, टीमों को समय श्रृंखला डेटा को पूर्व-प्रोसेस, साफ करने और संरेखित करने के लिए मजबूत ईटीएल (एक्सट्रेक्ट, ट्रांसफॉर्म, लोड) पाइपलाइनों को लागू करना चाहिए।
  • मॉडल स्केलेबिलिटी और प्रदर्शन: समय श्रृंखला एलएम, विशेष रूप से ट्रांसफॉर्मर जैसे गहरे शिक्षण मॉडल, संसाधन गहन हो सकते हैं, जिन्हें बड़े समय श्रृंखला डेटा को वास्तविक समय या निकट वास्तविक समय में संसाधित करने के लिए महत्वपूर्ण कंप्यूट और मेमोरी संसाधनों की आवश्यकता होती है। इसके लिए टीमों को स्केलेबल प्लेटफार्मों पर मॉडल तैनात करने की आवश्यकता होगी, जैसे कि कुबेरनेट्स या क्लाउड-मैनेज्ड एमएल सेवाएं, जीपीयू त्वरण का लाभ उठाएं जब आवश्यक हो, और डास्क या रे जैसे वितरित प्रसंस्करण फ्रेमवर्क का उपयोग करके मॉडल अंतर्दृष्टि को समानांतर करें।
  • व्याख्यात्मकता और विश्वसनीयता: समय श्रृंखला मॉडल, विशेष रूप से जटिल एलएम, “ब्लैक बॉक्स” के रूप में देखे जा सकते हैं, जिससे पूर्वानुमानों की व्याख्या करना मुश्किल हो जाता है। यह विशेष रूप से विनियमित उद्योगों में विशेष रूप से समस्याग्रस्त हो सकता है, जैसे कि वित्त या स्वास्थ्य सेवा।
  • डेटा गोपनीयता और सुरक्षा: समय श्रृंखला डेटा को संभालने में अक्सर संवेदनशील जानकारी शामिल होती है, जैसे कि आईओटी सेंसर डेटा या वित्तीय लेनदेन डेटा, इसलिए डेटा पाइपलाइनों और मॉडलों में डेटा सुरक्षा और अनुपालन सुनिश्चित करना महत्वपूर्ण है। संगठनों को यह सुनिश्चित करना चाहिए कि डेटा पाइपलाइनें और मॉडल सर्वोत्तम सुरक्षा प्रथाओं का पालन करते हैं, जिसमें एन्क्रिप्शन और एक्सेस कंट्रोल शामिल है, और मॉडल को सुरक्षित, अलग-अलग वातावरण में तैनात करें।

आगे बढ़ते हुए, आप समय श्रृंखला एलएम की भूमिका को पूर्वानुमानिक विश्लेषण और एआई के क्षेत्र में कैसे विकसित होते हुए देखते हैं? क्या कोई उभरते हुए रुझान या प्रौद्योगिकियां हैं जो आपको विशेष रूप से उत्साहित करती हैं?

समय श्रृंखला एलएम के विकास में एक संभावित अगला कदम उपयोगकर्ताओं को उन्हें अधिक आसानी से तैनात, एक्सेस और उपयोग करने में सक्षम बनाने वाले उपकरणों की शुरुआत हो सकती है। मैंने जिन समय श्रृंखला एलएम का उपयोग किया है, उनमें से अधिकांश को विशिष्ट वातावरण की आवश्यकता होती है और ट्यूटोरियल और दस्तावेज़ीकरण की कमी होती है। अंततः, ये परियोजनाएं अपनी प्रारंभिक अवस्था में हैं, लेकिन यह देखना दिलचस्प होगा कि वे आने वाले महीनों और वर्षों में कैसे विकसित होती हैं।

साक्षात्कार के लिए धन्यवाद, पाठक जो अधिक जानना चाहते हैं उन्हें इन्फ्लक्सडाटा पर जाना चाहिए।

एंटोनी एक दूरदर्शी नेता और यूनाइट.एआई के संस्थापक भागीदार हैं, जो कि एआई और रोबोटिक्स के भविष्य को आकार देने और बढ़ावा देने के लिए एक अटूट जुनून से प्रेरित हैं। एक连续 उद्यमी, वह मानता है कि एआई समाज के लिए उतना ही विघटनकारी होगा जितना कि बिजली, और अक्सर विघटनकारी प्रौद्योगिकियों और एजीआई की संभावना के बारे में उत्साहित होता है।

एक भविष्यवाणी के रूप में, वह इन नवाचारों के बारे में जानने के लिए समर्पित है कि वे हमारी दुनिया को कैसे आकार देंगे। इसके अलावा, वह सिक्योरिटीज़.io के संस्थापक हैं, जो एक मंच है जो भविष्य को फिर से परिभाषित करने और पूरे क्षेत्रों को पुनः आकार देने वाली नवीनतम प्रौद्योगिकियों में निवेश पर केंद्रित है।