एआई मॉडल और प्लेटफ़ॉर्म
एरिक जीएफेसर, एसपीआर के डेटा प्रैक्टिस के प्रिंसिपल आर्किटेक्ट – साक्षात्कार श्रृंखला

एरिक ने 2018 में एसपीआर के एमर्जिंग टेक्नोलॉजी ग्रुप के डेटा प्रैक्टिस में प्रिंसिपल आर्किटेक्ट के रूप में शामिल हुए।
एरिक डेटा, जावा का उपयोग करके ओपन सोर्स विकास, और व्यावहारिक उद्यम वास्तुकला में विशेषज्ञता रखते हैं, जिसमें प्रूफ ऑफ कॉन्सेप्ट, प्रोटोटाइप, और एमवीपी का निर्माण शामिल है।
आपको मशीन लर्निंग में क्या आकर्षित करता है?
इसकी अनुमति देने वाले अनुप्रयोगों को लगातार सीखने के लिए। मैंने अपने विकास करियर की शुरुआत एक वरिष्ठ डेटा विश्लेषक के रूप में की थी, जो एसपीएसएस का उपयोग करते थे, जो एक वैश्विक बाजार अनुसंधान फर्म में था, और बाद में मैंने ड्रूल्स नामक एक व्यवसाय नियम इंजन का उपयोग किया था, जो मैंने ग्राहकों के लिए अनुप्रयोगों में शामिल किया था, लेकिन इस सभी कार्य का परिणाम मूल रूप से स्थिर था।
बाद में मैं प्रक्रिया सुधार प्रशिक्षण के माध्यम से गया, जिसके दौरान प्रशिक्षकों ने विस्तार से दिखाया कि वे अपने ग्राहकों द्वारा उपयोग किए जाने वाले व्यवसाय प्रक्रियाओं में सुधार कैसे कर सकते हैं, लेकिन यहां भी आउटपुट मुख्य रूप से समय के बिंदुओं पर केंद्रित था। मेरे इसी समय के दौरान एक स्वास्थ्य देखभाल उत्पाद पर काम करने का मेरा अनुभव मुझे दिखाया कि ऐसे प्रयासों के लिए निरंतर सीखना क्यों आवश्यक है, लेकिन उस समय उपलब्ध संसाधन नहीं थे।
दिलचस्प बात यह है कि मेरी मशीन लर्निंग में आकर्षण पूरा हो गया है, क्योंकि मेरे स्नातक सलाहकार ने मुझे उस समय की कृत्रिम बुद्धिमत्ता में विशेषज्ञता के खिलाफ चेतावनी दी थी, क्योंकि उस समय एआई शीतकाल था। मैंने इसके बजाय एमएल जैसे शब्दों का उपयोग करने का फैसला किया, क्योंकि वे कम अर्थ रखते हैं, और क्योंकि यहां तक कि एएमडब्ल्यूएस भी स्वीकार करता है कि इसकी एआई सेवा परत वास्तव में इसकी एमएल सेवा परत पर एक उच्च-स्तरीय अभिव्यक्ति है। जबकि बाहर कुछ एमएल हYPE असंगत है, यह विकासकों के दृष्टिकोण से शक्तिशाली क्षमताएं प्रदान करता है, जब तक कि ये पрак्टिशनर्स स्वीकार करते हैं कि एमएल द्वारा प्रदान किया गया मूल्य केवल तभी अच्छा है जब यह डेटा द्वारा संसाधित किया जाता है।
आप एक बड़े ओपन सोर्स अधिवक्ता हैं, आप बता सकते हैं कि ओपन सोर्स इतना महत्वपूर्ण क्यों है?
ओपन सोर्स के बारे में एक पहलू जिसे मैंने वर्षों से कार्यकारियों को समझाने की आवश्यकता है, वह यह है कि ओपन सोर्स सॉफ्टवेयर का मुख्य लाभ यह नहीं है कि इसका उपयोग निशुल्क किया जा सकता है, बल्कि सोर्स कोड निशुल्क उपलब्ध है।
इसके अलावा, जो डेवलपर्स इस सोर्स कोड का उपयोग करते हैं, वे अपने लिए इसे संशोधित कर सकते हैं, और यदि सुझाए गए परिवर्तनों को मंजूरी दी जाती है, तो वे इन परिवर्तनों को अन्य डेवलपर्स के लिए उपलब्ध करा सकते हैं। वास्तव में, ओपन सोर्स सॉफ्टवेयर के पीछे का आंदोलन इसलिए शुरू हुआ क्योंकि डेवलपर्स व्यावसायिक फर्मों द्वारा उनके द्वारा लाइसेंस प्राप्त उत्पादों में परिवर्तन करने के लिए लंबे समय तक प्रतीक्षा कर रहे थे, इसलिए डेवलपर्स ने स्वयं समान कार्यक्षमता वाले सॉफ्टवेयर लिखने का फैसला किया, जिसे अन्य डेवलपर्स द्वारा सुधारा जा सकता है।
व्यावसायिक ओपन सोर्स इन लाभों का लाभ उठाता है, जो इस तथ्य की वास्तविकता है कि कई आधुनिक उत्पादों में ओपन सोर्स का उपयोग किया जाता है, यहां तक कि व्यावसायिक संस्करणों में भी जो आमतौर पर ओपन सोर्स रिलीज के हिस्से के रूप में उपलब्ध नहीं होने वाले अतिरिक्त घटक प्रदान करते हैं, जो विभेदक और समर्थन प्रदान करते हैं यदि इसकी आवश्यकता है।
मेरा पहला ओपन सोर्स अनुभव तब हुआ जब मैंने पहले उल्लिखित स्वास्थ्य देखभाल उत्पाद पर काम किया था, जिसमें एपाचे एंट जैसे टूलिंग का उपयोग किया गया था, जो सॉफ्टवेयर बनाने के लिए उपयोग किया जाता था, और एक प्रारंभिक डेवओप्स उत्पाद जिसे हडसन कहा जाता था (जिसका कोडबेस बाद में जेनकिन्स बन गया)। हमारे द्वारा इन ओपन सोर्स उत्पादों का उपयोग करने का मुख्य कारण यह था कि वे या तो व्यावसायिक विकल्पों की तुलना में बेहतर समाधान प्रदान करते थे, या वे ऐसे नवाचार थे जो व्यावसायिक संस्थाओं द्वारा पेश नहीं किए गए थे, और व्यावसायिक लाइसेंसिंग के कारण जो हम उपयोग कर रहे थे वह अत्यधिक प्रतिबंधक था, जिससे लाइसेंस की आवश्यकता होने पर अत्यधिक लाल फीता हो जाता था।
समय के साथ, मैंने ओपन सोर्स पेशकशों को विकसित होते देखा है, जो बहुत जरूरी नवाचार प्रदान करती हैं। उदाहरण के लिए, मेरे सहयोगियों और मैंने जिस स्वास्थ्य देखभाल उत्पाद पर काम किया था, उसमें जिन समस्याओं से हमें जूझना पड़ा, उन्हें बाद में एक नवाचारी ओपन सोर्स जावा उत्पाद द्वारा हल किया गया, जिसे स्प्रिंग फ्रेमवर्क कहा जाता है, जो एक दशक से अधिक समय से मजबूत है, जिसका पारिस्थितिकी तंत्र अब उन नवाचारों से बहुत आगे बढ़ गया है जो यह पहले प्रदान करता था, जैसे कि निर्भरता इंजेक्शन।
आपने प्रूफ ऑफ कॉन्सेप्ट, प्रोटोटाइप और एमवीपी के निर्माण के लिए ओपन सोर्स का उपयोग किया है। क्या आप इन उत्पादों के पीछे की अपनी यात्रा साझा कर सकते हैं?
जैसा कि मैंने एक हालिया ग्राहक को प्रस्तुत किए गए एक मार्गदर्शक सिद्धांत में समझाया है, हमने जिस डेटा प्लेटफ़ॉर्म का निर्माण किया है, उसके लिए निर्माण को समय-समय पर आवश्यकतानुसार आगे बढ़ाया जाना चाहिए। इस प्लेटफ़ॉर्म के लिए बनाए गए घटकों को स्थिर रहने की उम्मीद नहीं की जानी चाहिए, क्योंकि आवश्यकताएं बदलती हैं और समय के साथ नए घटक और घटक सुविधाएं उपलब्ध होंगी।
प्लेटफ़ॉर्म कार्यक्षमता का निर्माण करते समय, हमेशा न्यूनतम व्यवहार्य से शुरू करें और फिर अनावश्यक घंटियों और सीटी को जोड़ें, जिसमें कभी-कभी कॉन्फ़िगरेशन भी शामिल है। कार्यक्षम से शुरू करें, सुनिश्चित करें कि आप इसे समझते हैं, और फिर इसे विकसित करें। अनावश्यक समय और पैसा बर्बाद न करें जो कम संभावना है कि इसका उपयोग किया जाएगा, लेकिन भविष्य की आवश्यकताओं से आगे रहने का प्रयास करें।
हमने जिस उत्पाद के लिए एमवीपी बनाया था, उसे विशेष रूप से इस तरह से बनाने की आवश्यकता थी ताकि अतिरिक्त उपयोग के मामलों को इसके ऊपर बनाया जा सके, हालांकि यह एक एकल उपयोग के मामले के कार्यान्वयन के साथ आया था, जो व्यय विचलन का पता लगाने के लिए था। एक पहले के उत्पाद के विपरीत जिस पर मैंने काम किया था, जिसका इतिहास मेरे आगमन से पहले था, हितधारक तीन साल से (!) इस बारे में बहस कर रहे थे कि वे जिस उत्पाद का निर्माण करना चाहते थे, उसके लिए उन्हें कैसे आगे बढ़ना चाहिए। एक क्लाइंट कार्यकारी ने मुझे बताया कि मुझे लाने का एक कारण यह था कि फर्म को कुछ आंतरिक बहसों से आगे निकलने में मदद करने के लिए, खासकर जब उत्पाद जिसे वह बनाना चाहता था, उसे शामिल संगठनों के पदानुक्रम को संतुष्ट करने की आवश्यकता थी।
मैंने पाया कि ये टर्फ युद्ध मुख्य रूप से ग्राहक, उसकी सहायक कंपनियों और बाहरी ग्राहकों द्वारा स्वामित्व वाले डेटा से जुड़े थे, इसलिए इस मामले में पूरा उत्पाद बैकलॉग डेटा को कैसे पचाने, संग्रहीत, सुरक्षित और उपभोग किया जाएगा, इस पर केंद्रित था एक ही उपयोग के मामले के लिए स्वास्थ्य देखभाल प्रदाताओं के नेटवर्क का उत्पादन करने के लिए।
मैंने अपने करियर की शुरुआत में ही समझा था कि एक वास्तुकला गुणवत्ता जिसे “उपयोगकर्ता की समझ” कहा जाता है, यह केवल अंतिम उपयोगकर्ताओं तक ही सीमित नहीं है, बल्कि सॉफ्टवेयर डेवलपर्स पर भी लागू होता है। इसका कारण यह है कि जो कोड लिखा जाता है वह उपयोगी होना चाहिए, जैसे कि उपयोगकर्ता इंटरफेस को अंतिम उपयोगकर्ताओं द्वारा उपयोगी होना चाहिए। ताकि एक उत्पाद उपयोगी हो, प्रूफ ऑफ कॉन्सेप्ट बनाने की आवश्यकता है ताकि यह दिखाया जा सके कि डेवलपर्स वह करने में सक्षम होंगे जो वे करने का इरादा रखते हैं, खासकर जब वे विशिष्ट प्रौद्योगिकी चुनावों से संबंधित होते हैं। लेकिन प्रूफ ऑफ कॉन्सेप्ट केवल शुरुआत है, क्योंकि उत्पादों को समय के साथ विकसित किया जाना चाहिए। मेरे विचार में, एक एमवीपी के लिए आधार आदर्श रूप से स्थिरता प्रदर्शित करने वाले प्रोटोटाइप पर बनाया जाना चाहिए ताकि डेवलपर्स इसे आगे विकसित कर सकें।
जब आप ‘मशीन लर्निंग एट एंटरप्राइज स्केल’ पुस्तक की समीक्षा कर रहे थे, तो आपने कहा कि ‘ओपन सोर्स उत्पादों, फ्रेमवर्क और भाषाओं का उपयोग एक लचीले वास्तुकला के साथ जो ओपन सोर्स और व्यावसायिक घटकों के मिश्रण से बना है, जो कई फर्मों को आवश्यक लचीलापन प्रदान करता है जो वे तुरंत महसूस नहीं करते हैं।’ क्या आप बता सकते हैं कि आप क्यों सोचते हैं कि ओपन सोर्स का उपयोग करने वाली फर्में अधिक लचीली हैं?
कई व्यावसायिक डेटा उत्पाद ओपन सोर्स घटकों का उपयोग करते हैं, और डेवलपर्स को लोकप्रिय प्रोग्रामिंग भाषाओं जैसे पायथन का उपयोग करने की अनुमति देते हैं। जो फर्में इन उत्पादों का निर्माण करती हैं, वे जानती हैं कि उन्होंने जिन ओपन सोर्स घटकों का चयन किया है, वे उन्हें एक प्रमुख प्रारंभिक बिंदु प्रदान करते हैं जो पहले से ही समुदाय द्वारा व्यापक रूप से उपयोग किया जाता है।
ओपन सोर्स घटकों के साथ मजबूत समुदाय आसान हैं क्योंकि वे मेज पर लाते हैं। व्यावसायिक रूप से उपलब्ध उत्पाद जो मुख्य रूप से बंद स्रोत हैं, या यहां तक कि ओपन सोर्स हैं जो मुख्य रूप से विशिष्ट व्यावसायिक उत्पादों द्वारा उपयोग किए जाते हैं, अक्सर विक्रेताओं द्वारा प्रशिक्षण या लाइसेंस की आवश्यकता होती है ताकि सॉफ्टवेयर का उपयोग किया जा सके।
इसके अलावा, ऐसे घटकों के लिए दस्तावेज़ मुख्य रूप से सार्वजनिक रूप से उपलब्ध नहीं है, जो डेवलपर्स को इन फर्मों पर निर्भर रखता है ताकि वे अपना काम कर सकें। जब व्यापक रूप से स्वीकृत ओपन सोर्स घटकों जैसे कि एपाचे स्पार्क पर ध्यान केंद्रित किया जाता है, जैसे कि डेटाब्रिक्स यूनिफाइड एनालिटिक्स प्लेटफ़ॉर्म में, तो इनमें से कई आइटम पहले से ही समुदाय में उपलब्ध हैं, जो उन हिस्सों को कम करता है जिन पर विकास टीमों को व्यावसायिक संस्थाओं पर निर्भर रहने की आवश्यकता है।
इसके अलावा, क्योंकि एपाचे स्पार्क जैसे घटक व्यावहारिक रूप से उद्योग मानक टूलिंग के रूप में स्वीकार किए जाते हैं, कोड को व्यावसायिक कार्यान्वयन के साथ आसानी से स्थानांतरित किया जा सकता है। फर्में हमेशा प्रतिस्पर्धी विभेदकों को शामिल करने के लिए प्रेरित होती हैं, लेकिन कई डेवलपर्स ऐसे उत्पादों का उपयोग नहीं करना चाहते हैं जो पूरी तरह से नए हैं क्योंकि यह फर्मों के बीच स्थानांतरित होना मुश्किल है, और यह उन मजबूत समुदायों के साथ उनके संबंधों को काट देता है जिन्हें वे उम्मीद करते हैं।
व्यक्तिगत अनुभव से, मैंने अतीत में ऐसे उत्पादों के साथ काम किया है, और यह समर्थन प्राप्त करना चुनौतीपूर्ण हो सकता है। और यह विडंबना है, दी गई यह अपेक्षा है कि समर्थन समय पर प्रदान किया जाएगा। मैंने एक ओपन सोर्स परियोजना में एक पुल अनुरोध जमा किया है, जिसमें उसी दिन निर्माण में सुधार किया गया है, लेकिन मैं यह नहीं कह सकता कि मैंने जिस भी व्यावसायिक परियोजना पर काम किया है।
ओपन सोर्स के बारे में आपका एक और विश्वास यह है कि यह ‘मजबूत डेवलपर समुदायों तक पहुंच’ प्रदान करता है।’ कुछ समुदाय कितने बड़े हैं और वे इतने प्रभावी क्यों हैं?
एक दिए गए ओपन सोर्स उत्पाद के आसपास के डेवलपर समुदाय लाखों में हो सकते हैं। गोद लेने की दरें समुदाय की ताकत की ओर नहीं इशारा करती हैं, लेकिन यह एक अच्छा संकेत है कि यह मामला है क्योंकि वे स्वस्थ चर्चा और प्रभावी दस्तावेज़ उत्पन्न करते हैं, और जहां सक्रिय विकास होता है।
जब एक वास्तुकार या वरिष्ठ डेवलपर यह तय करता है कि कौन से ऐसे उत्पादों को शामिल करना है, तो कई कारक आमतौर पर खेल में आते हैं, न केवल उत्पाद के बारे में और समुदाय के बारे में जो दिखता है, बल्कि विकास टीमों के बारे में जो इनका अपना करने जा रहे हैं, क्या वे पारिस्थितिकी तंत्र के लिए एक अच्छा फिट हैं, क्या सड़कमैप दिखता है, और कुछ मामलों में क्या व्यावसायिक समर्थन मिल सकता है यदि इसकी आवश्यकता है। हालांकि, कई ऐसे पहलू गायब हो जाते हैं जब मजबूत डेवलपर समुदायों का अभाव होता है।
आपने अपनी वेबसाइट पर 100 से अधिक पुस्तकों की समीक्षा की है, क्या आप हमारे पाठकों के लिए तीन पुस्तकों की सिफारिश कर सकते हैं?
मैं अब बहुत कम प्रोग्रामिंग पुस्तकें पढ़ता हूं, और जबकि अपवाद हैं, वास्तविकता यह है कि वे आमतौर पर बहुत जल्दी पुरानी हो जाती हैं, और डेवलपर समुदाय आमतौर पर चर्चा मंचों और दस्तावेजों के माध्यम से बेहतर विकल्प प्रदान करता है। मैं जिन पुस्तकों को पढ़ता हूं वे अक्सर मुझे स्वतंत्र रूप से उपलब्ध होती हैं, या तो प्रौद्योगिकी समाचार पत्रों के माध्यम से जिन्हें मैं सदस्यता लेता हूं, लेखकों और प्रकाशकों द्वारा जो मुझसे संपर्क करते हैं, या जो अमेज़ॅन मुझे भेजता है। उदाहरण के लिए, अमेज़ॅन ने मुझे 2011 में “द लीन स्टार्टअप” की एक पूर्व-प्रकाशन असंशोधित प्रमाणित प्रति मेरी समीक्षा के लिए भेजी थी, जिसने मुझे एमवीपी की अवधारणा से परिचित कराया, और हाल ही में मुझे “जूलिया फॉर बिगिनर्स” की एक प्रति भेजी।
(1) ओ’रेली से एक पुस्तक जिसे मैंने सिफारिश की है वह “इन सर्च ऑफ डेटाबेस निर्वाण” है। लेखक विस्तार से बताता है कि एक डेटा क्वेरी इंजन के लिए चुनौतियां जो ओएलटीपी से लेकर विश्लेषण तक के कार्यभार को सपोर्ट करता है, जिसमें संचालन और व्यवसायिक बुद्धिमत्ता कार्यभार बीच में होते हैं। यह पुस्तक एक मार्गदर्शक के रूप में उपयोग की जा सकती है ताकि यह मूल्यांकन किया जा सके कि एक डेटाबेस इंजन या क्वेरी और स्टोरेज इंजनों का संयोजन कार्यभार की आवश्यकताओं को पूरा करने के लिए तैयार है या नहीं, चाहे वे लेनदेन, विश्लेषणात्मक हों या दोनों का मिश्रण। इसके अलावा, लेखक का “स्विंगिंग डेटाबेस पेंडुलम” का वर्णन हाल के वर्षों में विशेष रूप से अच्छा है।
(2) जबकि पिछले कुछ वर्षों में डेटा स्थान में बहुत कुछ बदला है, क्योंकि नए डेटा विश्लेषण उत्पादों का परिचय दिया जा रहा है, “डिसरप्टिव एनालिटिक्स” पिछले 50 वर्षों में विश्लेषण में नवाचार का एक सुलभ, छोटा इतिहास प्रस्तुत करता है जैसा कि मैंने कहीं और नहीं देखा है, और दो प्रकार के विघटन का चर्चा करता है: विश्लेषण मूल्य श्रृंखला के भीतर विघटनकारी नवाचार, और विश्लेषण में नवाचार द्वारा उद्योग विघटना। स्टार्टअप और विश्लेषण अभ्यासकर्ताओं के दृष्टिकोण से, सफलता विघटन द्वारा सुविधा प्रदान की जाती है क्योंकि उनके उद्योगों में विघटन करने के लिए, विश्लेषण का उपयोग करके एक उत्पाद को अलग करना एक विघटनकारी व्यवसाय मॉडल बनाने या नए बाजार बनाने का एक तरीका है। विश्लेषण प्रौद्योगिकी में निवेश करने वाले संगठनों के दृष्टिकोण से, एक प्रतीक्षा और देखें दृष्टिकोण समझ में आ सकता है क्योंकि जोखिम वाली प्रौद्योगिकियों में निवेश जोखिमपूर्ण हैं क्योंकि उनके उपयोगी जीवन छोटे हैं।
(3) मैंने पढ़ी सबसे अच्छी प्रौद्योगिकी व्यवसाय पाठ्य पुस्तकों में से एक “द लिमिट्स ऑफ स्ट्रेटजी” है, जो रिसर्च बोर्ड (गार्टनर द्वारा अधिग्रहित) के सह-संस्थापक द्वारा लिखी गई है, जो कंप्यूटिंग दुनिया में विकास की जांच करता है और कैसे निगमों को अपनी रणनीतियों को अनुकूलित करना चाहिए। लेखक व्यापक नोट्स प्रदान करता है जो उनकी व्यवसायिक नेताओं के साथ कई बातचीत से आते हैं, जो पूरे पुस्तक में अंतर्दृष्टि प्रदान करते हैं कि उन्होंने (अपनी पत्नी के साथ) एक ग्राहक समूह का निर्माण कैसे किया, जो प्रमुख फर्म थीं जिन्हें अपनी रणनीतियों को कंप्यूटिंग की बढ़ती दुनिया के साथ जोड़ने की आवश्यकता थी। जैसा कि मैंने अपनी समीक्षा में टिप्पणी की है, यह पुस्तक को दो विपरीत विशेषताओं के कारण अन्य संबंधित प्रयासों से अलग करती है: उद्योग व्यापी चौड़ाई, और गहराई जो केवल आमने-सामने की बातचीत के माध्यम से उपलब्ध है।
आप एसपीआर के डेटा प्रैक्टिस के प्रिंसिपल आर्किटेक्ट हैं। क्या आप बता सकते हैं कि एसपीआर क्या करता है?
एसपीआर एक डिजिटल प्रौद्योगिकी परामर्श है जो शिकागो क्षेत्र में स्थित है, जो फोर्ट्यून 1000 उद्यमों से लेकर स्थानीय स्टार्टअप तक के विभिन्न ग्राहकों के लिए प्रौद्योगिकी परियोजनाओं को वितरित करता है। हम कस्टम सॉफ्टवेयर विकास, उपयोगकर्ता अनुभव, डेटा, और क्लाउड इंफ्रास्ट्रक्चर से लेकर डेवओप्स कोचिंग, सॉफ्टवेयर परीक्षण, और परियोजना प्रबंधन तक की एक श्रृंखला का उपयोग करके एंड-टू-एंड डिजिटल अनुभव बनाते हैं।
एसपीआर के साथ आपकी कुछ जिम्मेदारियां क्या हैं?
प्रिंसिपल आर्किटेक्ट के रूप में, मेरी प्राथमिक जिम्मेडारी ग्राहकों के लिए समाधान वितरण को चलाना है, जिसमें परियोजनाओं के लिए वास्तुकला और विकास का नेतृत्व करना शामिल है, और यह अक्सर उत्पाद मालिक जैसे अन्य टोपी पहनने का मतलब है क्योंकि उत्पादों का निर्माण कैसे किया जाता है, इसके बारे में हाथों-हाथ अनुभव होना महत्वपूर्ण है, खासकर जब स्क्रैच से निर्माण किया जा रहा हो। मैं अक्सर संभावित ग्राहकों के साथ चर्चाओं में शामिल होता हूं जब मेरी विशेषज्ञता की आवश्यकता होती है, और कंपनी ने हाल ही में मुझसे अनुरोध किया है कि मैं डेटा अभ्यास में अपने सहयोगियों के साथ एक निरंतर श्रृंखला की बैठकें शुरू करूं, जिसमें ग्राहक परियोजनाओं, साइड परियोजनाओं और यह देखने के लिए कि मेरे सहयोगी क्या कर रहे हैं तकनीक के साथ ताज़ा रहने के लिए, जो कि मैंने एक पिछले परामर्श के लिए चलाया था, हालांकि उस फर्म के लिए आंतरिक मीटअप डेटा कार्य के लिए विशिष्ट नहीं थे, बल्कि पूरे प्रौद्योगिकी अभ्यास के लिए थे।
मेरे करियर के अधिकांश हिस्से में, मैंने जावा का उपयोग करके ओपन सोर्स विकास में विशेषज्ञता प्राप्त की है, और डेटा कार्य में बढ़ती मात्रा में काम किया है। इसके अलावा, मैं और मेरे सहयोगी जिसे “व्यावहारिक” या “व्यावहारिक” उद्यम वास्तुकला कहते हैं, जिसका अर्थ है कि वास्तुकला कार्यों को बनाने के संदर्भ में करना, और वास्तव में इसे बनाना, न कि केवल इसके बारे में बात करना या इसके बारे में आरेख बनाना।
मेरे विचार में, ये तीन विशेषज्ञता एक दूसरे के साथ ओवरलैप करती हैं और परस्पर अनन्य नहीं हैं। मैंने पिछले कुछ वर्षों से कार्यकारियों को समझाया है कि प्रौद्योगिकी उद्योग द्वारा सॉफ्टवेयर विकास और डेटा कार्य के बीच जो रेखा खींची गई थी, वह अब अच्छी तरह से परिभाषित नहीं है, आंशिक रूप से क्योंकि इन दोनों स्थानों के बीच टूलिंग अभिसरण हुई है, और आंशिक रूप से क्योंकि इस अभिसरण के परिणामस्वरूप, डेटा कार्य स्वयं एक सॉफ्टवेयर विकास प्रयास बन गया है। हालांकि, चूंकि पारंपरिक डेटा व्यवसायी आमतौर पर सॉफ्टवेयर विकास पृष्ठभूमि नहीं रखते हैं, और इसके विपरीत, मैं इस अंतर को पूरा करने में मदद करता हूं।
एसपीआर के साथ आप जिस परियोजना पर वर्तमान में काम कर रहे हैं वह क्या है?
मैंने हाल ही में एक मल्टी-पार्ट केस स्टडी श्रृंखला का पहला पोस्ट प्रकाशित किया है जो पिछले वर्ष में एक चिकागो स्थित वैश्विक परामर्श के सीआईओ के लिए हमारी टीम और मैंने एएमडब्ल्यूएस में स्क्रैच से डेटा प्लेटफ़ॉर्म को लागू करने के बारे में है। यह प्लेटफ़ॉर्म डेटा पाइपलाइनों, डेटा झील, शास्त्रीय डेटा मॉडल, दृश्यीकरण, और मशीन लर्निंग मॉडल से बना है, जो कॉर्पोरेट विभागों, अभ्यासों और ग्राहकों द्वारा उपयोग किया जाने वाला है। जबकि मुख्य प्लेटफ़ॉर्म को कॉर्पोरेट आईटी संगठन द्वारा निर्मित किया जाना था जिसे सीआईओ चलाता है, लक्ष्य यह था कि यह प्लेटफ़ॉर्म कॉर्पोरेट आईटी के बाहर अन्य संगठनों द्वारा भी उपयोग किया जाएगा ताकि कंपनी भर में एक सामान्य वास्तुकला का उपयोग करके डेटा संपत्ति और डेटा विश्लेषण को केंद्रित किया जा सके।
जैसा कि कई स्थापित फर्मों के साथ होता है, माइक्रोसॉफ्ट एक्सेल का उपयोग सामान्य था, जिसमें स्प्रेडशीट आंतरिक और संगठनों के बीच, साथ ही फर्म और बाहरी ग्राहकों के बीच वितरित की जाती थीं। इसके अलावा, व्यवसाय इकाइयों और परामर्श अभ्यासों ने विभिन्न प्रक्रियाओं और टूलिंग का उपयोग करके खुद को अलग-थलग कर लिया था। इसलिए, डेटा संपत्ति और डेटा विश्लेषण को केंद्रित करने के अलावा, एक और लक्ष्य डेटा स्वामित्व की अवधारणा को लागू करना और संगठनों के बीच डेटा को सुरक्षित और सुसंगत तरीके से साझा करना था।
क्या ओपन सोर्स, एसपीआर या आप जिस परियोजना पर काम कर रहे हैं उसके बारे में और कुछ है जो आप साझा करना चाहते हैं?
एक अन्य परियोजना (इसके बारे में पढ़ें यहां और यहां) जिस पर मैंने हाल ही में काम किया है, उसमें एक बड़े बीमा कंपनी के डेटा इंजीनियरिंग निदेशक के लिए डेटाब्रिक्स यूनिफाइड एनालिटिक्स प्लेटफ़ॉर्म को सफलतापूर्वक लागू करना और एचडीआईन्साइट, एक हडोप वितरण से मशीन लर्निंग मॉडल के कार्यान्वयन को स्थानांतरित करना शामिल था।
इनमें से सभी स्थानांतरित मॉडल विभिन्न बीमा उत्पादों के लिए उपभोक्ता अपनाने की उम्मीद की स्तर की भविष्यवाणी करने के लिए अभिप्रेत थे, जिनमें से कुछ को कुछ वर्षों पहले एसएएस से स्थानांतरित किया गया था। सबसे बड़ी चुनौती खराब डेटा गुणवत्ता थी, लेकिन अन्य चुनौतियों में व्यापक संस्करणन, जनजातीय ज्ञान और अपूर्ण दस्तावेज़, और डेटाब्रिक्स के संबंध में आर का उपयोग के लिए अपरिपक्व दस्तावेज़ीकरण और समर्थन शामिल था।
इन प्रमुख चुनौतियों का समाधान करने के लिए, हमारे कार्यान्वयन कार्य के अनुवर्ती के रूप में, मैंने स्वच्छीकरण, कॉन्फ़िगरेशन और संस्करणन, डेटा चिंताओं को अलग करने, दस्तावेज़ीकरण, और उनके डेटा, प्लेटफ़ॉर्म, और मॉडलिंग टीमों के बीच संरेखण की आवश्यकता के बारे में सिफारिशें कीं। हमारा काम एक मुख्य डेटा वैज्ञानिक को यह विश्वास दिलाने में सफल रहा कि डेटाब्रिक्स रास्ता है, जिसका लक्ष्य हमारे प्रस्थान के बाद शेष मॉडलों को डेटाब्रिक्स में स्थानांतरित करना है।
यह एक दिलचस्प साक्षात्कार रहा है जो कई विषयों पर चर्चा करता है, मुझे लगता है कि मैंने ओपन सोर्स के बारे में बहुत कुछ सीखा है। पाठक जो और अधिक जानना चाहते हैं वे एसपीआर की कॉर्पोरेट वेबसाइट या एरिक जीएफेसर की वेबसाइट पर जा सकते हैं।












