एआई की मूल बातें
डेटा साइंस क्या है?
डेटा साइंस का क्षेत्र हर दिन बड़ा और अधिक लोकप्रिय होता जा रहा है। लिंक्डइन के अनुसार, डेटा साइंस 2017 में सबसे तेजी से बढ़ने वाले नौकरी क्षेत्रों में से एक था और 2020 में ग्लासडोर ने डेटा साइंस की नौकरी को संयुक्त राज्य अमेरिका में तीन सर्वश्रेष्ठ नौकरियों में से एक के रूप में स्थान दिया। डेटा साइंस की बढ़ती लोकप्रियता को देखते हुए, यह कोई आश्चर्य की बात नहीं है कि अधिक से अधिक लोग इस क्षेत्र में रुचि ले रहे हैं। फिर भी, डेटा साइंस वास्तव में क्या है?
आइए डेटा साइंस से परिचित हों, डेटा साइंस की परिभाषा को समझने के लिए कुछ समय लें, बड़ा डेटा और कृत्रिम बुद्धिमत्ता के साथ इसके परिवर्तन को सीखें, कुछ सामान्य डेटा साइंस टूल्स के बारे में जानें, और डेटा साइंस के कुछ उदाहरणों का अन्वेषण करें।
डेटा साइंस क्या है?
डेटा साइंस टूल्स और उदाहरणों का अन्वेषण करने से पहले, हमें डेटा साइंस की संक्षिप्त परिभाषा प्राप्त करनी होगी।
“डेटा साइंस” को परिभाषित करना वास्तव में थोड़ा मुश्किल है, क्योंकि इस शब्द का उपयोग कई अलग-अलग कार्यों और जांच और विश्लेषण की विधियों के लिए किया जाता है। हम “विज्ञान” शब्द के अर्थ को याद दिलाकर शुरू कर सकते हैं। विज्ञान प्राकृतिक और प्राकृतिक दुनिया का प्रणालीगत अध्ययन है, जो प्राकृतिक प्रक्रियाओं की मानवीय समझ को आगे बढ़ाने के उद्देश्य से अवलोकन और प्रयोग के माध्यम से किया जाता है। उस परिभाषा में महत्वपूर्ण शब्द “अवलोकन” और “समझ” हैं।
यदि डेटा साइंस डेटा में पैटर्न से दुनिया को समझने की प्रक्रिया है, तो एक डेटा वैज्ञानिक की जिम्मेदारी डेटा को बदलने, डेटा का विश्लेषण करने और डेटा से पैटर्न निकालने की है। दूसरे शब्दों में, एक डेटा वैज्ञानिक को डेटा प्रदान किया जाता है और वे विभिन्न टूल्स और तकनीकों का उपयोग करके डेटा को विश्लेषण के लिए तैयार करते हैं और फिर डेटा में अर्थपूर्ण पैटर्न के लिए विश्लेषण करते हैं।
एक डेटा वैज्ञानिक की भूमिका पारंपरिक वैज्ञानिक की भूमिका के समान है। दोनों डेटा के विश्लेषण से चिंतित हैं ताकि वे दुनिया के संचालन के बारे में सिद्धांतों का समर्थन या अस्वीकार कर सकें, दुनिया की समझ में सुधार करने के लिए डेटा में पैटर्न को समझने का प्रयास करें। डेटा वैज्ञानिक पारंपरिक वैज्ञानिक द्वारा उपयोग की जाने वाली समान वैज्ञानिक विधियों का उपयोग करते हैं। एक डेटा वैज्ञानिक कुछ घटना के बारे में अवलोकन एकत्र करके शुरू करता है जिसे वे अध्ययन करना चाहते हैं। वे तब घटना के बारे में एक सिद्धांत बनाने का प्रयास करते हैं और डेटा खोजने का प्रयास करते हैं जो उनके सिद्धांत को कुछ तरीके से अस्वीकार कर देता है।
यदि सिद्धांत डेटा द्वारा विरोध नहीं किया जाता है, तो वे घटना के बारे में एक सिद्धांत या मॉडल बनाने में सक्षम हो सकते हैं, जिसे वे बार-बार परीक्षण कर सकते हैं कि क्या यह अन्य समान डेटासेट के लिए सच है। यदि एक मॉडल पर्याप्त रूप से मजबूत है, तो यदि यह पैटर्न को अच्छी तरह से समझाता है और अन्य परीक्षणों के दौरान अस्वीकार नहीं किया जाता है, तो इसका उपयोग भविष्य की घटनाओं की भविष्यवाणी करने के लिए भी किया जा सकता है।
एक डेटा वैज्ञानिक आमतौर पर प्रयोग के माध्यम से अपना डेटा एकत्र नहीं करता है। वे आमतौर पर नियंत्रण और दोहरे अंधे परीक्षणों के साथ प्रयोग डिजाइन नहीं करते हैं जो सिद्धांत के साथ हस्तक्षेप कर सकते हैं। एक डेटा वैज्ञानिक द्वारा विश्लेषण किए जाने वाले अधिकांश डेटा अवलोकन अध्ययन और प्रणालियों के माध्यम से प्राप्त किए जाते हैं, जो एक डेटा वैज्ञानिक की नौकरी को पारंपरिक वैज्ञानिक की नौकरी से अलग कर सकते हैं, जो आमतौर पर अधिक प्रयोग करते हैं।
हालांकि, एक डेटा वैज्ञानिक को ए/बी परीक्षण नामक एक प्रयोग करने के लिए कहा जा सकता है, जहां डेटा एकत्र करने वाली प्रणाली में छोटे बदलाव किए जाते हैं ताकि यह देखा जा सके कि डेटा पैटर्न कैसे बदलते हैं।
प्रयुक्त तकनीकों और टूल्स की परवाह किए बिना, डेटा साइंस अंततः अवलोकन और प्रयोग के माध्यम से प्राप्त डेटा को समझने से दुनिया की हमारी समझ में सुधार करने का लक्ष्य रखता है। डेटा साइंस डेटा से अंतर्दृष्टि निकालने की प्रक्रिया है, जो हमें दुनिया के आसपास के पैटर्न को समझने में मदद करती है।
डेटा वैज्ञानिक क्या करते हैं?
आप देख सकते हैं कि डेटा के विश्लेषण में शामिल कोई भी गतिविधि जो वैज्ञानिक तरीके से की जाती है, उसे डेटा साइंस कहा जा सकता है, जो इसे परिभाषित करना मुश्किल बनाता है। स्पष्टता के लिए, आइए उन गतिविधियों का अन्वेषण करें जो एक डेटा वैज्ञानिक दैनिक आधार पर कर सकता है।

डेटा साइंस कई अलग-अलग अनुशासनों और विशेषज्ञता को एक साथ लाता है। फोटो: कैल्विन एंड्रस विकिमीडिया कॉमन्स के माध्यम से
किसी भी दिन, एक डेटा वैज्ञानिक से पूछा जा सकता है: डेटा स्टोरेज और पुनर्प्राप्ति योजना बनाने के लिए, डेटा ईटीएल (निकालने, परिवर्तित करने, लोड करने) पाइपलाइन बनाने और डेटा को साफ करने के लिए, सांख्यिकीय तरीकों का उपयोग करने के लिए, डेटा दृश्यीकरण और डैशबोर्ड बनाने के लिए, कृत्रिम बुद्धिमत्ता और मशीन लर्निंग एल्गोरिदम लागू करने के लिए, डेटा पर आधारित कार्रवाई की सिफारिशें करने के लिए।
उपरोक्त कार्यों को थोड़ा और तोड़ दें।
एक डेटा वैज्ञानिक को डेटा को संग्रहीत और पुनर्प्राप्त करने के लिए प्रौद्योगिकियों की स्थापना को संभालने की आवश्यकता हो सकती है, दोनों हार्डवेयर और सॉफ्टवेयर पर ध्यान देते हुए। इस पद के लिए जिम्मेदार व्यक्ति को ” डेटा इंजीनियर ” के रूप में भी जाना जा सकता है। हालांकि, कुछ कंपनियां डेटा वैज्ञानिकों की भूमिका के तहत इन जिम्मेदारियों को शामिल करती हैं। एक डेटा वैज्ञानिक को ईटीएल पाइपलाइन बनाने या सहायता करने की आवश्यकता हो सकती है। डेटा शायद ही कभी डेटा वैज्ञानिक के लिए आवश्यक रूप में स्वरूपित होता है। इसके बजाय, डेटा को डेटा स्रोत से कच्चे रूप में प्राप्त किया जाना चाहिए, एक उपयोगी प्रारूप में परिवर्तित किया जाना चाहिए और पूर्व-प्रसंस्करण किया जाना चाहिए (जैसे डेटा को मानकीकृत करना, लालीनता को हटाना और दूषित डेटा को हटाना)।
डेटा साइंस के सांख्यिकीय तरीके
डेटा साइंस में सांख्यिकी का अनुप्रयोग डेटा को देखने और व्याख्या करने से वास्तविक विज्ञान में बदलने के लिए आवश्यक है। सांख्यिकीय तरीकों का उपयोग डेटासेट से प्रासंगिक पैटर्न निकालने के लिए किया जाता है, और एक डेटा वैज्ञानिक को सांख्यिकीय अवधारणाओं में महारत हासिल करनी चाहिए। उन्हें भ्रामक संबंधों से अर्थपूर्ण संबंधों को नियंत्रित करने वाले चर के लिए अलग करने में सक्षम होना चाहिए। उन्हें यह भी पता होना चाहिए कि अपने मॉडल में कौन सी विशेषताएं महत्वपूर्ण हैं और कौन से टूल का उपयोग करना है। एक डेटा वैज्ञानिक को पता होना चाहिए कि कब रिग्रेशन दृष्टिकोण का उपयोग करना है और कब वर्गीकरण दृष्टिकोण का उपयोग करना है, और कब नमूने के माध्य की तुलना में नमूने के मध्य मान की परवाह करनी है।
डेटा दृश्यीकरण
एक डेटा वैज्ञानिक के काम का एक महत्वपूर्ण हिस्सा अपने निष्कर्षों को दूसरों के साथ संवाद करना है। यदि एक डेटा वैज्ञानिक अपने निष्कर्षों को दूसरों के साथ प्रभावी ढंग से संवाद नहीं कर सकता है, तो उनके निष्कर्षों के परिणामों की परवाह नहीं है। एक डेटा वैज्ञानिक को एक प्रभावी कहानीकार भी होना चाहिए। इसका अर्थ है डेटासेट और इसके भीतर खोजे गए पैटर्न के बारे में प्रासंगिक बिंदुओं को संवाद करने वाले दृश्यीकरण का उत्पादन करना। एक डेटा वैज्ञानिक द्वारा उपयोग किए जाने वाले कई अलग-अलग डेटा दृश्यीकरण टूल हैं, और वे डेटा को प्रारंभिक, मूलभूत अन्वेषण (अन्वेषणात्मक डेटा विश्लेषण) के उद्देश्यों के लिए या मॉडल द्वारा उत्पादित परिणामों को दृश्य化 करने के लिए दृश्य化 कर सकते हैं।
सिफारिशें और व्यावसायिक अनुप्रयोग
एक डेटा वैज्ञानिक को अपने संगठन या व्यवसाय की आवश्यकताओं और लक्ष्यों की कुछ जानकारी होनी चाहिए। एक डेटा वैज्ञानिक को इन चीजों को समझने की आवश्यकता है क्योंकि उन्हें यह जानने की आवश्यकता है कि वे किन प्रकार के चर और विशेषताओं का विश्लेषण करना चाहिए, जो उनके संगठन को अपने लक्ष्यों को प्राप्त करने में मदद करेंगे। डेटा वैज्ञानिक को उन प्रतिबंधों के बारे में जागरूक होना चाहिए जिनके तहत वे काम कर रहे हैं और जो धारणाएं संगठन के नेतृत्व कर रहे हैं।
मशीन लर्निंग और एआई
मशीन लर्निंग और अन्य कृत्रिम बुद्धिमत्ता एल्गोरिदम और मॉडल डेटा वैज्ञानिकों द्वारा डेटा का विश्लेषण करने, डेटा में पैटर्न की पहचान करने, चर के बीच संबंधों का पता लगाने और भविष्य की घटनाओं की भविष्यवाणी करने के लिए उपयोग किए जाने वाले टूल हैं।
पारंपरिक डेटा साइंस बनाम बिग डेटा साइंस
जैसे-जैसे डेटा संग्रह विधियां अधिक परिष्कृत हुईं और डेटाबेस बड़े हुए, पारंपरिक डेटा साइंस और “बिग डेटा” साइंस के बीच एक अंतर उत्पन्न हुआ।
पारंपरिक डेटा विश्लेषण और डेटा साइंस विवरणात्मक और अन्वेषणात्मक विश्लेषण के साथ किया जाता है, जिसका उद्देश्य पैटर्न खोजना और परियोजनाओं के प्रदर्शन परिणामों का विश्लेषण करना है। पारंपरिक डेटा विश्लेषण विधियां अक्सर केवल अतीत के डेटा और वर्तमान डेटा पर ध्यान केंद्रित करती हैं। डेटा विश्लेषक अक्सर पहले से साफ और मानकीकृत डेटा के साथ काम करते हैं, जबकि डेटा वैज्ञानिक अक्सर जटिल और गंदे डेटा के साथ काम करते हैं। अधिक उन्नत डेटा विश्लेषण और डेटा साइंस तकनीकों का उपयोग भविष्य के व्यवहार की भविष्यवाणी करने के लिए किया जा सकता है, हालांकि यह अधिक बार बिग डेटा के साथ किया जाता है, क्योंकि भविष्यवाणी मॉडल अक्सर निर्माण के लिए बड़ी मात्रा में डेटा की आवश्यकता होती है।
“बिग डेटा” डेटा को संदर्भित करता है जो पारंपरिक डेटा विश्लेषण और विज्ञान तकनीकों और टूल्स के साथ संभाला और संभाला नहीं जा सकता है। बिग डेटा अक्सर ऑनलाइन प्लेटफ़ॉर्म और उन्नत डेटा परिवर्तन टूल्स के माध्यम से एकत्र किया जाता है, जो बड़ी मात्रा में डेटा को डेटा विज्ञान द्वारा निरीक्षण के लिए तैयार करते हैं। जैसा कि अधिक से अधिक डेटा एकत्र किया जाता है, एक डेटा वैज्ञानिक का अधिक काम बिग डेटा का विश्लेषण करना शामिल करता है।
डेटा साइंस टूल
सामान्य डेटा साइंस टूल में डेटा संग्रहीत करने, अन्वेषणात्मक डेटा विश्लेषण करने, डेटा मॉडल करने, ईटीएल करने और डेटा दृश्यीकरण करने के लिए टूल शामिल हैं। अमेज़न वेब सेवाएं, माइक्रोसॉफ्ट एज़्योर और गूगल क्लाउड जैसे प्लेटफ़ॉर्म डेटा वैज्ञानिकों को डेटा संग्रहीत करने, परिवर्तित करने, विश्लेषण करने और मॉडल करने में मदद करने के लिए टूल प्रदान करते हैं। एयरफ्लो (डेटा इन्फ्रास्ट्रक्चर) और टेबलो (डेटा दृश्यीकरण और विश्लेषण) जैसे स्टैंडअलोन डेटा साइंस टूल भी हैं।
मशीन लर्निंग और कृत्रिम बुद्धिमत्ता एल्गोरिदम के संदर्भ में, जो डेटा को मॉडल करने के लिए उपयोग किए जाते हैं, वे अक्सर टेंसोरफ्लो, पायटॉर्च और एज़्योर मशीन-लर्निंग स्टूडियो जैसे डेटा साइंस मॉड्यूल और प्लेटफ़ॉर्म के माध्यम से प्रदान किए जाते हैं। इन प्लेटफ़ॉर्म के माध्यम से, डेटा वैज्ञानिक अपने डेटासेट में संपादन कर सकते हैं, मशीन लर्निंग आर्किटेक्चर की रचना कर सकते हैं और मशीन लर्निंग मॉडल को प्रशिक्षित कर सकते हैं।
अन्य सामान्य डेटा साइंस टूल और लाइब्रेरी में एसएएस (सांख्यिकीय मॉडलिंग के लिए), अपाचे स्पार्क (स्ट्रीमिंग डेटा के विश्लेषण के लिए), डी3.जेएस (ब्राउज़र में इंटरैक्टिव दृश्यीकरण के लिए) और जूपिटर (इंटरैक्टिव, साझा कोड ब्लॉक और दृश्यीकरण के लिए) शामिल हैं।

फोटो: सियोनजे जो फ़्लिकर के माध्यम से
डेटा साइंस के उदाहरण
डेटा साइंस और इसके अनुप्रयोग हर जगह हैं। डेटा साइंस का अनुप्रयोग भोजन वितरण, खेल, यातायात और स्वास्थ्य जैसी चीजों में है। डेटा हर जगह है और इसलिए डेटा साइंस को सब कुछ में लागू किया जा सकता है।
भोजन के संदर्भ में, उबेर अपनी सवारी साझा करने वाली प्रणाली में विस्तार पर काम कर रहा है जो भोजन वितरण पर केंद्रित है, उबेर ईट्स। उबेर ईट्स को लोगों को उनका भोजन समय पर, गर्म और ताज़ा देने की आवश्यकता है। इसे होने के लिए, कंपनी के डेटा वैज्ञानिकों को दूरी, रेस्तरां से वितरण बिंदुओं तक, छुट्टी की भीड़, खाना पकाने का समय और यहां तक कि मौसम की स्थिति जैसे पहलुओं पर विचार करते हुए सांख्यिकीय मॉडलिंग का उपयोग करने की आवश्यकता है ताकि वितरण समय को अनुकूलित किया जा सके।
खेल आँकड़ों का उपयोग टीम प्रबंधक द्वारा सर्वश्रेष्ठ खिलाड़ियों का निर्धारण करने और मजबूत, विश्वसनीय टीम बनाने के लिए किया जाता है जो खेल जीतेंगे। एक उल्लेखनीय उदाहरण माइकल लुईस द्वारा पुस्तक मनीबॉल में दस्तावेज़ किया गया है, जहां ओकलैंड एथलेटिक्स टीम के महाप्रबंधक ने कम लागत पर हस्ताक्षर करने के लिए गुणवत्ता वाले खिलाड़ियों की पहचान करने के लिए विभिन्न आँकड़ों का विश्लेषण किया।
यातायात पैटर्न का विश्लेषण स्व-ड्राइविंग वाहनों के निर्माण के लिए महत्वपूर्ण है। स्व-ड्राइविंग वाहनों को अपने आसपास की गतिविधि की भविष्यवाणी करने और सड़क की स्थिति में परिवर्तनों के प्रति प्रतिक्रिया करने में सक्षम होना चाहिए, जैसे कि बारिश होने पर रोकने के लिए आवश्यक दूरी में वृद्धि और भीड़भाड़ वाले घंटे के दौरान सड़क पर अधिक कारें। स्व-ड्राइविंग वाहनों से परे, गूगल मैप्स जैसे ऐप यातायात पैटर्न का विश्लेषण करते हैं ताकि यह बता सकें कि विभिन्न मार्गों और परिवहन के साधनों का उपयोग करके गंतव्य तक पहुंचने में कितना समय लगेगा।
स्वास्थ्य डेटा साइंस में, कंप्यूटर दृष्टि को अक्सर मशीन लर्निंग और अन्य एआई तकनीकों के साथ मिलाकर एक्स-रे, एफएमआरआई और अल्ट्रासाउंड जैसी चीजों की जांच करने में सक्षम छवि वर्गीकरणकर्ता बनाने के लिए उपयोग किया जाता है ताकि यह देखा जा सके कि क्या चिकित्सा समस्याएं हैं जो स्कैन में दिखाई दे सकती हैं। इन एल्गोरिदम का उपयोग चिकित्सकों को बीमारी का निदान करने में मदद करने के लिए किया जा सकता है।
अंततः, डेटा साइंस कई गतिविधियों को कवर करता है और विभिन्न अनुशासनों को एक साथ लाता है। हालांकि, डेटा साइंस हमेशा डेटा से आकर्षक, दिलचस्प कहानियों को बताने और दुनिया को बेहतर ढंग से समझने के लिए डेटा का उपयोग करने से संबंधित होता है।












