एआई मॉडल और प्लेटफ़ॉर्म

बड़ा डेटा क्या है?

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

बड़ा डेटा क्या है?

“बड़ा डेटा” हमारे वर्तमान युग के सामान्य रूप से उपयोग किए जाने वाले शब्दों में से एक है, लेकिन इसका वास्तव में क्या अर्थ है?

बड़े डेटा की एक त्वरित, सरल परिभाषा यह है। बड़ा डेटा वह डेटा है जो पारंपरिक डेटा प्रोसेसिंग और स्टोरेज विधियों द्वारा संभाला नहीं जा सकता है। जबकि यह एक त्वरित परिभाषा है जिसका उपयोग आप एक सूत्र के रूप में कर सकते हैं, बड़े डेटा की एक गहरी, अधिक पूर्ण समझ प्राप्त करना उपयोगी होगा। आइए बड़े डेटा के अंतर्निहित कुछ अवधारणाओं पर एक नज़र डालें, जैसे कि स्टोरेज, संरचना, और प्रोसेसिंग।

बड़ा डेटा कितना बड़ा है?

यह इतना सरल नहीं है कि कहा जा सके कि “किसी भी डेटा का आकार ‘एक्स’ से बड़ा है तो यह बड़ा डेटा है”, डेटा को संभाले जा रहे वातावरण एक अत्यंत महत्वपूर्ण कारक है बड़े डेटा को निर्धारित करने में। बड़े डेटा के लिए आवश्यक आकार डेटा के संदर्भ या कार्य पर निर्भर करता है जिसमें इसका उपयोग किया जा रहा है। दो डेटासेट जो आकार में बहुत भिन्न हो सकते हैं, विभिन्न संदर्भों में “बड़े डेटा” माने जा सकते हैं।

अधिक स्पष्ट रूप से, यदि आप 200-मेगाबाइट फ़ाइल को ईमेल के रूप में भेजने का प्रयास करते हैं, तो आप ऐसा नहीं कर पाएंगे। इस संदर्भ में, 200-मेगाबाइट फ़ाइल को बड़ा डेटा माना जा सकता है। इसके विपरीत, एक ही लैन के भीतर एक डिवाइस से दूसरे डिवाइस पर 200-मेगाबाइट फ़ाइल की प्रतिलिपि बनाने में कोई समय नहीं लगेगा, और इस संदर्भ में, यह बड़ा डेटा नहीं माना जाएगा।

हालांकि, मान लें कि 15 टेराबाइट के वीडियो को कंप्यूटर विजन अनुप्रयोगों में प्रशिक्षण के लिए प्री-प्रोसेस करने की आवश्यकता है। इस मामले में, वीडियो फ़ाइलें इतनी जगह लेती हैं कि एक शक्तिशाली कंप्यूटर को भी उन सभी को संसाधित करने में बहुत समय लगेगा, और इसलिए संसाधित करने के लिए सामान्य रूप से कई कंप्यूटरों को एक साथ जोड़ दिया जाएगा ताकि संसाधित करने का समय कम हो जाए। इन 15 टेराबाइट के वीडियो डेटा को निश्चित रूप से बड़ा डेटा माना जाएगा।

बड़े डेटा संरचनाओं के प्रकार

बड़ा डेटा तीन प्रकार की संरचनाओं में आता है: अनस्ट्रक्चर्ड डेटा, सेमी-स्ट्रक्चर्ड, और स्ट्रक्चर्ड डेटा।

अनस्ट्रक्चर्ड डेटा वह डेटा है जिसमें कोई परिभाषित संरचना नहीं है, जिसका अर्थ है कि डेटा मूल रूप से एक बड़े पूल में है। अनस्ट्रक्चर्ड डेटा के उदाहरणों में अनलेबल्ड छवियों से भरा डेटाबेस हो सकता है।

सेमी-स्ट्रक्चर्ड डेटा वह डेटा है जिसमें कोई औपचारिक संरचना नहीं है, लेकिन एक ढीली संरचना के भीतर मौजूद है। उदाहरण के लिए, ईमेल डेटा सेमी-स्ट्रक्चर्ड डेटा हो सकता है, क्योंकि आप व्यक्तिगत ईमेल में निहित डेटा को संदर्भित कर सकते हैं, लेकिन औपचारिक डेटा पैटर्न स्थापित नहीं किए गए हैं।

स्ट्रक्चर्ड डेटा वह डेटा है जिसमें एक औपचारिक संरचना है, जिसमें डेटा बिंदु विभिन्न विशेषताओं द्वारा वर्गीकृत किए जाते हैं। स्ट्रक्चर्ड डेटा का एक उदाहरण एक एक्सेल स्प्रेडशीट हो सकता है जिसमें नाम, ईमेल, फोन नंबर, और वेबसाइट जैसी संपर्क जानकारी होती है।

यदि आप इन डेटा प्रकारों के अंतर के बारे में अधिक पढ़ना चाहते हैं, तो यहां दिए गए लिंक पर क्लिक करें।

बड़े डेटा का मूल्यांकन करने के लिए मेट्रिक्स

बड़े डेटा का विश्लेषण तीन अलग-अलग मेट्रिक्स के संदर्भ में किया जा सकता है: वॉल्यूम, वेलोसिटी, और वेराइटी。

वॉल्यूम डेटा के आकार को संदर्भित करता है। औसतन डेटासेट का आकार बढ़ रहा है। उदाहरण के लिए, 2006 में सबसे बड़ा हार्ड ड्राइव 750 जीबी का था। इसके विपरीत, फेसबुक प्रतिदिन 500 टेराबाइट से अधिक डेटा उत्पन्न करने के लिए सोचा जाता है और आज उपलब्ध सबसे बड़ा कंज्यूमर हार्ड ड्राइव 16 टेराबाइट का है। एक युग में जो बड़ा डेटा माना जाता है वह दूसरे युग में बड़ा डेटा नहीं हो सकता है। आज अधिक डेटा उत्पन्न किया जाता है क्योंकि हमारे आसपास के अधिक वस्तुओं में सेंसर, कैमरे, माइक्रोफोन, और अन्य डेटा संग्रह उपकरण हैं।

वेलोसिटी डेटा की गति को संदर्भित करता है, या दूसरे शब्दों में, एक निश्चित अवधि में कितना डेटा उत्पन्न किया जाता है। सोशल मीडिया स्ट्रीम प्रति मिनट सैकड़ों हजारों पोस्ट और टिप्पणियां उत्पन्न करती हैं, जबकि आपका अपना ईमेल इनबॉक्स शायद बहुत कम गतिविधि होगी। बड़े डेटा स्ट्रीम वे स्ट्रीम होते हैं जो अक्सर वास्तविक समय में सैकड़ों हजारों या लाखों घटनाओं को संभालते हैं। इन डेटा स्ट्रीम के उदाहरण ऑनलाइन गेमिंग प्लेटफ़ॉर्म और हाई-फ़्रीक्वेंसी स्टॉक ट्रेडिंग एल्गोरिदम हैं।

वेराइटी डेटा में निहित विभिन्न प्रकार के डेटा को संदर्भित करता है। डेटा कई प्रारूपों में हो सकता है, जैसे कि ऑडियो, वीडियो, टेक्स्ट, फोटो, या सीरियल नंबर।一般 रूप से, पारंपरिक डेटाबेस एक या दो प्रकार के डेटा को संभालने के लिए बनाए जाते हैं। दूसरे शब्दों में, पारंपरिक डेटाबेस समान और अनुमानित संरचना वाले डेटा को संभालने के लिए बनाए जाते हैं। जैसे-जैसे अनुप्रयोग अधिक विविध, विशेषताओं से भरे हुए, और अधिक लोगों द्वारा उपयोग किए जाते हैं, डेटाबेस को अधिक प्रकार के डेटा को स्टोर करने के लिए विकसित किया गया है। अनस्ट्रक्चर्ड डेटाबेस बड़े डेटा को स्टोर करने के लिए आदर्श होते हैं क्योंकि वे एक दूसरे से संबंधित नहीं होने वाले कई डेटा प्रकारों को स्टोर कर सकते हैं।

बड़े डेटा को संभालने के तरीके

बड़े डेटा के विश्लेषण को सुविधाजनक बनाने के लिए कई प्लेटफ़ॉर्म और टूल्स डिज़ाइन किए गए हैं। बड़े डेटा पूल का विश्लेषण करना आवश्यक है ताकि डेटा से अर्थपूर्ण पैटर्न निकाले जा सकें, जो एक कार्य साबित हो सकता है जो पारंपरिक डेटा विश्लेषण टूल्स के साथ चुनौतीपूर्ण है। बड़े डेटा के विश्लेषण के लिए टूल्स की आवश्यकता के जवाब में, कई कंपनियों ने बड़े डेटा विश्लेषण टूल्स बनाए हैं। बड़े डेटा विश्लेषण टूल्स में ज़ोहो एनालिटिक्स, क्लाउडेरा, और माइक्रोसॉफ्ट बीआई जैसे सिस्टम शामिल हैं।

ब्लॉगर और प्रोग्रामर जिनकी विशेषज्ञता मैशीन लर्निंग और डीप लर्निंग विषयों में है। डैनियल दूसरों को सामाजिक कल्याण के लिए एआई की शक्ति का उपयोग करने में मदद करना चाहता है।