विचार नेता

अपटाइम से अनुभव तक: आधुनिक ऑब्ज़रवबिलिटी में एआई-चालित बदलाव

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

2001 में, IBM ने एक स्वायत्त आईटी घोषणापत्र लिखा। ऑटोनोमिक कंप्यूटिंग का विज़न ने स्व-प्रबंधन को चार स्तंभों में विभाजित किया: स्व-ऑप्टिमाइज़ेशन, स्व-हीलिंग, स्व-कॉन्फ़िगरेशन, और स्व-प्रोटेक्शन। मैं Microsoft में था जब IBM ने इस आईटी विज़न को प्रस्तुत किया। हमने स्वायत्त डेटा सेंटर जैसी तकनीकी विचारों का प्रस्ताव रखकर प्रतिक्रिया दी, लेकिन अंततः यह एक ऐसा सपना था जो अपने समय से बहुत आगे था। उस विज़न को वास्तविकता में लाने का कोई व्यावहारिक तरीका नहीं था।

Microsoft में मेरे दिनों में, मैं Clippy टीम का हिस्सा था। हालांकि एनिमेटेड पेपरक्लिप सहायक को बदनाम रूप से बाधक माना जाता था, इसके पीछे का विचार ठोस था: कंप्यूटर को सक्रिय रूप से मनुष्यों को उनके काम करने में मदद करनी चाहिए। हमारे पास इसे संभव बनाने के लिए आवश्यक कम्प्यूटेशनल शक्ति और एआई नहीं थी। 25 साल बाद, हम अंततः इसे कर रहे हैं।

सेवा स्तर से अनुभव स्तर तक

ऑब्ज़रवबिलिटी की अवधारणा आईटी में उत्पन्न नहीं हुई। 1960 में, हंगेरियन-अमेरिकी इंजीनियर और गणितज्ञ Rudolf E. Kálmán ने प्रस्तावित किया शब्द “observability” को यह वर्णन करने के लिए कि एक प्रणाली को उसके आउटपुट द्वारा कितनी अच्छी तरह मापा जा सकता है। फिर, 2013 में, Twitter ने शब्द को अपनाया एक श्रृंखला ब्लॉग पोस्टों में, प्रभावी रूप से कहा कि पुरानी शैली की मॉनिटरिंग, सभी उपलब्ध वाणिज्यिक ऑफ‑द‑शेल्फ टूल्स के माध्यम से, एक अलग तकनीकी युग के लिए डिज़ाइन की गई थी और माइक्रोसर्विस-स्केल आर्किटेक्चर में काम नहीं करती।

इसे ऐसे सोचें जैसे डॉक्टर रोगी की जांच करता है। वह उसकी धड़कन जांच सकता है, रक्तचाप ले सकता है, और अन्य बाहरी लक्षणों को देख कर रोगी के आंतरिक स्वास्थ्य का अप्रत्यक्ष मूल्यांकन कर सकता है। आईटी में, हमें भी यही करना चाहिए। जब रोगी की धड़कन में झिलमिलाहट आती है, तो हमें पता होना चाहिए कि इसका मतलब किडनी या लिवर में समस्या है या नहीं। ट्विटर द्वारा 20 साल पहले (जब कंपनी केवल 100 मिलियन उपयोगकर्ताओं को रीयल‑टाइम ट्वीट और फ़ीड्स प्रदान कर रही थी) संभाली जा रही संचालन की पैमाने और जटिलता के कारण, ऑब्ज़रवबिलिटी को अलग टूलिंग और मॉनिटरिंग दृष्टिकोण की आवश्यकता थी।

आज के सिस्टम और भी बड़े और अधिक जटिल हो गए हैं, जिनकी निर्भरताएँ कंटेंट डिलीवरी नेटवर्क, कैशिंग और बिटमैप्स, फ़ॉन्ट्स, JavaScript फ़ाइलों आदि पर पूरी दुनिया में हैं। वास्तविक दुनिया के अनुप्रयोगों के प्रदर्शन को पूरी तरह समझना आसान काम नहीं है।

जब आईटी को सुबह 4 बजे पेज किया जाता है, तो किसी को बिस्तर से उठकर यह पता लगाना पड़ता है कि समस्या हार्ड ड्राइव के खराब सेक्टर के कारण है या किसी दुष्ट अभिनेता के कारण जो इन्फ्रास्ट्रक्चर में घुसपैठ करके हंगामा पैदा करने की कोशिश कर रहा है। अंततः यह मायने नहीं रखता कि कौन सी समस्या है: दिन के अंत में उनका काम सभी सिस्टम को चलाते रहना है। सौभाग्य से, आज एप्लिकेशन स्वास्थ्य का मूल्यांकन करने के लिए, हम सभी उपलब्ध टेलीमेट्री को ले सकते हैं: प्रत्येक नेटवर्क डिवाइस, प्रत्येक एप्लिकेशन, हजारों आउट‑ऑफ़‑द‑बॉक्स इंटीग्रेशन, JIRA या Atlassian के माध्यम से टिकट प्रवाह, और कई अन्य संकेत।

यहीं पर Experience Level Objectives (XLOs) काम आते हैं। आपने संभवतः Service Level Agreements (SLAs) और Service Level Objectives (SLOs) के बारे में सुना होगा, लेकिन XLOs अगला कदम उठाते हैं यह मापकर कि आपके ग्राहक और कर्मचारी वह अनुभव स्तर प्राप्त कर रहे हैं जो वे चाहते हैं। यह केवल अपटाइम नहीं, बल्कि गुणवत्ता के बारे में है। तकनीकी दृष्टिकोण से, XLOs को हासिल करने का एकमात्र तरीका NIC से अंत‑उपयोगकर्ता डिवाइस तक दृश्यता होना है।

पिछले अक्टूबर में, AWS US‑EAST‑1 बंद हो गया। Catchpoint ने इस समस्या का पता 16 मिनट पहले लगाया, जब Amazon ने इसे सार्वजनिक रूप से स्वीकार किया। इस दृश्यता वाले ग्राहक उपयोगकर्ताओं को आउटेज के परिणाम महसूस होने से पहले ही प्रतिक्रिया दे सके।

ऑब्ज़रवबिलिटी का वादा Smokey Bear जैसा है: आग लगने से पहले धुआँ कहाँ है, इसका पता लगाना। सही ढंग से किया जाए तो, ऑब्ज़रवबिलिटी आपको प्रेरी में जलती हुई आग को तब बुझाने देती है जब वह कैलिफ़ोर्निया में Palisades को नष्ट करने वाली बड़ी आग बनने से पहले ही हो। Smokey एक प्रारंभिक चेतावनी प्रणाली है जो छोटे‑छोटे धुएँ के संकेतों का पता लगा सकती है, चाहे वे कहीं से भी आएँ: AWS समस्या, Oracle समस्या, GCP समस्या, Microsoft Azure समस्या, या आपके इन्फ्रास्ट्रक्चर में कुछ गड़बड़।

एआई सुरक्षा प्रणालियों को स्केल करता है

कोई भी मानव ऑपरेटर आज के इन्फ्रास्ट्रक्चर सिस्टमों पर नज़र नहीं रख सकता। स्केल पर सिस्टमों की निगरानी करने, प्रतिदिन पेटाबाइट लॉग डेटा और ट्रिलियन मीट्रिक को इन्जेस्ट करने का एकमात्र तरीका एआई का उपयोग है।

उदाहरण के लिए, मान लीजिए आप डिस्क की पढ़ने/लिखने की प्रदर्शन या अपने नेटवर्किंग वातावरण में इनपुट/आउटपुट या पैकेट बफ़र ओवररन को ट्रैक करना चाहते हैं। आप एक डायनामिक थ्रेशोल्ड का उपयोग करके यह परिभाषित कर सकते हैं कि सामान्य क्या दिखता है, या एक निर्धारक तरीका अपनाकर पिछले सप्ताह, महीने, वर्ष या किसी भी समयावधि के टाइम सीरीज़ डेटा को देख सकते हैं, और सामान्य प्रदर्शन थ्रेशोल्ड स्थापित कर सकते हैं। एक बार जब आपके पास यह सांख्यिकीय विश्लेषण हो जाता है, तो आप औसत से दो मानक विचलन के स्तर सेट कर सकते हैं, ताकि जब कुछ इस सीमा के बाहर हो, तो आपको एक अलर्ट मिले कि प्रदर्शन संभावित रूप से असामान्य है।

हालांकि, अत्यधिक जटिल सिस्टम प्रतिदिन हजारों अलर्ट प्राप्त कर सकते हैं। डैशबोर्ड चमकने लगते हैं, और लोग पेज़ प्राप्त करने लगते हैं। इन सभी अलर्टों को छाँटना मानव समय का अच्छा उपयोग नहीं है। वास्तव में, Vectra अनुमान लगाता है कि संगठन औसतन 2,992 सुरक्षा अलर्ट प्रतिदिन प्राप्त करते हैं, जिनमें से 63 % अनसुलझे रह जाते हैं।

AI उपकरण इन हजारों दैनिक अलर्ट को केवल कुछ दर्जन तक घटा सकते हैं। मुझे एक मामला याद है जहाँ एक ही मशीन के एक ही NIC पर एक ही समस्या ने 2,000 नीचे की ओर अलर्ट उत्पन्न किए। AI की मदद से, ग्राहक ने अलर्ट को सम्बद्ध किया और बहुत तेज़ मूल कारण विश्लेषण किया, जिससे यह निष्कर्ष निकला कि उस एक समय पर एक ही समस्या कंपनी के पूरे डैशबोर्ड को लाल कर रही थी।

AI फिर से IT को रोमांचक बना रहा है

Cisco ने 2023 में Splunk का अधिग्रहण करने के बाद मैंने कुछ समय अवकाश लिया। अगले दो वर्षों में, मैंने देखा कि मेरे मित्र और पूर्व सहयोगियों ने ऐसी कंपनियों की स्थापना की जो AI का उपयोग ऐसे तरीकों से करती थीं जो पाँच साल पहले भी संभव नहीं थे। (याद रखें कि यदि ChatGPT एक मानव बच्चा होता, तो वह तीन साल का होता)।

IT टीमों को अलार्म बजने से पहले धुआँ पहचानने में मदद चाहिए, न कि अधिक डैशबोर्ड्स पर नज़र रखने की। वे। एक तरह से, यह वही समस्या है जिसे IBM, Twitter, और यहाँ तक कि Clippy वाले Microsoft ने भी हल करने की कोशिश की है।

यही कारण है कि मैंने फिर से इसमें कूदने का फैसला किया। तकनीक अंततः उस स्तर पर पहुँच गई है जहाँ हम अवलोकनीयता और स्वायत्त IT के मूल वादे को पूरा कर सकते हैं।

Garth Fort LogicMonitor में मुख्य उत्पाद अधिकारी हैं, जहाँ वह कंपनी के AI‑संचालित अवलोकन प्लेटफ़ॉर्म, LM Envision के लिए वैश्विक उत्पाद रणनीति और निष्पादन का नेतृत्व करते हैं। एक अनुभवी प्रौद्योगिकी कार्यकारी के रूप में, Garth के पास 20 से अधिक वर्षों का अनुभव है, जिसमें उन्होंने उत्पाद नवाचार, व्यवसाय वृद्धि, और क्लाउड परिवर्तन को विश्व की कुछ सबसे सम्मानित एंटरप्राइज़ सॉफ़्टवेयर कंपनियों में संचालित किया है।