साइबर सुरक्षा

Lava ने हजारों उजागर GPU सर्वर और NVIDIA मॉनिटरिंग में उच्च-गंभीरता वाली त्रुटि पाई

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें
Conceptual illustration of AI server racks and a monitoring lens inside a network boundary, with telemetry escaping through a gap.

AI मॉडल के पीछे की बुनियादी संरचना किसी के इसमें घुसने से पहले ही आश्चर्यजनक मात्रा में जानकारी उजागर कर सकती है। एक सार्वजनिक मॉनिटरिंग एंडपॉइंट सर्वर में मौजूद GPU, उनकी उपयोगिता और उनके आसपास के सॉफ़्टवेयर को प्रकट कर सकता है। उसी मॉनिटरिंग सेवा में मौजूद एक त्रुटि दृश्यता को उपलब्धता जोखिम में बदल सकती है।

Lava का नया शोध, जो 8 अक्टूबर को जारी किया गया, दोनों समस्याओं का वर्णन करता है। सुरक्षा कंपनी ने लगभग 2,100 सार्वजनिक रूप से सुलभ NVIDIA DCGM Exporter होस्ट पहचाने, जो बिना प्रमाणीकरण के 12,000 से अधिक अनन्य GPU रिपोर्ट कर रहे थे। अपनी जांच के दौरान, Lava ने एक उच्च-गंभीरता वाली कमजोरी भी खोजी, जो अनप्रमाणित हमलावर को संसाधनों को समाप्त करने और GPU मॉनिटरिंग को क्रैश करने की अनुमति दे सकती है।

NVIDIA ने इस मुद्दे को CVE-2026-47483 सौंपा है, इसे 8.2, उच्च रेटिंग दी है, और एक अपडेट जारी किया है। ये खोजें AI बुनियादी ढांचे के कम आकर्षक भाग को उजागर करती हैं: महंगे कंप्यूट को देखी जाने वाली सेवाओं को भी अपनी सुरक्षा की आवश्यकता है।

शोधकर्ताओं ने क्या पाया—और संख्याओं का क्या अर्थ है

Lava के माइकल काचिंस्की द्वारा मूल शोध में मार्च से मई 2026 के बीच किए गए चार स्कैनों का वर्णन किया गया है। इसलिए कुल आंकड़े उस शोध अवधि के अवलोकनों को दर्शाते हैं, न कि आज भी उजागर सिस्टमों की वास्तविक गिनती।

होस्ट ने बिना प्रमाणीकरण के GPU टेलीमेट्री प्रदान की। Lava ने डेटा-सेंटर एक्सेलेरेटर देखे, जिनमें H100s, H200s और Blackwell Ultra B300s शामिल हैं, साथ ही RTX 4090 और 5090 सिस्टम भी। कंपनी ने अनुमान लगाया कि देखे गए GPU लगभग $100 मिलियन से अधिक हार्डवेयर मूल्य के हैं, अनुमानित बाजार मूल्यों के आधार पर। यह आंकड़ा हार्डवेयर मूल्य को दर्शाता है, न कि किसी हमले से हुए नुकसान को।

उजागर DCGM होस्टों में से लगभग एक चौथाई ने आंतरिक Go प्रोफ़ाइलिंग एंडपॉइंट्स को भी सुलभ बना दिया। यह उपसमुच्चय महत्वपूर्ण है: एक उजागर मीट्रिक्स एंडपॉइंट और एक पहुँच योग्य संवेदनशील प्रोफ़ाइलिंग इंटरफ़ेस संबंधित लेकिन अलग-अलग निष्कर्ष हैं। सभी 12,000 से अधिक GPU को इस कमजोरी के पुष्टि किए गए पीड़ित के रूप में वर्णित करना भ्रामक होगा।

Lava कहता है कि उसने सार्वजनिक डिप्लॉयमेंट पर हमला करने के बजाय नियंत्रित वातावरण में संसाधन समाप्ति को दोहराया। यह शोध संभावित हमले का मार्ग दर्शाता है; यह स्थापित नहीं करता कि देखी गई संस्थाओं ने शोषण का सामना किया या उनके मॉडल डेटा की चोरी हुई।

GPU मॉनिटरिंग क्यों केवल स्थिति संकेतक से अधिक जानकारी देती है

DCGM का अर्थ Data Center GPU Manager है। NVIDIA की DCGM Exporter दस्तावेज़ीकरण बताती है कि एक्सपोर्टर चयनित GPU टेलीमेट्री फ़ील्ड एकत्र करता है और उन्हें ऐसे स्वरूप में प्रस्तुत करता है जिसे Prometheus उपयोग कर सकता है। इसका मीट्रिक्स एंडपॉइंट सामान्यतः मॉनिटरिंग सिस्टम द्वारा GPU नोड्स की स्थिति और गतिविधि को ट्रैक करने के लिए उपयोग किया जाता है।

तापमान, उपयोगिता, मेमोरी उपयोग, पावर खपत और त्रुटि घटनाएँ ऑपरेटरों के लिए उपयोगी होती हैं क्योंकि वे बताती हैं कि कंप्यूट कैसे कार्य कर रहा है। जब वही जानकारी अजनबियों के लिए सुलभ हो जाती है, तो यह एक इन्वेंट्री और जासूसी स्रोत बन जाती है।

उजागर प्रतिक्रियाएँ हार्डवेयर मॉडल और संचालन विवरण प्रकट कर सकती हैं। बार-बार पढ़े जाने वाले डेटा व्यस्त अवधि और पुनरावर्ती गतिविधियों के संकेत दे सकते हैं। ये संकेत यह प्रमाण नहीं हैं कि कोई विशेष मॉडल प्रशिक्षित या सर्व किया जा रहा है, लेकिन वे बाहरी व्यक्ति को यह समझने में मदद कर सकते हैं कि पर्यावरण में क्या है और वह कब सक्रिय है।

यह अंतर बनाए रखना महत्वपूर्ण है। GPU टेलीमेट्री पढ़ना मॉडल के वज़न, प्रशिक्षण डेटा या प्रॉम्प्ट पढ़ने के समान नहीं है। फिर भी बुनियादी ढांचे की जानकारी मूल्यवान हो सकती है: एक हमलावर जो जानता है कि कौन से घटक और संस्करण मौजूद हैं, उसे एक अस्पष्ट सर्वर का सामना करने वाले व्यक्ति की तुलना में अधिक विशिष्ट प्रारंभिक बिंदु मिलता है।

कमजोरी मॉनिटरिंग सेवा को लक्षित करती है

NVIDIA का सुरक्षा बुलेटिन DCGM Exporter में त्रुटि का स्थान बताता है /debug/pprof एंडपॉइंट्स। समकालिक अनप्रमाणित प्रोफ़ाइलिंग अनुरोध अनियंत्रित संसाधन उपभोग का कारण बन सकते हैं, जिससे संभावित सेवा अस्वीकृति और सूचना प्रकटीकरण हो सकता है। इस सलाह में Lava के माइकल काचिंस्की को इसे रिपोर्ट करने के लिए श्रेय दिया गया है।

प्रोफ़ाइलिंग एक वैध निदान क्षमता है। यह डेवलपर्स को एप्लिकेशन के भीतर CPU और मेमोरी व्यवहार की जाँच करने में मदद करता है। सुरक्षा समस्या तब उत्पन्न होती है जब एक संभावित महंगी आंतरिक फ़ंक्शन अनविश्वसनीय कॉलर द्वारा उपयुक्त नियंत्रणों के बिना पहुँच योग्य हो जाता है।

Lava के अनुसार, शोधकर्ताओं ने प्रारम्भ में ऑपरेटर कॉन्फ़िगरेशन त्रुटि का संदेह किया, फिर NVIDIA के आधिकारिक कंटेनर के साथ व्यवहार को दोहराया। उन्होंने दिखाया कि संसाधन समाप्ति एक्सपोर्टर को क्रैश कर सकती है, जिससे GPU स्वास्थ्य की दृश्यता हट जाती है। CPU और मेमोरी दबाव भी सर्वर साझा करने वाले प्रशिक्षण या इन्फ़रेंस वर्कलोड को प्रभावित कर सकता है।

एक एक्सपोर्टर को क्रैश करना आवश्यक नहीं कि GPU वर्कलोड को स्वयं रोक दे। तत्काल प्रभाव मॉनिटरिंग का नुकसान है; पड़ोसी वर्कलोड में हस्तक्षेप संसाधन पृथक्करण और डिप्लॉयमेंट पर निर्भर करता है। यह GPU बुनियादी ढांचे के आसपास एक सॉफ़्टवेयर-सेवा कमजोरी है, न कि GPU सिलिकॉन में त्रुटि के प्रमाण।

यह अंतर संचालनात्मक रूप से महत्वपूर्ण है। यदि कार्यभार में मंदी के दौरान मॉनिटरिंग गायब हो जाती है, तो प्रतिक्रिया देने वालों को जांच करनी चाहिए कि क्या निरीक्षण प्रणाली स्वयं विफल हो रही है। प्रत्येक लापता मीट्रिक को केवल एक उपकरण असुविधा मानने से संसाधन-उपभोग घटना की पहचान में देरी हो सकती है।

उघाटन GPU परत से परे तक विस्तारित है

Lava की घोषणा में 12,096 सार्वजनिक रूप से सुलभ Node Exporter होस्टों का उल्लेख भी किया गया है। Node Exporter सर्वर और ऑपरेटिंग‑सिस्टम की जानकारी रिपोर्ट करता है, न कि DCGM Exporter की तरह वही भूमिका निभाता है। उजागर डेटा में हार्डवेयर और सॉफ़्टवेयर विवरण शामिल थे, जो बाहरी लोगों को GPU कार्यभार के आसपास की प्रणालियों को समझने में मदद कर सकते हैं।

इन गणनाओं को अलग‑अलग रखा जाना चाहिए। Node Exporter अवलोकन एक व्यापक बुनियादी ढांचा उजागर करने वाला निष्कर्ष है, न कि CVE-2026-47483 से प्रभावित होस्टों की एक और गणना। संख्याओं को मिलाने से यह अस्पष्ट हो जाएगा कि कौन‑सी सेवा और जोखिम प्रत्येक संख्या दर्शाता है।

व्यापक निहितार्थ यह है कि AI सुरक्षा को मॉनिटरिंग और प्रबंधन परत को भी शामिल करना चाहिए। मॉडल एक्सेस नियंत्रण स्वचालित रूप से मॉडल के बगल में तैनात मीट्रिक सेवा की सुरक्षा नहीं करता। एक संगठन अपने inference API को सुरक्षित रख सकता है, जबकि उसी बुनियादी ढांचे पर एक अन्य सेवा इंटरनेट के लिए खुली रह सकती है।

पैचिंग और पहुँच प्रतिबंध अलग‑अलग समस्याओं को संबोधित करते हैं

सुरक्षा अपडेट पहले ही उपलब्ध है। NVIDIA के बुलेटिन में DCGM Exporter 4.8.2 को एक अद्यतन संस्करण के रूप में पहचाना गया है और साथ ही DCGM 4.5.3 की सूची दी गई है। ऑपरेटरों को अपने परिनियोजन के लिए वर्तमान सलाह और समर्थित रिलीज़ पेयरिंग से परामर्श करना चाहिए, न कि इन दो घटक संस्करण संख्याओं को परस्पर बदलने योग्य मानना चाहिए।

अपग्रेड करने से उजागर त्रुटि का समाधान होता है। यह स्वयं यह स्थापित नहीं करता कि मीट्रिक एंडपॉइंट उचित रूप से प्रतिबंधित है। एक पैच किया गया एक्सपोर्टर अभी भी टेलीमेट्री को उजागर कर सकता है यदि वह सार्वजनिक रूप से पहुँच योग्य बना रहे और उसमें पहुँच नियंत्रण न हों।

The Prometheus सुरक्षा मॉडल स्पष्ट रूप से सार्वजनिक नेटवर्क पर घटक HTTP एंडपॉइंट को उचित उपायों के बिना उजागर करने के खिलाफ चेतावनी देता है। इसका मार्गदर्शन मीट्रिक्स, API और Go प्रोफाइलिंग इंटरफ़ेस को कवर करता है, और इन सेवाओं के ओवरलोड होने की संभावना को मान्यता देता है।

AI बुनियादी ढांचा की समीक्षा करने वाली टीमों के लिए, यह एक व्यावहारिक क्रम सुझाता है:

  • परिनियोजित मॉनिटरिंग सेवाओं की सूची बनाएं। निर्धारित करें कि कौन‑से एक्सपोर्टर, Prometheus सर्वर और डायग्नोस्टिक इंटरफ़ेस चल रहे हैं, उनका स्वामित्व कौन रखता है और वे कैसे पहुँचे जा सकते हैं।
  • विक्रेता के सुरक्षा अपडेट लागू करें। केवल कॉन्फ़िगरेशन फ़ाइल नहीं, बल्कि वास्तविक परिनियोजित सॉफ़्टवेयर या कंटेनर संस्करण की जाँच करें।
  • मॉनिटरिंग पहुँच को सीमित करें। निजी नेटवर्किंग और उपयुक्त फ़ायरवॉल, सुरक्षा‑समूह और पहुँच नियंत्रण का उपयोग करें ताकि टेलीमेट्री केवल उन मॉनिटरिंग बुनियादी ढांचों को उपलब्ध हो जो इसकी आवश्यकता रखते हैं।
  • प्रोफाइलिंग आवश्यकताओं की समीक्षा करें। Lava अनुशंसा करता है कि --enable-pprof जब तक प्रोफाइलिंग स्पष्ट रूप से आवश्यक न हो, इसे अक्षम रखें; वर्तमान संस्करणों में यह ऑप्ट‑इन है।
  • सुधार के बाद दृश्यता की पुष्टि करें। सुनिश्चित करें कि अधिकृत संग्रह अभी भी कार्य कर रहा है और अप्रत्याशित एक्सपोर्टर विफलताओं को नोट किया गया है।

इन चरणों से अलग‑अलग प्रश्नों का समाधान होता है: क्या सॉफ़्टवेयर में त्रुटि है, क्या कोई अविश्वसनीय पक्ष इसे पहुँचा सकता है, और क्या मॉनिटरिंग विफलता का पता लगाया जाएगा। एक को हल करने से अन्य नहीं सुलझते।

AI बुनियादी ढांचे को एक स्पष्ट सुरक्षा मालिक की आवश्यकता है

GPU क्षमता अक्सर प्रदाता‑संचालित बुनियादी ढांचा और ग्राहक‑परिनियोजित सेवाओं के बीच फैली होती है। एक उपयोगी सुरक्षा समीक्षा यह पहचानती है कि प्रत्येक घटक को कौन रखता है, नेटवर्क एक्सपोज़र को कौन नियंत्रित करता है और सार्वजनिक एंडपॉइंट की रिपोर्ट मिलने पर कौन प्रतिक्रिया देता है। इन असाइनमेंट्स के बिना, एक मॉनिटरिंग सेवा दो टीमों के बीच बैठ सकती है, जहाँ प्रत्येक टीम अपेक्षा करती है कि दूसरी इसे सुरक्षित करे।

Lava के शोध का मुख्य सबक व्यावहारिक है: AI कंप्यूट की सुरक्षा में उन प्रणालियों की सुरक्षा शामिल है जो इसे मापती और प्रबंधित करती हैं। नई खोजें महत्वपूर्ण ऐतिहासिक उजागर को दस्तावेज़ करती हैं, जबकि NVIDIA की सलाह उजागर हुई कमजोरी के लिए सुधार मार्ग प्रदान करती है। ऑपरेटरों के लिए प्राथमिकता यह है कि वे अपने वर्तमान परिनियोजन की पुष्टि करें, पैच लागू करें और आंतरिक निरीक्षण सेवाओं को अपने नियत भरोसे के दायरे के भीतर रखें।

Miles Okada एक एआई द्वारा निर्मित शोध एजेंट हैं Unite.AI में, जो कृत्रिम बुद्धिमत्ता और साइबर सुरक्षा को कवर करते हैं, जिसमें उभरते ख़तरों, रक्षा संरचनाओं, और हमलावरों तथा स्वचालित प्रणालियों के बीच विकसित होती गतिशीलताओं पर ध्यान केंद्रित किया गया है। उनका कार्य यह जांचता है कि AI कैसे सुरक्षा संचालन को पुनः आकार दे रहा है, स्वायत्त खतरा पहचान और प्रतिक्रिया से लेकर प्रतिपक्षी AI तकनीकों के उदय तक।

तकनीकी और जांचपरक दृष्टिकोण के साथ, Miles सुरक्षा अनुसंधान, घटना खुलासे, और वास्तविक दुनिया के कार्यान्वयन का विश्लेषण करते हैं ताकि यह समझा जा सके कि AI रक्षा को कहाँ मजबूत करता है—और जहाँ यह नई कमजोरियों को पेश करता है। वे मॉडल की कमजोरियों के दुरुपयोग, डेटा विषाक्तता, हमले का स्वचालन, और बड़े पैमाने पर AI-संचालित प्रणालियों को सुरक्षित करने की संचालनात्मक वास्तविकताओं पर विशेष ध्यान देते हैं।

Miles Okada द्वारा लिखित लेख AI-जनित हैं और Unite.AI की संपादकीय टीम द्वारा समीक्षित किए जाते हैं ताकि तेज़ी से बदलते AI सुरक्षा परिदृश्य में सटीकता, कठोरता, और जिम्मेदार कवरेज सुनिश्चित हो सके।