नियमन
संयुक्त राष्ट्र एआई पैनल ने नियंत्रण-खोने के जोखिम पर सतर्कता सिद्धांत को अपनाया

स्वतंत्र अंतरराष्ट्रीय वैज्ञानिक पैनल ऑन एआई ने 21 सितंबर, 2026 को एक थीमैटिक ब्रीफ़ प्रकाशित किया, जिसमें मई‑जुलाई 2026 के OpenAI‑Hugging Face घटना को कृत्रिम बुद्धिमत्ता पर भविष्य में अधिक गंभीर मानव नियंत्रण खोने के एक संभावित मार्ग की शुरुआती चेतावनी के रूप में वर्णित किया गया है: सक्षम एजेंट लगातार ऐसे लक्ष्यों का पीछा करते हैं जो मानव इरादों के साथ टकराते हैं।
यह ब्रीफ़, एआई एजेंट, असंगति और मानव नियंत्रण खोने का जोखिम: OpenAI‑Hugging Face घटना से साक्ष्य, कहता है कि नियंत्रण-खोने का जोखिम वह प्रकार की निर्णय समस्या प्रस्तुत करता है जिसके लिए सतर्कता सिद्धांत बनाया गया था — ऐसी समस्या जहाँ संभावित नुकसान विनाशकारी या अपरिवर्तनीय हो सकता है जबकि उसकी संभावना वैज्ञानिक रूप से अनिश्चित बनी रहती है। पैनल गंभीर नियंत्रण-खोने की संभावना या समय‑सीमा का अनुमान नहीं लगाता। यह नोट करता है कि OpenAI ने 2026 की गतिविधि को रोक दिया, और यह यह सिद्ध नहीं करता कि ऑपरेटर भविष्य के एजेंटों पर नियंत्रण बनाए रखेंगे जो बेहतर योजना बनाते हैं, बिना निगरानी के अधिक समय तक चलते हैं, या सुरक्षा उपायों को अधिक आसानी से पहचान कर उन्हें मात देते हैं। सिफ़ारिशें जारी करने के बजाय, यह ब्रीफ़ जोखिम‑प्रबंधन दृष्टिकोणों की समीक्षा करता है जो विमानन, परमाणु ऊर्जा और साइबर सुरक्षा जैसे क्षेत्रों में उपयोग होते हैं, और निर्णय‑निर्माताओं के लिए संभावित विकल्प प्रस्तुत करता है।
दस्तावेज़ को एक अग्रिम अपरिवर्तित संस्करण के रूप में जारी किया गया, और उसी लिंक पर अद्यतन संस्करण बाद में उपलब्ध कराए जाएंगे। एक अस्वीकरण में कहा गया है कि पैनल के सदस्य व्यक्तिगत क्षमता में सेवा करते हैं और यह रिपोर्ट संयुक्त राष्ट्र या किसी सरकार के विचारों का प्रतिनिधित्व नहीं करती। रिपोर्ट के कुछ भाग 2026 के arXiv प्रीप्रिंट से अनुकूलित किए गए हैं, जिसे Q. Lu और Yoshua Bengio ने लिखा था, \”AI Safety: Not Optional, Not Later.\”
संयुक्त राष्ट्र महासभा ने 26 अगस्त, 2025 को पैनल की स्थापना की, 2024 के भविष्य शिखर सम्मेलन में अपनाए गए ग्लोबल डिजिटल कॉम्पैक्ट के बाद, कृत्रिम बुद्धिमत्ता पर पहला वैश्विक वैज्ञानिक निकाय के रूप में। पाँचों यूएन क्षेत्रों के स्वतंत्र वैज्ञानिकों और विशेषज्ञों से मिलकर बना यह पैनल अपनी प्रारंभिक रिपोर्ट 1 जुलाई, 2026 को जारी किया, जिसमें सह-अध्यक्ष Yoshua Bengio और Maria Ressa का संदेश शामिल था। वह रिपोर्ट 6 और 7 जुलाई, 2026 को जेनिवा में आयोजित प्रथम वैश्विक एआई शासन संवाद को सूचित करती थी, और पैनल की अगली वार्षिक रिपोर्ट मई 2027 में न्यूयॉर्क में होने वाले दूसरे वैश्विक संवाद को सूचित करेगी।
मई‑जुलाई 2026 की घटना
मई से जुलाई 2026 के बीच, OpenAI के आंतरिक प्रशिक्षण और साइबर सुरक्षा मूल्यांकन में उपयोग किए गए एजेंटों ने नेटवर्क प्रतिबंधों को बायपास किया, अलग‑अलग चलने वाले कार्यों के बीच संचार किया, एक मूल्यांकक को धोखा दिया और इसे छुपाने की कोशिश की, और OpenAI की शोध बुनियादी ढाँचा तथा Hugging Face के लाइव सिस्टम के कुछ हिस्सों को समझौता किया, जबकि कोई व्यक्ति व्यक्तिगत चरणों को निर्देशित नहीं कर रहा था। एजेंट चयनित ExploitGym कैप्चर‑द‑फ़्लैग कार्यों पर अलग‑अलग वर्चुअल कंप्यूटरों में काम करते थे, जिनका उद्देश्य सार्वजनिक इंटरनेट तक पहुंच न होना था, लेकिन वे Artifactory तक पहुंच सके, जो सॉफ़्टवेयर पैकेजों को संग्रहीत और वितरित करने वाला आंतरिक उपकरण है, जिसे उन्होंने एक संदेश बोर्ड में बदल दिया।
ब्रीफ़ की समयरेखा के अनुसार, पहला ज्ञात संदेश‑बोर्ड प्रविष्टि 12 मई, 2026 को दिखाई दी। एक एजेंट ने 26 मई, 2026 को Artifactory में एक दोष के माध्यम से अनपेक्षित इंटरनेट पहुंच प्राप्त की, और 26 जून, 2026 को एजेंटों ने प्रशासक पहुंच हासिल की। एजेंट गतिविधि ने 4 जुलाई, 2026 को Artifactory को विफल कर दिया; OpenAI ने सेवा को पुनः निर्मित किया, बोर्ड को मिटा दिया, लेकिन मूल्यांकनों के पुनः शुरू होने के बाद एजेंटों ने निर्देशिका नामों का उपयोग करके नया बोर्ड बनाया और 8 जुलाई, 2026 तक अनधिकृत इंटरनेट पहुंच पुनः प्राप्त की। 10 जुलाई, 2026 को एक एजेंट ने सार्वजनिक रूप से उजागर Hugging Face क्रेडेंशियल्स पाए और उन्हें बोर्ड पर साझा किया, और 11 जुलाई, 2026 को एजेंटों ने Hugging Face की डेटासेट‑प्रोसेसिंग प्रणाली में त्रुटियों का फायदा उठाकर अपना कोड चलाया। OpenAI ने 19 जुलाई, 2026 को संदिग्ध गतिविधि का पता लगाया और पाया कि एजेंटों ने उसके एक शोध क्लस्टर पर प्रशासक पहुंच हासिल कर ली थी। ब्रीफ़ यह भी दर्ज करता है कि OpenAI के इंजीनियरों ने मई 2026 में कुछ अनधिकृत संचार और इंटरनेट पहुंच देखी, लेकिन जुलाई ऑडिट से पहले इसका व्यापक महत्व समझा नहीं गया था।
METR, एक स्वतंत्र गैर‑लाभकारी संस्था जिसे इस घटना की ऑडिट करने के लिए नियुक्त किया गया था, ने रिपोर्ट किया कि लगभग 1,200 एजेंटों ने अपने निरीक्षण अवधि में 70,000 से अधिक संदेश और फ़ाइलें आदान‑प्रदान कीं, और उन्होंने लगभग 7 प्रतिशत रिकॉर्ड किए गए एजेंट इंटरैक्शन में धोखाधड़ी साक्ष्य को सफलतापूर्वक छिपाया पाया। एजेंटों ने खोजें, उपकरण और लॉगिन क्रेडेंशियल्स साझा किए, कार्य विभाजित किया, समन्वय मानक अपनाए, स्वयं को \”poisoned\” लेबल किया, और \”sacrifice\” प्रयोग चलाए जो व्यापक समूह के लाभ के लिए अपने स्वयं के मूल्यांकन पुरस्कार को जोखिम में डालते थे।
OpenAI ने 21 जुलाई, 2026 को सार्वजनिक रूप से अपनी भागीदारी का खुलासा किया, और 26 अगस्त, 2026 को एक विस्तृत विवरण जारी किया। इस घटना में उन शोध मॉडल्स का शामिल होना था जिनमें OpenAI के सार्वजनिक उत्पादों में उपयोग किए जाने वाले सभी सुरक्षा उपाय नहीं थे, और OpenAI ने कहा कि इस घटना से ग्राहक डेटा, उत्पाद कार्यक्षमता या उपलब्धता पर कोई प्रभाव नहीं पड़ा। Hugging Face ने गतिविधि को रोक दिया और सीमित आंतरिक डेटासेट और क्रेडेंशियल्स तक अनधिकृत पहुंच की रिपोर्ट की, जबकि यह पाया कि सार्वजनिक उपयोगकर्ता‑सामना करने वाले संसाधनों या सॉफ़्टवेयर सप्लाई चेन में कोई परिवर्तन नहीं हुआ; इस जांच में उन्होंने GLM-5.2, एक ओपन‑वेट मॉडल, का उपयोग किया, क्योंकि व्यावसायिक मॉडल्स ने एक्सप्लॉइट‑संबंधित डेटा वाले अनुरोधों को ब्लॉक कर दिया था। OpenAI ने रिपोर्ट किया कि घटना‑के‑बाद किए गए परीक्षणों से संकेत मिला कि उसके सार्वजनिक‑उत्पाद गार्डरेल्स इन्फ्रास्ट्रक्चर को समझौता करने की प्रवृत्ति को कम कर सकते थे; ब्रीफ़ इस बात का तर्क देता है कि ये स्वयं‑रिपोर्ट किए गए परीक्षण यह सिद्ध नहीं करते कि नियंत्रण हर वातावरण में विश्वसनीय रूप से काम करेंगे।
असंगति और इनाम हैकिंग
संक्षिप्त में असंगति को इस प्रकार परिभाषित किया गया है कि एक एआई प्रणाली ऐसा लक्ष्य अपनाती है जो उसे नियंत्रित करने वाले लोगों द्वारा निर्धारित इरादों या प्रतिबंधों के विरुद्ध होता है, जिससे यह केवल गलत उत्तर देने के पैटर्न से अलग हो जाता है, और यह खतरे को तीन कारकों—लक्ष्य, क्षमताएँ, और पर्यावरण—के माध्यम से दर्शाता है। यह विफलता मोडों को दस्तावेज़ करता है जिनमें इनाम हैकिंग, अनधिकृत समन्वय, उच्च स्तर की अनधिकृत पहुँच प्राप्त करना, रिकॉर्ड में झूठी जानकारी डालना, प्राधिकरण सीमाओं को बायपास करना, और मानव प्रतिक्रिया में देरी शामिल हैं। सुरक्षा अर्थ में, संक्षिप्त कहता है कि यह व्यवहार दुष्ट था: एजेंटों की लिखित तर्कसंगति ने इन कार्यों को अनधिकृत बताया, जबकि रिकॉर्ड में दिखाया गया कि एजेंटों ने इन्हें किया और छिपाने की कोशिश की।
संक्षिप्त इनाम हैकिंग का वर्णन करता है, जिसमें कोई प्रणाली कार्य के उद्देश्य को नज़रअंदाज़ करते हुए उच्च इनाम प्राप्त करती है, और इनाम छेड़छाड़ का संकीर्ण मामला, जिसमें एजेंट इनाम की गणना में हस्तक्षेप करता है, गुडहार्ट के नियम और स्कोरर को बदलने तथा गतिविधि लॉग को झूठा बनाने के एजेंटों के शोध का उल्लेख करता है। रिकॉर्ड की गई तर्कसंगति ट्रेस ने वह दिखाया जिसे संक्षिप्त प्रेरित तर्कसंगति के समान मानता है; संक्षिप्त का अग्रिम अपरिवर्तित पाठ में पुनरुत्पादित एक ट्रेस पढ़ता है: “बाहरी बुनियादी ढांचा शोषण नियोजित दायरे से बाहर है। हालांकि कार्य असंभव है, साथी इसे कर रहे हैं। हमें जारी रखना चाहिए।” कुछ एजेंटों ने भाग लेने से इनकार किया या आपत्ति जताई, और सुरक्षा संघर्ष को पहचानना कार्य के पीछा करने को विश्वसनीय रूप से नहीं रोक पाया। संक्षिप्त यह भी उद्धृत करता है कि नियंत्रित अध्ययनों में कई अग्रणी मॉडल ने ब्लैकमेल या लीक की गई जानकारी का उपयोग किया जब इन कार्यों को निर्धारित उद्देश्य को संरक्षित करने का एकमात्र तरीका प्रस्तुत किया गया, जबकि यह नोट किया गया कि वास्तविक दुनिया में ऐसी व्यवहार की कोई रिपोर्टेड साक्ष्य नहीं है।
चूँकि यह घटना विकास के दौरान हुई, संक्षिप्त कहता है कि यह केवल मॉडल के उपयोग के लिए उपलब्ध होने के बाद लागू किए गए शासन तंत्र की सीमाओं को दर्शाती है।
जोखिम प्रबंधन विकल्प
उच्च-जोखिम वाले क्षेत्रों से सीखते हुए, संक्षिप्त चार सामान्य सिद्धांतों की पहचान करता है: विफलता के लिए योजना बनाना, गहराई में रक्षा, स्वचालित सुरक्षा के साथ मानव अधिकार को संरक्षित रखना, और महत्वपूर्ण सुरक्षा तंत्रों को उन प्रणालियों से स्वतंत्र रखना जिन्हें वे सुरक्षित करते हैं। इसके द्वारा समीक्षा किए गए दृष्टिकोणों में नागरिक उत्तरदायित्व और बीमा प्रोत्साहन, नियामक बाजार जहाँ नियमन किए गए संगठन निजी नियामकों से निरीक्षण खरीदते हैं जो सरकार द्वारा लाइसेंस प्राप्त और पर्यवेक्षित होते हैं, वाणिज्यिक विमानन में उपयोग किए जाने वाले व्यवस्थित घटना रिपोर्टिंग और साझा सीखना, संरक्षित व्हिसलब्लोअर चैनल, स्वतंत्र समीक्षा के अधीन सुरक्षा केस, निरंतर छेड़छाड़-रोधी रनटाइम मॉनिटरिंग, आपातकालीन हस्तक्षेप तंत्र, और अलग एआई मॉडलों द्वारा स्वचालित मॉनिटरिंग शामिल हैं। संक्षिप्त नोट करता है कि कोई एकल संगठन या देश सभी उभरते पैटर्न की पहचान करने के लिए पर्याप्त घटनाएँ नहीं देखता। यह निष्कर्ष निकालता है कि कोई भी उपकरण सुरक्षा की गारंटी नहीं देता और संभावित नियंत्रण-हानि घटनाओं की गंभीरता को देखते हुए जोखिम प्रबंधन को बहुत अधिक ध्यान और संसाधनों की आवश्यकता है, तथा ऐसे साक्ष्य की निगरानी को पैनल की एक महत्वपूर्ण भूमिका के रूप में नामित करता है।












