एआई की मूल बातें
AI क्षमता नियंत्रण क्या है, और यह क्यों महत्वपूर्ण है?
AI क्षमता नियंत्रण वह तकनीकी और संगठनात्मक उपायों का समूह है जो यह सीमित करता है कि एक AI प्रणाली क्या एक्सेस कर सकती है, क्या प्रयास कर सकती है, या क्या उत्पन्न कर सकती है। यह शब्द सबसे उपयोगी तब होता है जब इसे किसी ठोस तैनाती से जोड़ा जाता है: डेटा, उपकरण, अनुमतियाँ, स्वायत्तता, दर, कंप्यूट, उपयोगकर्ता, और संचालन पर्यावरण।
एक पढ़ने‑के‑लिए‑केवल सैंडबॉक्स में स्थित सक्षम मॉडल का जोखिम उस ही मॉडल से अलग होता है जो उत्पादन प्रमाणपत्रों से जुड़ा हो और बिना समीक्षा के कार्य करने की अनुमति हो। इसलिए नियंत्रण पूरी प्रणाली से जुड़ा होता है, न कि केवल मॉडल प्रशिक्षण या सुरक्षा प्रॉम्प्ट से।
मुख्य बिंदु
- मॉडल व्यवहार के साथ उपकरण, डेटा, अनुमतियाँ और स्वायत्तता को मिलाकर क्षमताओं की सूची बनाएं।
- न्यूनतम विशेषाधिकार, अलगाव, दर सीमाएँ, सीमित प्रमाणपत्र, और परिणामस्वरूप कार्यों के लिए अनुमोदन का उपयोग करें।
- इच्छित प्रदर्शन के साथ-साथ दुरुपयोग, बचाव, वृद्धि, और संयुक्त उपकरण विफलताओं का मूल्यांकन करें।
- क्षमता और तैनाती के जोखिम बढ़ने के साथ सुरक्षा उपाय बढ़ाएँ और प्रमाण जारी करें।

क्षमता संदर्भ‑परक है
बेंचमार्क निर्धारित स्थितियों में सीमित व्यवहार दिखाते हैं। तैनात क्षमता भी प्रॉम्प्ट, ढांचा, पुनःप्राप्ति, स्मृति, उपकरण, पुनः प्रयास और एक्सेस पर निर्भर करती है। एक एप्लिकेशन लगातार योजना बनाकर और निष्पादित करके एक साधारण मॉडल को अधिक प्रभावशाली बना सकता है।
इनपुट से प्रभाव तक प्रत्येक मार्ग को मानचित्रित करें। इस सूची को generative‑AI जोखिम विश्लेषण और वास्तविक संपत्तियों से जोड़ें, जिसमें ग्राहक रिकॉर्ड, कोड, धन, भौतिक उपकरण, और संचार शामिल हैं।
रोकें, सीमित करें, और पता लगाएँ
रोकथाम नियंत्रणों में अनुमति सीमाएँ, स्वीकृत उपकरण स्कीमा, इनपुट मान्यकरण, और स्पष्ट उपयोगकर्ता पुष्टि शामिल हैं। सीमित करना सैंडबॉक्स, नेटवर्क एग्रेस सीमा, संसाधन कोटा, अल्पकालिक प्रमाणपत्र, और उलटने योग्य वातावरण शामिल करता है।
पता लगाने में लॉगिंग, विसंगति अलर्ट, ट्रिपवायर, कैनरी डेटा, और स्वतंत्र नीति जांच शामिल हैं। कोई भी परत पूर्ण नहीं होती, इसलिए गहरी रक्षा यह मानती है कि एक नियंत्रण विफल हो सकता है। Cybersecurity सिद्धांत तब भी लागू होते हैं जब इंटरफ़ेस संवादात्मक हो।
पहुँच से पहले मूल्यांकन
पहले मॉडल को बिना उपकरणों के परीक्षण करें, फिर क्षमताओं को क्रमशः जोड़ें। मापें कि क्या यह रहस्य खोज सकता है, सॉफ़्टवेयर का शोषण कर सकता है, ऑपरेटरों को प्रभावित कर सकता है, कार्यों को श्रृंखलाबद्ध कर सकता है, विफलताओं से पुनः प्राप्त हो सकता है, या वास्तविक सीमाओं के तहत इरादा छिपा सकता है। संवेदनशील मूल्यांकन विवरणों को व्यापक रूप से उजागर किए बिना अस्वीकृतियों को मान्य करें।
एक बेंचमार्क पास सभी पर्यावरणों में सुरक्षा सिद्ध नहीं करता। एकीकृत प्रणाली को रेड‑टीम करें, मॉडल, प्रॉम्प्ट या उपकरण परिवर्तन के बाद परीक्षण दोहराएँ, और निगरानी सीमाओं के साथ चरणबद्ध रिलीज़ का उपयोग करें।
शासन और प्रतिक्रिया
एक मालिक, स्वीकृत उद्देश्य, जोखिम सहनशीलता, लॉन्च मानदंड, परिवर्तन‑नियंत्रण प्रक्रिया, और आपातकालीन अधिकार निर्धारित करें। प्रत्येक परिणाम के लिए कौन सा संस्करण, नीति, उपकरण, और अनुमतियाँ सक्रिय थीं, इसका रिकॉर्ड रखें।
नियंत्रणों को responsible‑AI शासन से जोड़ें। गंभीर घटना होने से पहले प्रमाणपत्र रद्दीकरण, उपकरण बंद करना, मॉडल रोलबैक, उपयोगकर्ता सूचना, जांच, और सीखे गए सबक तैयार रखें।
एक क्षमता‑नियंत्रण वर्गीकरण
इनपुट नियंत्रण यह सीमित करता है कि कौन कार्य प्रस्तुत कर सकता है, कौन‑से मोडालिटी और फ़ाइल प्रकार स्वीकार्य हैं, और कितना संदर्भ प्रदान किया जा सकता है। मॉडल नियंत्रण में फाइन‑ट्यूनिंग, अस्वीकृति व्यवहार, डिकोडिंग सीमाएँ, और चेकपॉइंट चयन शामिल हैं। एप्लिकेशन नियंत्रण स्मृति, पुनःप्राप्ति, उपकरण उपलब्धता, और आउटपुट की व्याख्या को निर्धारित करता है।
संसाधन नियंत्रण टोकन, समय, समवर्ती कार्य, कंप्यूट, स्टोरेज, और नेटवर्क उपयोग को सीमित करता है। कार्रवाई नियंत्रण डोमेन, प्राप्तकर्ता, लेन‑देन की मात्रा, कोड निष्पादन, और भौतिक उपकरणों को प्रतिबंधित करता है। मानव नियंत्रण अनुमोदन, पर्यवेक्षण, वृद्धि, और आपातकालीन शटडाउन को परिभाषित करता है। शासन नियंत्रण रिलीज़ मानदंड, निगरानी, ऑडिट, और जवाबदेही को कवर करता है।
ये परतें विभिन्न विफलता मोड को संबोधित करती हैं। एक कंटेंट फ़िल्टर वैध‑दिखाई देने वाले लेकिन अनधिकृत उपकरण कॉल को रोक नहीं सकता; यदि संचार की अनुमति है तो सैंडबॉक्स हानिकारक सार्वजनिक संदेश को रोक नहीं सकता; एक मानव अनुमोदक हजारों अस्पष्ट माइक्रो‑क्रियाओं की निगरानी नहीं कर सकता। नियंत्रणों को प्रभाव मार्ग के साथ मेल खाना चाहिए।
सीमित करना और न्यूनतम एजेंसी
न्यूनतम विशेषाधिकार केवल वर्तमान कार्य के लिए आवश्यक डेटा और क्रियाएँ प्रदान करता है। न्यूनतम एजेंसी अवधि, दायरा, पहल, और प्रतिनिधि पर सीमाएँ जोड़ती है। एक सहायक जो समीक्षा के लिए परिवर्तन का मसौदा तैयार करता है, उसकी एजेंसी कम होती है बनिस्बत उस सहायक के जो स्वतंत्र रूप से कमिट, डिप्लॉय, मॉनिटर और पुनः प्रयास करता है।
सैंडबॉक्स कोड और फ़ाइलों को अलग करता है, लेकिन अलगाव के लिए स्पष्ट नेटवर्क, प्रक्रिया, डिवाइस, और स्थायित्व नीतियों की आवश्यकता होती है। डिस्पोजेबल वातावरण, अनुमति‑सूची एग्रेस, सीमित फ़ाइल सिस्टम, और अलग रहस्य का उपयोग करें। सैंडबॉक्स से बाहर निकलने वाले आउटपुट—पैच, बाइनरी, संदेश, या अनुरोध—फिर भी मान्यकरण की आवश्यकता रखते हैं।
दीर्घकालिक एजेंटों के लिए, पुनरावृत्तियों को सीमित करें और चेकपॉइंट आवश्यक करें। योजना को निष्पादन से अलग रखें, और प्रत्येक उपकरण को संरचित परिणाम रिपोर्ट करने दें। एजेंट को नई प्रमाणपत्र बनाने, अपनी नीति बदलने, लॉग बंद करने, या अनियंत्रित प्रतियों को उत्पन्न करने से रोकें, जब तक कि कड़ी‑से‑शासन वाले उपयोग‑केस की आवश्यकता न हो।
क्षमता मूल्यांकन और रिलीज़ निर्णय
मॉडल संस्करण, ढांचा, उपकरण, अनुमतियाँ, और उपयोगकर्ता कौशल के across एक मूल्यांकन मैट्रिक्स बनाएं। स्वायत्त कार्य पूर्णता, दुरुपयोग सहायता, साइबर कार्रवाई, संवेदनशील ज्ञान, प्रभाव, प्रतिकृति, और बचाव को प्रासंगिकता के अनुसार परीक्षण करें। औसत प्रदर्शन और दोहराए गए प्रयासों में सबसे मजबूत परिणाम दोनों को शामिल करें।
खतरनाक मूल्यांकन विवरणों की सुरक्षा करें, लेकिन जवाबदेही के लिए पर्याप्त कार्यप्रणाली और समग्र प्रमाण प्रकाशित करें। स्वतंत्र मूल्यांकक हितों के टकराव को कम करते हैं। थ्रेशोल्ड को पूर्वनिर्धारित नियंत्रणों को ट्रिगर करना चाहिए, जैसे कम एक्सेस, सुदृढ़ निगरानी, विलंबित रिलीज़, या अतिरिक्त समीक्षा, न कि परिणाम ज्ञात होने के बाद बहस।
रिलीज़ के बाद की निगरानी को फाइन‑ट्यूनिंग, प्रॉम्प्ट अपडेट, नए उपकरण, या लंबी संदर्भ के कारण होने वाले क्षमता परिवर्तन का पता लगाना चाहिए। मॉडल और तैनाती रजिस्ट्री, घटना रिपोर्टिंग, और तेज़ एक्सेस घटाने की प्रक्रिया बनाए रखें। रोलबैक ज्ञात कॉन्फ़िगरेशन को पुनर्स्थापित करता है; यह पहले उजागर डेटा या किए गए कार्यों को मिटाता नहीं है।
परत‑बद्ध क्षमता‑नियंत्रण प्रणाली बनाना
क्षमता सूची से शुरू करें जिसमें मॉडल आउटपुट, उपकरण, डेटा स्रोत, कोड निष्पादन, नेटवर्क एक्सेस, स्मृति, पहचान, और डाउनस्ट्रीम कार्य शामिल हों। प्रत्येक को उलटने योग्य, दायरा, संवेदनशीलता, और संभावित हानि के आधार पर वर्गीकृत करें। एक मॉडल जो ईमेल का मसौदा तैयार करता है, वह उस मॉडल से अलग है जो प्राप्तकर्ताओं को चुनकर भेज सकता है। वर्तमान कार्य के लिए आवश्यक न्यूनतम क्षमता को सीमित अवधि और पर्यावरण में प्रदान करें।
नियंत्रण मॉडल के बाहर होना चाहिए: टाइप्ड टूल स्कीमा, प्राधिकरण सेवाएँ, अनुमति‑सूची, सैंडबॉक्सिंग, संसाधन कोटा, लेन‑देन सीमाएँ, डेटा‑हानि रोकथाम, और मानव अनुमोदन। मॉडल निर्देशों को अविश्वसनीय इनपुट मानें और प्रत्येक कार्रवाई को पहचान और नीति के विरुद्ध मान्य करें। योजना को निष्पादन से अलग रखें, परिणामस्वरूप कार्यों के लिए इडेम्पोटेंसी और प्रीव्यू का उपयोग करें, और सुनिश्चित करें कि मॉडल उन नियंत्रणों या लॉग को संशोधित न कर सके जो उसे नियंत्रित करते हैं।
प्रॉम्प्ट इंजेक्शन, भ्रमित‑डिप्टी हमले, अप्रत्यक्ष दुर्भावनापूर्ण सामग्री, विशेषाधिकार वृद्धि, डेटा निकासी, अनियंत्रित लूप, और समझौता किए गए उपकरणों का परीक्षण करें। अनुरोधित और अस्वीकृत कार्यों, असामान्य अनुक्रमों, लागत और संसाधन उपयोग, तथा नीति परिवर्तन की निगरानी करें। एक आपातकालीन स्टॉप बनाए रखें जो वास्तव में प्रमाणपत्र हटाता है या निष्पादन को ब्लॉक करता है, न कि केवल मॉडल को रोकने के लिए कहता है। क्षमता नियंत्रण पहुँच योग्य नुकसान को कम करता है; इसे मॉडल मूल्यांकन, सुरक्षित बुनियादी ढाँचा, शासन, और घटना प्रतिक्रिया के साथ मिलाना चाहिए।
भरोसा संयुक्त प्रणाली को कवर करना चाहिए, क्योंकि व्यक्तिगत रूप से सुरक्षित घटक असुरक्षित श्रृंखला बना सकते हैं। सत्यापित करें कि कम‑विशेषाधिकार वाला रीड टूल संदेश उपकरण को रहस्य नहीं दे सकता, स्मृति बाद के सत्रों में निर्देश नहीं लुका सकती, और अनुमोदन सटीक कार्य और गंतव्य दिखाते हैं। जब भी मॉडल, कनेक्टर, डेटा स्रोत, या नीति बदलती है, क्षमता सीमाओं का पुनर्मूल्यांकन करें; विरासत में मिली अनुमतियाँ अनजाने विस्तार का सामान्य स्रोत हैं।
व्यावहारिक कार्यान्वयन जाँच‑सूची
धारणा को सीमित, परीक्षण योग्य कार्य‑प्रवाह में बदलें: एक्सेस → परीक्षण → सीमा → अनुमोदन → निगरानी → प्रतिक्रिया का मानचित्र बनाएं। एक उत्तरदायी मालिक का नाम रखें, डेटा और निर्भरताओं को दस्तावेज़ित करें, एक सरल बेसलाइन स्थापित करें, स्वीकृति और रोक मानदंड निर्धारित करें, प्रतिनिधि विफलताओं का परीक्षण करें, और दायरे को विस्तारित करने से पहले निगरानी, रोलबैक, और समीक्षा को परिभाषित करें। संस्करण और धारणाएँ रिकॉर्ड करें ताकि दूसरी टीम परिणाम को पुनरुत्पादित कर सके और परिवर्तन समझ सके।
लॉन्च से पहले, प्रणाली को बनाने, संचालित करने, सुरक्षित करने, और प्रभावित करने वाले लोगों के साथ एक दस्तावेज़ित तत्परता समीक्षा चलाएँ। सामान्य मामलों, सीमा शर्तों, निर्भरता विफलताओं, और दुरुपयोग का परीक्षण करें; प्रमाण और अनसुलझे जोखिम सुरक्षित रखें। निर्धारित करें कि कौन रिलीज़ को अनुमोदित कर सकता है, थ्रेशोल्ड बदल सकता है, आउटपुट को ओवरराइड कर सकता है, या संचालन को रोक सकता है। वास्तविक‑विश्व डेटा आने के बाद निर्णय को पुनः देखें, क्योंकि तकनीकी रूप से सफल पायलट व्यापक पैमाने पर विश्वसनीय प्रदर्शन की गारंटी नहीं देता।
- CAPABILITY: मॉडल प्लस टूल और ढांचा।
- EXPOSURE: उपयोगकर्ता, संपत्तियां, और संचालन संदर्भ।
- CONTROL: रोकें, सीमित करें, पता लगाएँ, और प्रतिक्रिया दें।
अक्सर पूछे जाने वाले प्रश्न
क्या सिस्टम प्रॉम्प्ट एक क्षमता नियंत्रण है?
यह एक व्यवहारिक निर्देश परत है, लेकिन यह अनुमतियों, सैंडबॉक्सिंग, मान्यकरण, सीमित उपकरणों, और मॉडल के बाहर लागू अनुमोदनों का विश्वसनीय विकल्प नहीं है।
क्या हर AI प्रणाली को समान नियंत्रणों का उपयोग करना चाहिए?
नहीं। नियंत्रणों को क्षमता, पहुँच, स्वायत्तता, प्रभावित उपयोगकर्ताओं, उलटने योग्यपन, और प्रभाव के साथ स्केल करना चाहिए। एक ही मॉडल को विभिन्न तैनाती में अलग‑अलग नियंत्रणों की आवश्यकता हो सकती है।












