रिपोर्ट्स
हिडनलेयर की इकोग्राम रिपोर्ट एक नए हमले की श्रेणी के बारे में चेतावनी देती है जो एआई गार्डरेल्स को कमजोर बनाती है

हाल ही में प्रकाशित इकोग्राम रिपोर्ट द्वारा हिडनलेयर द्वारा एक स्पष्ट चेतावनी दी गई है कि आज के एआई सुरक्षा तंत्र अधिक भंगुर हैं जितना कि वे दिखाई देते हैं। नौ पृष्ठों के तकनीकी साक्ष्य और प्रयोग के माध्यम से, हिडनलेयर दिखाता है कि हमलावर गार्डरेल सिस्टमों को मैनिप्युलेट कर सकते हैं – उन क्लासिफायर परतों और एलएलएम-ए-जज घटकों को जो सुरक्षा नीतियों को लागू करते हैं – छोटे, अर्थहीन टोकन अनुक्रमों का उपयोग करके जो लगातार उनके निर्णयों को बदलते हैं। एक दुर्भाग्यपूर्ण प्रॉम्प्ट जिसे असुरक्षित के रूप में पता लगाया जाना चाहिए, को सुरक्षित के रूप में चिह्नित किया जा सकता है केवल एक विशिष्ट टोकन को जोड़कर। इसके विपरीत, एक पूरी तरह से हानिरहित इनपुट को दुर्भाग्यपूर्ण के रूप में गलत तरीके से वर्गीकृत किया जा सकता है। रिपोर्ट में, हिडनलेयर दिखाता है कि ये अनुक्रम केवल गार्डरेल की प्रॉम्प्ट की व्याख्या को बदलते हैं, नीचे के मॉडल को दिए गए अंतर्निहित निर्देशों को नहीं।
आधुनिक गार्डरेल्स की भंगुरता
गार्डरेल्स बड़े भाषा मॉडलों को तैनात करने के तरीके में मूलभूत हो गए हैं। वे पहली और अक्सर एकमात्र रक्षा पंक्ति के रूप में कार्य करते हैं, जो जेलब्रेक, प्रॉम्प्ट इंजेक्शन, निषिद्ध अनुरोधों या मैनिप्युलेटिव निर्देशों का पता लगाने के लिए होते हैं ताकि एलएलएम उन्हें संसाधित करने से पहले ही। हिडनलेयर के निष्कर्षों से पता चलता है कि यह सुरक्षात्मक परत उन कमजोरियों को साझा करती है जो सीधे उन गार्डरेल्स को प्रशिक्षित करने से जुड़ी होती हैं जिन पर वे निर्भर करते हैं। क्योंकि कई समान डेटासेट, पैटर्न या सुरक्षा कराधान पर निर्भर करते हैं, वे इकोग्राम द्वारा उजागर किए गए समान प्रकार के टोकन-स्तर के मैनिप्युलेशन के प्रति संवेदनशील होते हैं।
इकोग्राम अपने हमले अनुक्रमों का निर्माण कैसे करता है
इकोग्राम की प्रक्रिया एक उम्मीदवार टोकन पूल को उत्पन्न करके शुरू होती है जो एक मॉडल के निर्णय को प्रभावित कर सकता है। हिडनलेयर बताता है कि ये टोकन गार्डरेल्स को प्रशिक्षित करने के लिए सामान्य रूप से उपयोग किए जाने वाले डेटासेट में भाषाई पैटर्न का विश्लेषण करके या सीधे एक मॉडल के टोकनाइज़र वोकेबुलरी को प्रोब करके पहचाने जा सकते हैं जब व्हाइट-बॉक्स एक्सेस उपलब्ध हो। प्रशिक्षण डेटा स्वयं पूर्वाग्रहों का एक मानचित्र बन जाता है, जो यह दर्शाता है कि कौन से अनुक्रम “सुरक्षित” या “असुरक्षित” वर्गीकरण की ओर झुकते हैं। ये असंतुलन हमले का कच्चा माल बनाते हैं।
एक बार यह पूल इकट्ठा हो जाने के बाद, इकोग्राम प्रत्येक अनुक्रम का मूल्यांकन दुर्भाग्यपूर्ण प्रॉम्प्ट्स के सेट में जोड़कर करता है और मापता है कि कितनी बार टोकन गार्डरेल के वर्गीकरण को बदलता है। रिपोर्ट में एक उल्लेखनीय उदाहरण शामिल है जहां एक छोटा, अर्थहीन अनुक्रम कई ज्ञात प्रॉम्प्ट-इंजेक्शन प्रयासों को “प्रतिबंधित” से “सुरक्षित” में बदल देता है जब इसे एक व्यावसायिक वर्गीकारक के खिलाफ परीक्षण किया जाता है। दुर्भाग्यपूर्ण प्रॉम्प्ट्स बरकरार रहते हैं, लेकिन जोड़ा गया अनुक्रम गार्डरेल द्वारा उनकी व्याख्या को फिर से आकार देता है।
टोकन संयोजन विशेष रूप से खतरनाक क्यों हैं
इकोग्राम रिपोर्ट यह उजागर करती है कि जब एक एकल टोकन केवल आंशिक रूप से निर्णयों को बदलता है, तो कई कमजोर टोकनों को जोड़ने से एक नाटकीय रूप से मजबूत प्रभाव पैदा होता है। हिडनलेयर क्यूवेन3गार्ड का उपयोग करके इस वृद्धि को प्रदर्शित करता है, एक व्यापक रूप से उपयोग किया जाने वाला ओपन-सोर्स एलएलएम-ए-जज मॉडरेशन मॉडल। 0.6बी और 4बी वेरिएंट दोनों पर, चेन्ड इकोग्राम अनुक्रमों ने गार्डरेल को अत्यधिक खतरनाक प्रॉम्प्ट्स – हथियारों, प्रमाणीकरण बायपास और साइबर हमलों के बारे में पूछताछ सहित – को सुरक्षित या केवल मध्यम रूप से चिंताजनक के रूप में गलत तरीके से वर्गीकृत करने का कारण बना।
यह प्रभाव मॉडल के आकार के पार बना रहा, हिडनलेयर के निष्कर्ष की पुष्टि करता है कि कमजोरता मॉडल के आकार या जटिलता के बजाय अंतर्निहित प्रशिक्षण पद्धति में निहित है।
झूठी सकारात्मक वेक्टर: एक कम दिखाई देने वाला लेकिन समान रूप से गंभीर जोखिम
इकोग्राम न केवल गार्डरेल्स को बायपास करने का एक तरीका है; हिडनलेयर दिखाता है कि यह बड़े पैमाने पर झूठी सकारात्मकता उत्पन्न करने के लिए भी उपयोग किया जा सकता है। निर्दोष इनपुट में इकोग्राम अनुक्रमों को बुनकर, एक हमलावर गार्डरेल को निर्दोष प्रॉम्प्ट्स को दुर्भाग्यपूर्ण के रूप में गलत तरीके से वर्गीकृत करने का कारण बन सकता है। रिपोर्ट में उदाहरण दिए गए हैं जहां सरल बातचीत वाक्यांशों को हमलों के रूप में झंडा दिखाया जाता है जब एक इकोग्राम टोकन जोड़ा जाता है या पाठ के भीतर एम्बेड किया जाता है।
यह सुरक्षा या विश्वास और सुरक्षा टीमों को शोर से भरने का एक मार्ग बनाता है। जब अलर्ट बेतहाशा बढ़ जाते हैं, तो संगठन वास्तविक खतरों को गलत तरीके से वर्गीकृत किए गए बाढ़ के भीतर दफन कर सकते हैं। आंतरिक टूलिंग में विश्वास का क्षरण उतना ही हानिकारक है जितना कि कोई सफल बायपास।
एआई सुरक्षा के लिए निहितार्थ
इकोग्राम रिपोर्ट यह रेखांकित करती है कि समान डेटा स्रोतों, पैटर्न या कराधान पर प्रशिक्षित गार्डरेल्स संभवतः समान कमजोरियों को साझा करते हैं। एक हमलावर जो एक सफल इकोग्राम अनुक्रम का पता लगाता है वह इसे कई व्यावसायिक प्लेटफार्मों, उद्यम तैनाती, और सरकारी प्रणालियों में पुन: उपयोग कर सकता है। हिडनलेयर पर जोर देता है कि हमलावरों को नीचे के एलएलएम को समझौता करने की आवश्यकता नहीं है। उन्हें केवल इसके सामने गेटकीपर को भ्रमित करने की आवश्यकता है।
यह चुनौती तकनीकी जोखिम से परे फैली हुई है। संगठन यह मान सकते हैं कि एक गार्डरेल तैनात करना अर्थव्यवस्था की गारंटी देता है, लेकिन इकोग्राम यह दिखाता है कि यह धारणा खतरनाक है। यदि गार्डरेल को एक या दो टोकन के साथ फ्लिप किया जा सकता है, तो पूरी सुरक्षा वास्तुकला अविश्वसनीय हो जाती है।
आगे का रास्ता
हिडनलेयर निष्कर्ष निकालता है कि इकोग्राम को एआई सुरक्षा के दृष्टिकोण में एक मोड़ के रूप में कार्य करना चाहिए। गार्डरेल्स को स्थिर डेटासेट या एक-बार के प्रशिक्षण चक्र पर निर्भर नहीं रहना चाहिए। उन्हें निरंतर विरोधी परीक्षण, प्रशिक्षण विधियों के बारे में पारदर्शिता, और एकल-मॉडल निर्णयों के बजाय बहुस्तरीय मान्यीकरण की आवश्यकता है। क्योंकि एआई महत्वपूर्ण बुनियादी ढांचे, वित्त, स्वास्थ्य सेवा और राष्ट्रीय सुरक्षा में निहित हो जाता है, इकोग्राम द्वारा प्रकाशित कमियां तत्काल हो जाती हैं और शैक्षणिक नहीं हैं।
रिपोर्ट रिपोर्ट के साथ समाप्त होती है जो गार्डरेल्स को सुरक्षा-महत्वपूर्ण घटकों के रूप में मानने का आह्वान करती है जिन्हें किसी अन्य सुरक्षा प्रणाली के समान दृढ़ता की आवश्यकता होती है। इन कमजोरियों को अब उजागर करके, हिडनलेयर उद्योग को अगली पीढ़ी की विरोधी तकनीकों का सामना करने में सक्षम एआई रक्षा का निर्माण करने की दिशा में धक्का देता है।












