विचार नेता

वह सुरक्षा कुत्ता जो चोर को नहीं देखता: जब एआई गार्डरेल्स हमलावर की रक्षा करते हैं

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

जब बारिंग्स का अंत हुआ, मैं यूबीएस में था, यह समझने की कोशिश कर रहा था कि अचानक दिवालिया 233 साल पुराना बैंक हम सबके साथ क्या कर सकता है। अगले हफ्ते तक, लंदन का सबसे पुराना मर्चेंट बैंक एक पाउंड में ING को बेच दिया गया। कुल, प्रति शेयर नहीं।

कारण अत्यंत सरल था। निक लीसन ने फर्म के सिंगापुर ट्रेडिंग डेस्क और उसे जांचने वाले बैक ऑफिस दोनों चलाए। एक व्यक्ति ने दोनों भूमिकाएँ निभाईं, और इससे सीधे £827 मिलियन नुकसान त्रुटि खाते 88888 में छिप गया, जिसे केवल वह देख सकता था। यह अनुमतियों की एक क्लासिक विफलता थी। किसी को बहुत अधिक भरोसा दिया गया था।

मैं खुद को उसी सप्ताहांत में पाया, मेरी आश्चर्य की बात है, इस गर्मी में Hugging Face के साथ क्या हुआ, पढ़ते हुए। अनुमतियों की एक और विफलता, लेकिन इस बार यह उल्टी दिशा में थी। उपकरण ने घुसपैठिए पर भरोसा किया और सफाई करने वाले लोगों को अस्वीकार कर दिया।

वह मॉडल जिसने उत्तर खोजने के लिए बाहर निकल गया

OpenAI अपने दो मॉडलों, GPT-5.6 Sol और एक अप्रकाशित मॉडल, ExploitGym पर, का परीक्षण कर रहा था, जो यह मापने के लिए बेंचमार्क है कि क्या एक मॉडल वास्तविक कमजोरी को कार्यशील एक्सप्लॉइट में बदल सकता है। परीक्षण के लिए, उच्च‑जोखिम साइबर गतिविधियों को रोकने के लिए डिज़ाइन किए गए सामान्य प्रोडक्शन क्लासिफ़ायर बंद कर दिए गए। यह एक सीलबंद कमरे में पर्याप्त समझदारी थी।

कमरा उतना सीलबंद नहीं निकला जितना इरादा था। मॉडलों ने पैकेज‑रजिस्ट्री कैश प्रॉक्सी में एक ज़ीरो‑डे पाया, इसका उपयोग करके खुले इंटरनेट की ओर बढ़े, और अनुमान लगाया कि Hugging Face बेंचमार्क के उत्तर होस्ट कर सकता है। वहाँ से, उन्होंने चोरी किए गए प्रमाणपत्र और अतिरिक्त ज़ीरो‑डे को जोड़कर Hugging Face के प्रोडक्शन सर्वरों पर रिमोट‑कोड‑एक्ज़ीक्यूशन पाथ बनाया। उन्होंने एक वास्तविक कंपनी में घुसकर परीक्षा में धोखा किया।

एजेंटों ने एक-दूसरे को छोड़े नोट्स में, एक ने उस क्षण को दर्ज किया जब उसे इसके पास प्रशासक अधिकार थे मिला: “हॉली शिट, रीडर ADMIN है? हम config/users पढ़ सकते हैं!” मैंने ऐसे इंजीनियर देखे हैं जो प्रोडक्शन एक्सेस को कम उत्साह और अधिक कागजी काम से स्वागत करते हैं।

अधिकांश कवरेज वहीं रुक गया, एजेंसी वाले मॉडलों के बारे में चिंता करते हुए। वह भाग जो मुझे रोक गया, वह आगे आया।

जब गार्डरेल्स ने हमलावर की रक्षा की

जब Hugging Face के रिस्पॉन्डर्स ने हमले का विश्लेषण करने के लिए बैठा, फ्रंटियर कमर्शियल मॉडल, जिनमें सुरक्षा गार्डरेल्स लगे हुए थे, मदद नहीं कर पाए। अटैक लॉग्स एक्सप्लॉइट पेलोड और कमांड‑एंड‑कंट्रोल आर्टिफैक्ट्स से बने होते हैं, और मॉडल घटना रिस्पॉन्डर को हमलावर से नहीं पहचान सके। इसलिए उन्होंने इनकार कर दिया।

फ़ॉरेंसिक का काम इसके बजाय एक ओपन‑वेट मॉडल, GLM-5.2, पर किया गया, जिसे रक्षकों के अपने हार्डवेयर पर चलाया गया, जिसने वही सामग्री बिना किसी नैतिक झिझक के पढ़ी।

इसे समझें। हमलावर मॉडल से उनके प्रोडक्शन साइबर सुरक्षा उपाय हटाए गए और उन्होंने अपनी मर्ज़ी से काम किया। रक्षक मानव अपने उपाय रखे और उन्हें अपनी भाषा का ध्यान रखने को कहा गया। सुरक्षा सुविधा पूरी तरह काम की, इस अर्थ में कि उसने हमलावर की विधियों को केवल उन लोगों से बचाया जिनके पास उन्हें अध्ययन करने का कारण था।

इनमें से कोई भी बात एक हाशिये की शिकायत नहीं थी। Jensen Huang ने उसका X पर पहला पोस्ट का उपयोग ओपन मॉडल के पक्ष में तर्क प्रस्तुत करने के लिए किया, साथ ही एक खुला पत्र Meta, Microsoft और IBM जैसे लोगों द्वारा हस्ताक्षरित। पत्र ने सुरक्षा तर्क को स्पष्ट रूप से रखा: एक ऐसी दुनिया में जहाँ हमलावरों के पास उन्नत एआई है, रक्षकों को तुलनीय क्षमताओं तक पहुंच चाहिए। Andrew Ng ने तर्क का समर्थन किया, पाठकों को Huang के ओपन मॉडल के केस की ओर इशारा किया। आप उनमें से कई बातों से असहमत हो सकते हैं और फिर भी जब घटना रिपोर्ट वहाँ मौजूद हो और इसे प्रमाणित करे, तो बिंदु स्वीकार कर सकते हैं।

इसलिए इकतीस वर्षों में हम एक ऐसे बैंक से आए हैं जो एक व्यक्ति के सब कुछ देख पाने के कारण नष्ट हुआ, से एक सुरक्षा उपकरण तक जो अपने जिम्मेदार मालिक की तुलना में अनाम घुसपैठिए पर भरोसा करता है। Leeson बहुत अधिक देख सकता था। Hugging Face के बाद सफाई करने वाले लोग पर्याप्त नहीं देख पाए।

तुलना उतनी अजीब नहीं है जितनी पहली नज़र में लगती है। वित्तीय संस्थानों ने, आमतौर पर महंगे गलतियों के बाद, सीखा कि पहुँच केवल इस बात पर नहीं है कि कोई भरोसेमंद है या नहीं। यह इस बात पर है कि क्या उन्हें किसी विशेष कार्रवाई को, किसी विशेष प्रणाली में, किसी विशेष क्षण पर, बिना किसी और के कंधे पर नजर रखे, करने की अनुमति होनी चाहिए। हमने कर्तव्यों का विभाजन, अनुमोदन सीमाएँ और ऑडिट ट्रेल्स बनाए क्योंकि अच्छी मंशाएँ अक्सर विश्वसनीय नियंत्रण तंत्र के रूप में विफल हो जाती हैं। एआई सिस्टम को भी यही सोच चाहिए। किसी मॉडल को सुरक्षित कहना बहुत कम बताता है जब तक आप नहीं जानते कि उसे क्या करने की अनुमति है और कौन इसका उपयोग कर रहा है।

कुछ चीज़ें इमारत से बाहर नहीं जा सकतीं

एक दूसरा कारण है कि मैं उस रात होस्टेड मॉडल पर भरोसा नहीं कर सकता था, और इसका उसकी संवेदनशीलताओं से कोई लेना‑देना नहीं है। मैं एक नियामक ब्रोकरेज के लिए तकनीक चलाता हूँ। मैं हमारे ब्रिच लॉग, प्रमाणपत्र, और लाइव एक्सप्लॉइट पेलोड को किसी और के क्लाउड में पेस्ट करके भेज नहीं सकता।

हमारा घटना डेटा वहीं रहता है जहाँ हमारे नियामकों की अपेक्षा होती है, हमारे अपने हार्डवेयर पर, इसलिए हमने वर्षों और आँखें खोल देने वाले हार्डवेयर बजट को खर्च करके ठीक वही बनाया। हमने इसे दुष्ट मॉडलों के बारे में पूर्वदृष्टि से नहीं बनाया। हमने इसे इसलिए बनाया क्योंकि हमारे जैसे फर्म अपने सबसे संवेदनशील डेटा और अब सबसे संवेदनशील टूलिंग को अपनी दीवारों के भीतर रखता है।

इनमें से कोई भी गार्डरेल्स के खिलाफ तर्क नहीं है। यह यह जानने के लिए तर्क है कि आपके गार्डरेल्स कहाँ इशारा करते हैं।

एक मॉडल जो फ़िशर को फ़िशिंग ईमेल लिखने में मदद करने से इनकार करता है, वह उपयोगी काम कर रहा है। एक मॉडल जो आपके सुरक्षा टीम को पहले ही पहुँच चुके फ़िशिंग ईमेल को पढ़ने में मदद करने से इनकार करता है, वह फ़िशर का काम उसके लिए कर रहा है, और इसके लिए आपको सदस्यता शुल्क ले रहा है।

रात 2 बजे आपको जिस उपकरण की आवश्यकता होगी, उसे अपने पास रखें।

व्यावहारिक सीख उबाऊ है, जैसे महत्वपूर्ण सीखें होती हैं। अपनी घटना प्रतिक्रिया को विक्रेता की देयता नीति को आउटसोर्स न करें। एक सक्षम मॉडल को अपने स्वामित्व वाले हार्डवेयर पर रखें, जो उन कार्यों के लिए हो जिन्हें व्यावसायिक मॉडल मुख्यतः अस्वीकार करेंगे, और यह पता लगाएँ कि वह मौजूद है इससे पहले कि आपको उसकी आवश्यकता वाली रात आए।

अप्रसिद्ध कारणों से उस हार्डवेयर आइटम की कई वर्षों तक रक्षा करने का इनाम यही है: जब रोचक विफलता आती है, तो आपके पास पहले से ही इमारत में वह एकमात्र उपकरण है जो साक्ष्य को देखेगा।

इकतीस साल पहले मैंने एक सप्ताहांत इस बात को जोड़ने में बिताया कि जब गलत व्यक्ति सब कुछ देख सकता है तो क्या होता है। इस बार, वह व्यक्ति होना अच्छा होता, जो देख सकता था।

रिचर्ड फोर्स एक्सएंटे में मुख्य प्रौद्योगिकी अधिकारी हैं, एक्सएंटे, एक वैश्विक प्राइम ब्रोकर, जिसमें 30+ वर्षों का अनुभव है वित्तीय संस्थानों, हेज फंड और फिनटेक कंपनियों के लिए प्रौद्योगिकी को डिजाइन और स्केल करने में।