साइबर सुरक्षा
प्रयोगशाला ने साबित किया है कि आपके एजेंट का सैंडबॉक्स केवल एक सुझाव है

एंथ्रोपिक ने 141,006 साइबर सुरक्षा मूल्यांकन रनों के माध्यम से जाना और तीन घटनाओं — छह रनों में — का पता लगाया जहां एक क्लाउड मॉडल 。
न तो जेलब्रेक, न ही एक पलायन प्रयास। , कंपनी स्पष्ट रूप से कहती है कि तीन मामलों में से किसी में भी मॉडल ने खुद को निकालने या परीक्षण वातावरण से बाहर निकलने का प्रयास नहीं किया। यह बस अपना काम करता रहा, और काम वास्तविक जगह पर ले गया।
यह अंतर बैठने लायक है, क्योंकि यह वही संरचना है जो कई सामान्य व्यवसायिक तैनाती के अंदर चल रही है।
सीमा एक वाक्य थी, और वाक्य गलत था
यहाँ क्या हुआ। एंथ्रोपिक और इसके तीसरे पक्ष के भागीदारों में से एक, इर्रेगुलर के बीच एक गलतफहमी ने परीक्षण मशीनों को लाइव इंटरनेट एक्सेस के साथ छोड़ दिया। मूल्यांकन प्रॉम्प्ट ने मॉडल को बताया कि इसके पास कोई इंटरनेट नहीं है।
तो मॉडल के पास एक कैप्चर-द-फ्लैग कार्य था — मानक सुरक्षा ड्रिल जहां आप एक लक्ष्य मशीन में तोड़ते हैं एक प्लांटेड रहस्य पुनर्प्राप्त करने के लिए — एक घोषित प्रतिबंध था कि इसके पास कोई इंटरनेट नहीं है, और एक वातावरण जो शांत रूप से प्रतिबंध का खंडन करता है। एक मामले में, एक काल्पनिक लक्ष्य कंपनी का नाम एक वास्तविक डोमेन से मेल खाता था। चार रनों में, क्लाउड ओपस 4.7 ने काल्पनिक लक्ष्य की तलाश की, वास्तविक कंपनी को खुले वेब पर पाया, और बुनियादी तकनीकों के साथ — कमजोर पासवर्ड और अनप्रमाणित एंडपॉइंट, एंथ्रोपिक के घटनाओं के विवरण में — प्रवेश किया। यह प्रमाण पत्र और एक डेटाबेस तक पहुंच प्राप्त किया जो कई सौ पंक्तियों के उत्पादन डेटा को पकड़ता था। सभी चार रनों में, मॉडल ने अंततः स्वीकार किया कि सिस्टम वास्तविक थे; कोई भी इस आधार पर रुका नहीं, और दो में यह तर्क दिया कि वास्तविक कंपनी अभ्यास का हिस्सा होनी चाहिए।
एक दूसरे मॉडल ने एक बूबी-ट्रैप्ड सॉफ़्टवेयर पैकेज बनाया जो अपने सेटअप निर्देशों में एक काल्पनिक एक के साथ मेल खाता था और इसे पाइपी — पब्लिक रजिस्ट्री में प्रकाशित किया जहां पायथन सॉफ़्टवेयर प्रकाशित और खींचा जाता है। यह लगभग एक घंटे के लिए लाइव था और पंद्रह वास्तविक मशीनों पर उतरा, जिनमें से एक सुरक्षा कंपनी का था जिसका स्कैनर नियमित रूप से पैकेज स्थापित करता है और उन्हें जांचता है।
जब स्कैनर ने पैकेज चलाया, तो छिपी हुई कोड ने कंपनी के प्रमाण पत्रों को एक संग्रह बिंदु पर खींच लिया जो मॉडल ने सेट किया था, और मॉडल ने उन्हें अपने बुनियादी ढांचे के अधिक हिस्सों तक पहुंचने के लिए उपयोग किया। रन की शुरुआत में, इसके अपने तर्क ने इसे सही ढंग से बुलाया था: यदि इंटरनेट वास्तविक था, तो प्रकाशन एक वास्तविक दुनिया का हमला होगा — “ठीक नहीं, और निश्चित रूप से इरादा समाधान नहीं।” फिर यह अपने ही निष्कर्ष से बाहर निकल गया। यह प्रमाण पत्र प्राधिकरणों को नहीं पहचान पाया जो अपने कनेक्शनों को सुरक्षित करते हैं — आउटफिट जो एक वेबसाइट को वह होने का दावा करते हैं जो यह दावा करता है — और कैलेंडर 2026 पढ़ता है, इसलिए यह तय किया कि वातावरण चरणबद्ध था और प्रश्न को फिर से नहीं देखा। जब स्वचालित स्कैनर पैकेज स्थापित करना शुरू किया, तो इसने उन्हें परीक्षण के अंदर स्क्रिप्टेड अभिनेताओं के लिए लिया।
तीसरा और सबसे हाल का मॉडल यह निर्धारित करने में सक्षम था कि इसका लक्ष्य वास्तविक था और अपने आप रुक गया — लेकिन केवल लगभग 9,000 लक्ष्यों को स्कैन करने और एक कंपनी के इंटरनेट सामने वाले अनुप्रयोग को एक उजागर डिबग पेज और एसक्यूएल इंजेक्शन के माध्यम से समझौता करने के बाद। एंथ्रोपिक का अपना फैसला: यहां तक कि उस मॉडल ने भी रुकने से पहले आगे बढ़ गया होगा जितना वे चाहेंगे।
लिखित में दफन यह पंक्ति है जो सबसे ज्यादा मायने रखती है किसी के लिए भी इस सामान को व्यावसायिक रूप से तैनात करने के लिए: यह “संभव है कि एक प्रॉम्प्ट जो क्लाउड को बताता है कि क्या इंटरनेट एक्सेस है क्लाउड के व्यवहार को बदल देगा जब यह वास्तविक प्रणालियों से संपर्क में आता है। “
इसे एक डिज़ाइन बयान के रूप में पढ़ें, न कि एक सुरक्षा पाद लेख के रूप में। एजेंट और खुले इंटरनेट के बीच एकमात्र चीज़ एक वाक्य थी जो एक वातावरण का वर्णन करती थी जो मौजूद नहीं थी। एजेंट ने विवरण पर विश्वास किया। विवरण गलत था। उसके बाद सब कुछ एजेंट द्वारा अपने उद्देश्य का पीछा करना था जो एक दुनिया का एक बुरा नक्शा था।
एंथ्रोपिक इसे एक संचालन विफलता कहता है, जो बुरी खबर है
कंपनी घटनाओं को “एक मॉडल संरेखण विफलता की तुलना में एक हार्नेस और संचालन विफलता के करीब” के रूप में वर्णित करती है। यह फ्रेमिंग शांत करने वाला होने का इरादा है, और एक प्रयोगशाला के लिए यह शायद है। एक व्यवसाय के लिए यह दूसरी तरह से उतरना चाहिए।
एक संरेखण समस्या मॉडल विक्रेता से संबंधित है। एक हार्नेस समस्या आपके साथ है। हार्नेस वह सब कुछ है जो आप मॉडल के चारों ओर बनाते हैं: जो प्रमाण पत्र यह रखता है, जो नेटवर्क यह बैठता है, जो यह पहुंच सकता है, जो इसे रोकता है। एंथ्रोपिक अपने मॉडलों को रेड-टीम करता है, बाहरी मूल्यांकन भागीदारों के साथ अनुबंध करता है, और कहता है कि यह एक तृतीय-पक्ष समीक्षा के लिए स्वतंत्र मूल्यांकक, मेट्र के साथ बातचीत कर रहा है। मिस्कॉन्फ़िगरेशन अभी भी एंथ्रोपिक और इसके भागीदार दोनों द्वारा अनदेखा किया गया था — पहली घटना अप्रैल में है, और किसी ने भी इसे जुलाई प्रतिलेख ऑडिट तक नहीं पकड़ा।
ऑडिट खुद दो दिन बाद शुरू हुआ — एक अलग तंत्र, जैसा कि एंथ्रोपिक ध्यान से नोट करता है, लेकिन एक ही वर्ग की विफलता। ओपनएआई के मॉडलों ने एक अज्ञात, अनपैच्ड खामी को एक आंतरिक सेवा में पाया जो बाहरी कोड लाइब्रेरी को प्राप्त करती है, इसका उपयोग एक सील किए गए शोध वातावरण से बाहर निकलने के लिए किया, और हगिंग फेस में लाइव सिस्टम में अपना रास्ता बनाया। ओपनएआई की जारी समीक्षा ने तब से : मॉडलों ने हगिंग फेस हमले में चार बाहरी सेवाओं पर सार्वजनिक रूप से उजागर प्रमाण पत्रों का उपयोग किया, साथ ही अन्य मूल्यांकन में कुछ और, हालांकि यह किसी भी गंभीरता या पैमाने पर और कुछ नहीं रिपोर्ट करता है। दो फ्रंटियर लैब, दो स्वतंत्र नियंत्रण विफलताएं, नौ दिनों के अंतराल पर प्रकट हुईं।
एक ईमानदार जटिलता पहले कि तुलना उतर जाए: दोनों प्रयोगशालाओं ने इन मूल्यांकनों को अपनी उत्पादन सुरक्षा परतों को जानबूझकर बंद करके चलाया, और एंथ्रोपिक कहता है कि इसके जहाजों पर सुरक्षा उपायों ने व्यवहार को अवरुद्ध कर दिया होगा। आपके एजेंट उन सुरक्षा उपायों के साथ चलते हैं। लेकिन सुरक्षा उपाय मॉडल परत पर रहते हैं, और अनुमति अंतराल आपके पास रहता है — कोई वर्गीकारक आपके सेवा खाते की जांच नहीं करता है।
अब अपनी सेटअप की तुलना इससे करें। अधिकांश एजेंट तैनाती सामान्य कंपनियों के अंदर सीमा को उसी तरह परिभाषित करती है जैसे मूल्यांकन करती है: निर्देशों में। केवल साझा ड्राइव से पढ़ें। उत्पादन में कुछ भी छूएं नहीं। भेजने से पहले पूछें। दूसरी ओर, यह सेवा खाता जो यह लॉग इन करता है — जो गैर-मानव लॉगिन आपके सॉफ़्टवेयर का उपयोग करता है, जिसे कोई व्यक्ति के रूप में नहीं सोचता है — जो अनुमतियां स्थापना दिवस पर देने में सुविधाजनक थीं, और किसी ने भी उस अंतर को तब से नहीं देखा है।
किसी ने भी ध्यान नहीं दिया, और यह दूसरी समस्या है
दो प्रभावित संगठन जिन तक एंथ्रोपिक पहुंच सकता था, उन्होंने पहले से ही गतिविधि का पता नहीं लगाया था और इसके बारे में कंपनी से संपर्क नहीं किया था — उन्होंने सीखा कि उन्हें जब प्रयोगशाला ने उन्हें बुलाया। एंथ्रोपिक कहता है कि यह अभी भी तीसरे को पहुंचाने की कोशिश कर रहा है। यह अपने स्वयं के प्रतिलेखों को पढ़कर घटनाओं का पता लगाया।
हगिंग फेस अपवाद है जो दिखाता है कि इसके लिए क्या लेता है। यह अपने सुरक्षा लॉग पढ़ने वाले एक एआई सिस्टम और वास्तविक अलर्ट से शोर को सॉर्ट करने के साथ घुसपैठ को पकड़ा। में यह हमले को एक आंतरिक प्रणाली से दूसरे में फैलते हुए एक सप्ताहांत पर वर्णित करता है।
सामान्य निगरानी इसे याद करती है क्योंकि देखने के लिए कुछ भी असामान्य नहीं है। आपका एजेंट एक अधिकृत खाते के रूप में लॉग इन करता है, जो प्रणालियों को पूछता है जो अनुमति दी जाती है, और मशीन गति से चलता है जो स्वचालन की तरह दिखता है क्योंकि यह स्वचालन है। आपके द्वारा स्वामित्व वाला प्रत्येक अलर्ट नियम एक अजनबी को पकड़ने के लिए लिखा गया था। यह एक अजनबी नहीं है।
यह एक असहज स्थिति छोड़ता है। गतिविधि की समीक्षा की मात्रा आपके द्वारा एजेंट को सौंपे गए काम के साथ स्केल करती है, और प्रदर्शित दो विकल्प हगिंग फेस के हैं — अपने स्वयं के सुरक्षा लॉग पर एआई ट्राइज चलाना — या एंथ्रोपिक का, जो 141,006 रनों की समीक्षा करने के लिए है। दूसरा लगभग किसी और के पास नहीं है, और यह केवल इसलिए चलाया गया क्योंकि एक प्रतियोगी के खुलासे ने इसे प्रेरित किया।
इसके बारे में क्या करना है
कार्रवाई संकीर्ण है और इसके लिए सुरक्षा टीम की आवश्यकता नहीं है।
एक एजेंट लें जो आप पहले से ही उत्पादन में है। खाता खोलें जिसे यह लॉग इन करता है और सूची बनाएं कि उस प्रमाण पत्र को क्या पहुंच मिल सकती है — न कि प्रॉम्प्ट में क्या कहा जाना चाहिए, लॉगिन वास्तव में अनुमति देता है। दो सूचियों की तुलना करें। अंतर आपका वास्तविक विस्फोट क्षेत्र है, और अधिकांश टीमों के लिए यह अपेक्षित से काफी व्यापक है, क्योंकि अनुमतियां स्थापना के दौरान कुछ काम करने के लिए दी जाती हैं और कभी वापस नहीं ली जाती हैं।
फिर प्रवर्तन परत को निर्देशों के बजाय ठीक करें — एंटरप्राइज़ एआई के लिए सुरक्षित वास्तुकला का व्यावहारिक संस्करण चित्र को हटा दें। यदि एजेंट को इंटरनेट तक नहीं पहुंचना चाहिए, तो नेटवर्क मार्ग को हटाने के बजाय लिखें कि इसके पास कोई इंटरनेट एक्सेस नहीं है। यदि यह उत्पादन में नहीं लिखना चाहिए, तो एक पढ़ने योग्य प्रमाण पत्र दें न कि नीति वाक्य। यदि यह एक नंबर से परे नहीं खर्च करना चाहिए, तो खर्च होने वाले स्थान पर टोपी रखें।
इन घटनाओं में मॉडलों ने अपने स्वयं के तर्क के निशान के अनुसार एक दिलचस्प कर्मचारी की तरह व्यवहार किया जिन्हें एक असटीक विवरण दिया गया था। दो ने साक्ष्य को अपने सामने से गुजरने के लिए खुद को बात की क्योंकि उन्होंने ब्रीफ पर कमरे पर विश्वास किया। यह एक दोष नहीं है जिसे आप प्रॉम्प्ट के माध्यम से बाहर निकाल सकते हैं, और प्रयोगशालाओं ने हर संसाधन के साथ, ऐसा नहीं किया।
मान लें कि एजेंट जो कुछ भी आप इसके बारे में बताते हैं उसका विश्वास करेगा। फिर सुनिश्चित करें कि वातावरण सहमत है।












