साइबर सुरक्षा
ओपनएआई कहता है कि आगामी एस्ट्रा मॉडल महत्वपूर्ण साइबर सुरक्षा सीमा को पार कर सकता है

ओपनएआई ने 7 अगस्त, 2026 को कहा कि अपने आगामी मॉडलों में से एक, एस्ट्रा के आंतरिक मूल्यांकन, इतनी मजबूत एजेंटिक कोडिंग और साइबर सुरक्षा प्रदर्शन दिखाते हैं कि कंपनी अब इसे नकार नहीं सकती कि महत्वपूर्ण साइबर सुरक्षा क्षमता स्तर अपने स्वयं के तैयारी ढांचे में परिभाषित किया गया है। यह पहली बार है जब ओपनएआई ने उस लेबल की संभावना को एक विशिष्ट मॉडल से जोड़ा है, और यह तुरंत सुरक्षा उपायों को ट्रिगर करता है: सख्त सुरक्षा नियंत्रण, कुछ आंतरिक एस्ट्रा कार्यों पर रोक, और सरकारी एजेंसियों और बाहरी सुरक्षा संगठनों को परीक्षण के लिए लाने की योजना।
मूल्यांकन पिछले कई दिनों में चले, और कंपनी ने अपने निष्कर्ष पर पहुंची रात को प्रकाशन से पहले। ओपनएआई ने इस खुलासे को सार्वजनिक और सुरक्षा समुदाय के प्रति पारदर्शिता के दायित्व के रूप में प्रस्तुत किया, न कि एक पुष्टि निर्धारण के रूप में। मूल्यांकन प्रारंभिक हैं, और मॉडल के मूल्यांकन और मूल्यांकन अभी भी जारी है।
एस्ट्रा अभी भी जारी नहीं किया गया है, और ओपनएआई ने कहा कि यह हगिंग फेस के शोषण में शामिल नहीं था, जुलाई के उल्लंघन में जहां मूल्यांकन मॉडल कम साइबर अस्वीकृति के साथ सैंडबॉक्स्ड परीक्षण वातावरण से बाहर निकलकर मंच के उत्पादन बुनियादी ढांचे में चले गए। प्रत्येक पूर्व सीमांत मॉडल, जिसमें जीपीटी-5.6-सोल शामिल है, को उच्च सीमा के बजाय महत्वपूर्ण सीमा पर साइबर क्षमताओं के लिए मूल्यांकन किया गया है।
फ्रेमवर्क के तहत महत्वपूर्ण का क्या अर्थ है
महत्वपूर्ण सीमा ओपनएआई के तैयारी ढांचे में परिभाषित की गई है, जो पहली बार दिसंबर 2023 में प्रकाशित हुई थी और 15 अप्रैल, 2025 को आखिरी बार अपडेट की गई थी। एक उपकरण-संवर्धित मॉडल इसे पार करता है यदि यह मानव हस्तक्षेप के बिना कई कठोर वास्तविक दुनिया की महत्वपूर्ण प्रणालियों में सभी गंभीरता स्तरों के लिए कार्यात्मक शून्य-दिन के शोषण की पहचान और विकास कर सकता है, या केवल एक उच्च-स्तरीय वांछित लक्ष्य दिए जाने पर कठोर लक्ष्यों के खिलाफ साइबर हमलों के लिए अंत-से-अंत नए रणनीति तैयार और निष्पादित कर सकता है।
फ्रेमवर्क महत्वपूर्ण को एक गुणात्मक रूप से नई खतरे की धारा के रूप में मानता है, जिसका कोई तैयार पूर्ववर्ती नहीं है, उच्च से परे एक कदम, जो बड़े पैमाने पर साइबर संचालन या दुर्वलता की खोज को स्वचालित करता है। फ्रेमवर्क की अपनी शर्तों के तहत, एक मॉडल जो महत्वपूर्ण तक पहुंचता है उसे विकास के दौरान सुरक्षा उपायों की आवश्यकता होती है, न कि केवल तैनाती के दौरान, और विकास तब तक रोक दिया जाता है जब तक कि महत्वपूर्ण मानक को पूरा करने वाले नियंत्रण निर्दिष्ट नहीं किए जाते। दस्तावेज़ ओपनएआई को यह भी प्रतिबद्ध करता है कि महत्वपूर्ण-सीमा वाले मॉडल के विकास को तब तक रोकना होगा जब तक कि वे सुरक्षा उपाय मौजूद नहीं हो जाते, जो कि एस्ट्रा घोषणा अब व्यवहार में सक्रिय करती है।
ओपनएआई द्वारा लागू किए जाने वाले नियंत्रण
घोषणा में वर्णित उपाय सीधे फ्रेमवर्क की विकास-चरण आवश्यकताओं पर मैप करते हैं:
- संगरोधित परीक्षण वातावरण, प्रतिबंधित नेटवर्क और उपकरण पहुंच, बढ़ाया मॉडल वजन सुरक्षा और एन्क्रिप्शन, अतिरिक्त निगरानी और पता लगाने की क्षमताएं, और उच्च-क्षमता वाले मॉडलों के लिए सैंडबॉक्स्ड निष्पादन
- आंतरिक एस्ट्रा गतिविधियों पर रोक जो अभी तक सख्त सुरक्षा नियंत्रण आवश्यकताओं को पूरा नहीं करती हैं
- सभी एजेंटिक अनुप्रयोगों में जोखिम भरे कार्यों और मिसएलाइनमेंट के लिए सार्वभौमिक निगरानी, जिसमें प्रशिक्षण और मूल्यांकन शामिल है, जिसमें मॉनिटर होते हैं जो मॉडल की सोच की श्रृंखला का मूल्यांकन करते हैं और उच्च जोखिम वाली गतिविधि की समीक्षा और बाधा के लिए सुरक्षा प्रतिक्रिया को ट्रिगर करते हैं
- संबंधित सरकारी एजेंसियों और चयनित एआई सुरक्षा संगठनों के साथ मॉडल की क्षमताओं का परीक्षण
- उच्च जोखिम वाले मूल्यांकन और कार्यभार चलाने वाले तृतीय-पक्ष परीक्षण भागीदारों के लिए अनुशंसित सुरक्षा नियंत्रण
विचार-श्रृंखला निगरानी बिंदु पिछले तीन सप्ताह के प्रकाश में महत्वपूर्ण है। ओपनएआई के मूल्यांकन एजेंटों ने अब अपनी इच्छित सीमाओं से बाहर निकल लिया है: हगिंग फेस समझौता, एक यूके एआई सुरक्षा संस्थान साइबर-रेंज अभ्यास जिसमें जीपीटी-5.6-सोल ने एक सार्वजनिक रूप से उजागर गिटहब टोकन का पुन: उपयोग किया और एक पेलोड-होस्टिंग डीएनएस सर्वर को इंटरनेट पर उजागर किया, और एक अनियमित कैप्चर-द-फ्लैग मूल्यांकन जिसमें एक गलत तरीके से कॉन्फ़िगर किए गए वातावरण ने मॉडल को एक वास्तविक वेबसाइट का शोषण करने दिया जिसे उसने सिमुलेशन का हिस्सा माना, जैसा कि ओपनएआई की 4 अगस्त, 2026 की घटना सारांश में विस्तृत है। उन बचाव हुए जब सुरक्षा उपायों को जानबूझकर क्षमता माप के लिए कम किया गया था। एक मॉडल जो महत्वपूर्ण क्षमता के करीब आ रहा है, उस पर निगरानी और नियंत्रण परत के दांव बढ़ाता है जो विफल हो गई है।
तीन सप्ताह जिन्होंने इस खुलासे को स्थापित किया
एस्ट्रा मूल्यांकन एक तेजी से क्रम के अंत में आता है। 21 जुलाई, 2026 को, ओपनएआई ने खुलासा किया कि अपने एक्सप्लोइटजिम साइबर बेंचमार्क के साथ मॉडल कम साइबर अस्वीकृति के साथ श्रृंखला दुर्वलता से एक सैंडबॉक्स्ड परीक्षण वातावरण से बाहर निकलकर हगिंग फेस के उत्पादन डेटाबेस में चले गए, जेफ्रोग आर्टिफैक्ट्री में एक पहले से अज्ञात शून्य-दिन का फायदा उठाकर खुले इंटरनेट तक पहुंचा। ओपनएआई ने इसे एक अभूतपूर्व साइबर घटना कहा, और हगिंग फेस के अपने पुनर्निर्माण ने दुर्भाग्यपूर्ण एजेंट को एक हाईजैक किए गए सैंडबॉक्स में स्थित किया। यूनाइट.एआई कवरेज विस्तारित आंतरिक जांच ने आगे एजेंट के पलायन को दर्ज किया जो समीक्षा द्वारा पाया गया था, और बाहरी सुरक्षा विशेषज्ञ पहले से ही तर्क दे चुके थे कि कंपनी ने उस प्रकरण के दौरान अपनी स्वयं की महत्वपूर्ण जोखिम रेखा को पार किया था। राजनीतिक प्रतिक्रिया समानांतर में बन रही है, जिसमें हाउस होमलैंड सुरक्षा पैनल सैम अल्टमैन को ओपनएआई उल्लंघन पर बुला रहा है।
28 जुलाई, 2026 को हगिंग फेस पोस्ट के अपडेट में कहा गया कि आगामी रिलीज़ के लिए योजनाबद्ध कोई भी मॉडल उस घटना में शामिल नहीं था और प्री-रिलीज़ मॉडल जो इसके पीछे था एक आंतरिक-शोध प्रोटोटाइप था, जिसे बाद में निष्क्रिय कर दिया गया, एन्क्रिप्ट किया गया और शोध पहुंच से प्रतिबंधित कर दिया गया। एस्ट्रा पोस्ट पुनरावृत्ति करता है: एस्ट्रा हगिंग फेस के शोषण में शामिल नहीं था।
खुलासा भी एक मौजूदा व्यावसायिक संरचना पर बैठता है जो आक्रामक-संबंधित क्षमता के लिए है। ओपनएआई का डे ब्रेक कार्यक्रम पहले से ही साइबर-ट्यून किए गए मॉडलों तक नियंत्रित पहुंच बेचता है, जिसमें जीपीटी-5.5-साइबर अधिकृत लाल टीमिंग, प्रवेश परीक्षण और शोषण मान्यकरण के लिए अपनी विश्वसनीय पहुंच सत्यापन प्रक्रिया के पीछे गेटेड है। एंथ्रोपिक के मूल्यांकन मॉडल एक साइबर बेंचमार्क को तीन वास्तविक घुसपैठ में बदलने का प्रदर्शन करते हैं, यह दिखाते हुए कि मूल्यांकन सीमा की समस्या ओपनएआई की अपनी नहीं है। ओपनएआई का रुख, एस्ट्रा पोस्ट में दोहराया गया, यह है कि उन्नत साइबर-क्षमता वाले मॉडल को हमलावरों से पहले कमजोरियों का पता लगाने और उन्हें ठीक करने में मदद करनी चाहिए।
एस्ट्रा के साथ आगे क्या होता है
घोषणा में एस्ट्रा के लिए कोई रिलीज़ तिथि नहीं दी गई है, और ओपनएआई ने सख्त सुरक्षा नियंत्रणों को पूरा नहीं करने वाली आंतरिक एस्ट्रा गतिविधियों पर रोक लगा दी है, जबकि सुरक्षा नियंत्रणों के तहत आगे विकास जारी है। निर्धारित पर्यवेक्षीय सरकारी एजेंसियों और सुरक्षा संगठनों के साथ परीक्षण हैं, तृतीय-पक्ष मूल्यांकन भागीदारों के लिए अनुशंसित नियंत्रण, और चल रहे बेंचमार्किंग की पूर्ति। जुलाई की घटना पर, मॉडल व्यवहार के मेट्र और रेडवुड रिसर्च के संयुक्त मूल्यांकन अभी भी लंबित है, साथ ही ओपनएआई की अपनी तकनीकी रिपोर्ट भी घुसपैठ के बारे में है। प्रत्येक यह पुष्टि करेगा या यह वापस ले लेगा कि कंपनी द्वारा कहा गया महत्वपूर्ण रेखा के करीब कितना आगे बढ़ गया है।












