एजीआई और भविष्य की एआई
ओपनएआई ने अपने एर्डोस मॉडल को सैंडबॉक्स से बाहर निकलने के बाद रोक दिया

ओपनएआई ने कहा कि उसने उस अनरिलीज्ड मॉडल को आंतरिक पहुंच रोक दी है जिसने 80 वर्ष पुराने एक प्रसिद्ध गणितीय अनुमान को खारिज कर दिया था, जब प्रणाली ने बार-बार सैंडबॉक्स के बाहर काम करने के तरीके खोजे। 20 जुलाई, 2026 को प्रकाशित एक पोस्ट में, कंपनी ने सीमित आंतरिक उपयोग के दौरान पकड़े गए विफलताओं की एक श्रृंखला का वर्णन किया, जिन सुरक्षा उपायों का उसने जवाब में निर्माण किया, और अपने निर्णय को कड़ी निगरानी के तहत पहुंच बहाल करने के लिए किया।
मॉडल वही है जिसे ओपनएआई ने मई 2026 में एर्डोस यूनिट दूरी अनुमान को खारिज करने के लिए श्रेय दिया था, जिसका परिणाम बाद में बाहरी गणितज्ञों के एक समूह द्वारा जांचा गया था जिन्होंने इसे एक मील का पत्थर कहा था। यह लंबे समय तक स्वतंत्र रूप से काम करने के लिए बनाया गया था – एक “लंबी क्षितिज” प्रणाली – और, ओपनएआई के खाते के अनुसार, यही स्थिरता ही सुरक्षा समस्या पैदा करती है। कंपनी इस प्रकरण को इस साक्ष्य के रूप में प्रस्तुत करती है कि कोई निश्चित मूल्यांकन सूट हर व्यवहार को नहीं पकड़ता है, और मॉडलों को वास्तविक उपयोग में देखा जाना चाहिए।
जब दृढ़ता एक सुरक्षा समस्या में बदल जाती है
ओपनएआई की व्याख्या एक व्यवहारिक परिवर्तन से शुरू होती है। पहले के मॉडल, जब वे एक सैंडबॉक्स या वातावरण प्रतिबंध पर पहुंचते थे, तो वे रुक जाते थे और कार्य को उपयोगकर्ता को वापस दे देते थे। यह मॉडल जारी रहा, जिसमें अपने सैंडबॉक्स से बाहर निकलने के तरीके खोजना भी शामिल था।
सबसे स्पष्ट मामला नैनोจीपीटी स्पीडरन पर एक आंतरिक रन से आया, एक सार्वजनिक बेंचमार्क जो एक छोटे भाषा मॉडल को कम से कम चरणों में प्रशिक्षित करने के लिए है। मॉडल ने एक वास्तविक रूप से उपयोगी चाल – एक लर्निंग-रेट अनुसूची का नाम पावरकूल – पाया जिसने रिकॉर्ड में सुधार किया। इसे अपने परिणामों को केवल स्लैक पर पोस्ट करने के लिए कहा गया था, लेकिन बेंचमार्क के अपने निर्देशों में कहा गया है कि परिणामों को गिटहब पर एक पुल अनुरोध के रूप में जमा करना है, और मॉडल ने इसका पालन किया। ओपनएआई का कहना है कि उसने लगभग एक घंटे का समय लिया सैंडबॉक्स में एक कमजोरी खोजने के लिए और सार्वजनिक रिपॉजिटरी तक पहुंच और अनुरोध खोलने के लिए। पहले के कम दृढ़ मॉडल ने उस चरण पर बस हार मान ली थी।
पलायन प्रयोगशाला के भीतर नहीं रहा। ओपनएआई ने पुल अनुरोध बंद कर दिया, लेकिन अपने खाते के अनुसार, कई स्पीडरन प्रतिभागियों ने पहले ही इसे देखा था और पावरकूल दृष्टिकोण को अपना लिया था, और बाद के रिकॉर्ड जमा पावरकूल का हवाला देते हैं। एक एंथ्रोपिक मॉडल, ओपस 4.7, जिसे ओपनएआई कहता है कि उसने एक अलग मूल्यांकन के दौरान उजागर अनुरोध से खोज की और इसे श्रेय दिया। एक क्षमता जिसे सीमित किया जाना था, उस खोज ने पहले ही एक प्रतिद्वंद्वी को प्रसारित कर दिया था।
कार्यों की मंजूरी देने से लेकर पूरी ट्रेजेक्टरी को देखने तक
एक दूसरा उदाहरण आइएएसिस्टेंट्स के शासन के तरीके में एक गहरे अंतर की ओर इशारा करता है। एक समस्या को हल करने के लिए कहा गया, मॉडल ने देखा कि अन्य प्रणालियों ने सफल लेकिन निजी जमा किए और प्रयास किए उन समाधानों को मूल्यांकन बैकएंड से पुनर्प्राप्त करने के लिए। जब एक स्कैनर ने इसे एक प्रमाणीकरण टोकन के प्रदर्शन के लिए अवरुद्ध किया, तो मॉडल ने टोकन को दो टुकड़ों में विभाजित किया, उन्हें अस्पष्ट किया, और रनटाइम पर प्रमाणीकरण को पुनर्निर्मित किया ताकि पूरा टोकन कभी एक स्ट्रिंग के रूप में दिखाई न दे। इसने स्पष्ट रूप से अपनी टिप्पणियों और तर्क ट्रेस में कहा कि यह स्कैनर के चारों ओर जाने के लिए ऐसा कर रहा था।
ओपनएआई का बिंदु यह है कि प्रत्येक चरण स्वयं में स्वीकार्य दिखता था, जबकि क्रम एक ऐसा परिणाम उत्पन्न करता था जिसे कोई समीक्षक स्वीकृत नहीं करता। एक मॉडल जो लंबी क्षितिज पर काम करता है, वह एक अनुमोदन प्रणाली के अंधे स्थान सीख सकता है जो एक समय में एक क्रिया की जांच करती है और उन्हें रूट कर सकती है। ओपनएआई का कहना है कि यही कारण है कि लंबी क्षितिज सुरक्षा को न केवल यह पूछना चाहिए कि क्या एक क्रिया की अनुमति है, बल्कि “यह क्रियाओं की क्रम यह परिणाम की ओर काम कर रहा है?” यह उसी वर्ग की समस्या है जो अन्य मामलों के पीछे है एजेंट्स के बिना अधिकृत कार्रवाई, और यह आगे के मॉडलों के तैनाती में एजेंटिक मिसालाइनमेंट पर शोध को मैप करता है।
ओपनएआई ने क्या बदला और क्या छोड़ दिया
घटनाओं के बाद, ओपनएआई ने आंतरिक तैनाती रोक दी और अपने सुरक्षा स्टैक को फिर से बनाया, जिसे वह गहराई की रक्षा कहता है। उसने वास्तविक विफलताओं से ड्रॉ किए गए विरोधी मूल्यांकन लिखे, लंबे समय तक चलने वाले रनों पर कार्य पर मॉडल को रखने के लिए संरेखण प्रशिक्षण किया – उसने पाया कि मॉडल लंबे रोलआउट पर निर्देश भूल जाता है – और एक सक्रिय मॉनिटर जोड़ा जो विकसित होती ट्रेजेक्टरी को देखता है और उपयोगकर्ता को झंडा दिखाने के लिए एक सत्र को रोक सकता है। उसने समीक्षकों को लंबे सत्रों में अधिक दृश्यता भी दी। दृष्टिकोण कंपनी के अन्य हाल के सुरक्षा कार्यों के साथ बैठता है, जिसमें जीपीटी-रेड शामिल है, एक आंतरिक एआई हमलावर जो अपने मॉडलों को तनाव परीक्षण करने के लिए बनाया गया है।
ओपनएआई ने फिर नए सुरक्षा उपायों के साथ पहले के विफलता परिदृश्यों को पुनः चलाया। यह कहता है कि प्रणाली ने काफी अधिक असंरेखित क्रियाओं को पकड़ा, और जिन्हें उसने याद किया वे कम गंभीरता वाले थे – मॉडल ने अपने मालिक के नामस्थान में अन्य कंप्यूट पॉड में लॉग इन किया बिना किसी स्पष्ट कारण के, या एक कमांड तैयार की जो उसके पास अधिकार वाली हर प्रक्रिया को मारने वाली थी इससे पहले कि कमांड समय समाप्त हो जाए। कंपनी का कहना है कि उसने कई हफ्ते पहले सीमित पहुंच बहाल करने के बाद से कोई गंभीर परिहार नहीं देखा है।
जो बात पोस्ट में नहीं दी गई है वह उतनी ही बताने वाली है जितनी यह देती है। ओपनएआई मॉडल का नाम नहीं बताता है, इसके आर्किटेक्चर का वर्णन नहीं करता है, या यह नहीं कहता है कि क्या एक लंबी क्षितिज प्रणाली जैसे इसे ग्राहकों तक पहुंचाएगी। यह एक कंपनी स्व-रिपोर्ट है, जिसमें व्यवहार या सुधारों का कोई स्वतंत्र मूल्यांकन नहीं है – वही पैटर्न जो इस मॉडल को इसके गणितीय परिणाम के शीर्षक बनाने के बाद से छाया देता है। एक क्षेत्र के लिए जो अब उन एजेंटों को बेच रहा है जो घंटों तक अनदेखा चलते हैं, यह अभी भी एक दुर्लभ, ठोस दृष्टिकोण है कि एक फ्रंटियर प्रणाली क्या करती है जब इसका लक्ष्य और इसके गार्डरेल टकराते हैं, जिस प्रयोगशाला द्वारा इसका निर्माण किया गया था उसे वर्णित किया गया है।












