Anderson का एंगल
भाषा मॉडल्स एक राज़ रखने में असमर्थ हैं

एआई मॉडल्स राज़ नहीं रख सकते। यहां तक कि जब उन्हें खुलासा न करने के लिए कहा जाता है, तो उनका लेखन उन्हें दूर कर देता है, और इसे छिपाने की कोशिश करना इसे और भी आसान बना देता है।
जानबूझकर कुछ न सोचना बहुत मुश्किल है। इसका एक क्लासिक उदाहरण 1960 की ब्रिटिश साइंस फिक्शन थ्रिलर विलेज ऑफ द डैम्ड के अंत में दिखाया गया है, जहां हमारे बलिदानी नायक ने होस्टाइल एलियन आक्रमणकारियों के एन्क्लेव में एक बम को छुपाया है, जो बच्चों के रूप में प्रस्तुत हो रहे हैं। हालांकि, चूंकि उनकी दूरसंचार शक्तियां उनके इरादे को समझने के लिए जोखिम में हैं trước कि वह दुनिया को खतरे से मुक्त कर सकते हैं, उन्हें समय के लिए देरी करने के लिए किसी भी चीज़ पर ध्यान केंद्रित करने के लिए मजबूर किया जाता है जो नहीं-बम है:
विरोधाभास यह है कि कुछ न सोचने के लिए, आपको इसे किसी तरह से अपना ध्यान केंद्रित करना होगा; और यह जाना जाता है सिंड्रोम अधिकांश लोगों को कम नाटकीय संदर्भों में अनुभव होने की संभावना है।
लार्ज लैंग्वेज मॉडल (एलएलएम), जिसका आधार आधार पर है, जानकारी को दबाने में समान कठिनाई का अनुभव करते हैं, क्योंकि उन्हें एक उपयोगकर्ता द्वारा ऐसा करने के लिए कहा जाता है; और चूंकि वे व्यावसायिक जानकारी नेटवर्क के केंद्र में रखे जा रहे हैं, उनकी निर्दोष प्रवृत्ति की कमी कई कंपनियों के लिए एक दायित्व साबित हो सकती है।
इस साल की शुरुआत में, एक शोध सहयोग ने चांदर रिसर्च लैब के नेतृत्व में, एलएलएम के संदर्भ में इस चुनौती को प्राइवेट स्टेट इंटरएक्टिव टास्क्स (पीएसआईटी) के रूप में परिभाषित किया, जो ‘एक एजेंट को छुपी हुई जानकारी बनाने और बनाए रखने की आवश्यकता होती है, जबकि सार्वजनिक प्रतिक्रियाओं को संगत बनाए रखने की आवश्यकता होती है’, और पाया कि ओपनएआई और अलीबाबा से परीक्षण मॉडल इस तरह के कार्य को करने में असमर्थ थे।
इसे मत कहो…
हालांकि यह पहले से ही जाना जाता है कि बड़े मॉडल अधिक रिसाव करते हैं, नए शोध से पता चलता है कि राज्य-कला भाषा मॉडल एक कमांड का पालन करेंगे या नहीं जानकारी को दबाने के लिए, जबकि अभी भी एक विषय या थीम में आउटपुट उत्पन्न करने की आवश्यकता है जो ‘प्रतिबंधित’ शब्द या विचार को शामिल कर सकता है।
कागज़ का निष्कर्ष है कि सभी मॉडल जिन्हें यह अध्ययन करता है, कुछ तरह से एक प्रवृत्ति से प्रभावित होते हैं जो ‘राज’ को प्रकट करने के लिए, पाते हैं कि पांच-आलेख (~450 शब्द) और कहानियां ‘स्लिप्स’ के लिए एक विस्तृत कैनवास प्रदान करती हैं – हालांकि बहुत छोटे चुटकुले पर्याप्त स्कोप प्रदान नहीं करते हैं।
इसके अलावा, मॉडल को अधिक जोर से छुपाने के लिए कहा जाता है, जितना अधिक यह जोखिम में है कि यह एक एलएलएम द्वारा बीस लगातार प्रयासों में ‘गुप्त शब्द’ को प्रकट कर देगा।

नई कागज़ से: पांच मुख्य मॉडलों में, लंबे फॉर्म लेखन में छुपी हुई अवधारणाएं विश्वसनीय रूप से रिसाव करती हैं; छोटे चुटकुले नहीं करते हैं; और मजबूत ‘छुपाएं’ निर्देश आउटपुट को गुप्त से दूर धकेलते हैं, लेकिन संकेत को विचलन द्वारा पता लगाने योग्य बनाते हैं। स्रोत
यह कार्य व्यावसायिक संचालन के लिए अत्यधिक प्रासंगिक है, जहां विपणन और पीआर आउटरीच से लेकर आंतरिक रिपोर्ट तक विभिन्न चैनलों को जानकारी को चयनात्मक रूप से प्रस्तुत करने की आवश्यकता होती है; हालांकि, इन सभी प्रक्रियाओं को पूरी श्रृंखला की आवश्यकता होती है, यदि केवल यह सुनिश्चित करने के लिए कि क्या दबाना है।

कागज़ में एक उदाहरण परिदृश्य यह दिखाता है कि कैसे छुपाई गई जानकारी अनजाने में असंबंधित आउटपुट को आकार दे सकती है, एक एलएलएम को अपनी कंपनी की वित्तीय अस्थिरता का खुलासा न करने का निर्देश दिया जाता है, फिर भी नकदी की कमी और पूंजी तनाव से संबंधित वाक्यांशों की ओर बढ़ता है, जिससे पाठक को छुपी हुई संदर्भ का अनुमान लगाने की अनुमति मिलती है।[/em>
लेखक कहते हैं*:
‘भाषा मॉडल्स छुपी हुई जानकारी को विश्वसनीय रूप से कम्पार्टमेंटलाइज़ नहीं कर सकते। एक राज़ प्रॉम्प्ट में मॉडल के लेखन को आकार देता है, और दूसरा मॉडल उस आकार का पता लगा सकता है। साहित्यिक शब्द हमेशा दबाया जाता है, लेकिन अवधारणा नहीं है। यह सात मॉडलों, तीन शब्द सेट, सिस्टम प्रॉम्प्ट बनाम उपयोगकर्ता प्रॉम्प्ट, और दो स्वतंत्र क्रॉस-मॉडल गेसर्स में समान है।’
‘…हम सोचते हैं कि ट्रांसफॉर्मर्स की उच्च-विश्वास वाली जानकारी तक पहुंच ही उन्हें राज़ रखने में मुश्किल बनाती है। भले ही एक एलएलएम को एक शब्द को रिसाव न करने का प्रयास करने के लिए कहा जाए, तो भी उसे उस शब्द पर ध्यान देना होगा, जिससे आकस्मिक रिसाव का मार्ग प्रदान किया जा सके। ‘
‘किसी चीज़ से बचने के लिए, एक मानव को इसके बारे में सोचना होगा, और एक ट्रांसफॉर्मर को इसके बारे में ध्यान देना होगा। जब दो अवधारणाएं मॉडल द्वारा लगभग समान रूप से पसंद की जाती हैं (जैसे कि एक कार्यालय नौकरी या एक ऑर्केस्ट्रा में दूसरे वायलिन के बारे में एक कहानी लिखना), तो मॉडल के निर्णय लेने में उस जानकारी से प्रभावित होने की संभावना है जिसे यह प्रकट नहीं करना चाहता है।’
हालांकि डीपसीक और चैटजीपीटी-5.4 मॉडल इस तरह से प्रदर्शन करने में अपवाद थे, वे दोनों रिसाव करते थे; जीपीटी-5.4 के मामले में, यह एक परीक्षण में 50% (यानी, मौका स्तर से नीचे) स्कोर किया, जहां इसे एक अवधारणा से बचने के लिए कहा गया था; यह वस्तुतः एक ‘रिवर्स स्पाइक’ या संकेतक के रूप में कार्य करता है, न कि मॉडल को ‘शांत’ रखने के अनुरोध के रूप में।
लेखक इस सिंड्रोम को एलएलएम में परिमित एंट्रोपी बजट के रूप में परिभाषित करते हैं, जहां मॉडल की अप्रत्याशितता (जो इस मामले में बहुत उपयोगी होगी) इसकी अनिवार्य कमी की कमी द्वारा बाधित है। सरल शब्दों में, मॉडल ईंट की दीवार या बेसबॉल स्कोर पर हमारी तरह ध्यान केंद्रित नहीं कर सकता है; हालांकि, लेखक यह भी नोट करते हैं कि मॉडल को एक वैकल्पिक अवधारणा पर विचार करने के लिए देने से समस्या में सुधार हो सकता है, लेकिन इसे समाप्त नहीं किया जा सकता है। हालांकि, मॉडल को निर्देश देने के दौरान एक असंबंधित अवधारणा को ध्यान में रखना आउटपुट में ‘नकली’ अवधारणा को उलझाने के लिए निर्धारित लगता है।
कागज़ के सबसे दिलचस्प निष्कर्षों में से एक यह है कि अध्ययन की स्थिति तब और भी बढ़ जाती है जब नियंत्रण पाठ सीधे उपयोगकर्ता संदेशों में शामिल किया जाता है, न कि सिस्टम प्रॉम्प्ट में (यानी, मानव उपयोगकर्ता द्वारा एआई को दी गई एक सेट पूर्व शर्तें, आदान-प्रदान से पहले), क्योंकि चैटजीपीटी जैसे जीयूआई में प्रश्न टाइप करना वास्तव में इंटरैक्शन के लिए मानक परिदृश्य है।
इसके अलावा, यह ध्यान देने योग्य है कि एक लक्षित परीक्षण में यह पुष्टि की गई है कि छोटे मॉडल इस प्रवृत्ति से पीड़ित नहीं हैं (हालांकि यह संभवतः समान रूप से कम क्षमता के साथ आता है)।
नई कागज़ का शीर्षक है क्या आप एक राज़ रख सकते हैं? भाषा मॉडल लेखन में अनैच्छिक जानकारी रिसाव, और यह शिकागो विश्वविद्यालय और ब्रिटिश कोलंबिया विश्वविद्यालय के दो लेखकों से आता है।
विधि
अध्ययन मुख्य रूप से पांच मुख्य मॉडलों पर केंद्रित है: क्लॉड ओपस 4.6 और सोनेट 4.6, एंथ्रोपिक से; जीपीटी-5.4 ओपनएआई से; लामा 4 मेवरिक मेटा से; और डीपसीक वी3.2। अतिरिक्त मान्यकरण परीक्षण एक्सएआई के ग्रोक 4 और गूगल के जेमिनी 2.5 प्रो के साथ किए गए, जबकि अलग स्केलिंग प्रयोग लामा 3.2 3बी, लामा 3.1 8बी, लामा 3.3 70बी, और गेमा 3 को 4बी, 12बी, और 27बी पैरामीटर के साथ जांचते हैं।
सूक्ष्म रूप से रिसाव को मापने के लिए, शोधकर्ताओं ने एक दो-विकल्प बलपूर्वक चयन (2एएफसी) परीक्षण का उपयोग किया, जो मनोविज्ञान साहित्य में एक मानक मीट्रिक है, जिसमें एक दूसरे मॉडल को दो कहानियां दिखाई जाती हैं और पूछा जाता है कि कौन सी एक छुपे हुए शब्द को छुपाती है।
चूंकि यादृच्छिक अनुमान 50% सटीकता का उत्पादन करेगा, 50% से ऊपर या नीचे के स्कोर यह संकेत देंगे कि लेखन में छुपी हुई सेमांटिक निशान अभी भी पता लगाने योग्य हैं।
पहले प्रयोग में, लेखक-गेसर सेटअप में, एक मॉडल को एक छुपा हुआ शब्द दिया गया था, साथ ही निर्देश थे कि यह छुपा हुआ शब्द को छुपाने के लिए; इसके साथ जुड़े संबंधों से बचने के लिए; या एक डिकॉय अवधारणा की ओर ध्यान दें। सिस्टम को तब कहानियां, निबंध और विभिन्न लंबाई के चुटकुले उत्पन्न करने का काम सौंपा गया था, जबकि दूसरा मॉडल या तो छुपे हुए शब्द को सीधे पहचानने का प्रयास करता था, या विभिन्न छुपे हुए प्रॉम्प्ट से प्रभावित पाठ के बीच अंतर करता था।
पांच स्थितियों का परीक्षण किया गया था;

मुख्य मॉडलों में परीक्षण की गई पांच स्थितियां।
शोधकर्ताओं ने चार प्रकार के लेखन कार्यों का परीक्षण किया: पांच से आठ अनुच्छेदों की छोटी कहानियां जो लगभग 450 शब्दों की औसत थीं; बहुत छोटे चुटकुले जो लगभग 12 शब्दों की औसत थे; लंबे फॉर्म चुटकुले जो विस्तारित सेटअप के साथ लगभग 450 शब्दों की औसत थे; और पांच-अनुच्छेद निबंध जो लगभग 380 शब्दों की औसत थे।
प्रयोगों में 15 छुपे हुए शब्दों का उपयोग किया गया था, जो तीन श्रेणियों में विभाजित थे: कंक्रीट वस्तुओं में ‘छतरी’, ‘प्रकाशस्तंभ’, ‘वायलिन’, ‘कैक्टस’, और ‘दूरबीन’ शामिल थे; अमूर्त अवधारणाओं में ‘न्याय’, ‘धैर्य’, ‘एंट्रोपी’, ‘नोस्टाल्जिया’, और ‘स्वतंत्रता’ शामिल थे; और तटस्थ शब्द ‘ब्रैकेट’, ‘मंगलवार’, ‘तांबा’, ‘मार्जिन’, और ‘चालान’ शामिल थे।
इन शब्दों पर निर्भरता के प्रभाव की जांच करने के लिए, शोधकर्ताओं ने कॉर्पस ऑफ कंटेम्पररी अमेरिकन इंग्लिश (सीओसीए) से 15 यादृच्छिक रूप से चुने गए संज्ञाओं के साथ प्रयोगों को दोहराया, जिनमें ‘न्यायाधीश’, ‘उपभोक्ता’, ‘बर्फ’, ‘जोड़ी’, ‘निर्माण’, ‘पैनल’, ‘अल्पसंख्यक’, ‘विपणन’, ‘अजनबी’, ‘गोली’, ‘अनुपस्थिति’, ‘गियर’, ‘गाल’, ‘प्रसंस्करण’, और ‘बैंकर’ शामिल थे, साथ ही प्रत्येक परीक्षण मॉडल द्वारा स्वतंत्र रूप से चुने गए 15 अतिरिक्त शब्द।
माप/मीट्रिक
पहले परीक्षण में, एक एआई मॉडल ने या तो एक ही मॉडल के दूसरे उदाहरण द्वारा उत्पन्न पाठ, या एक अलग मॉडल द्वारा उत्पन्न पाठ पढ़ा, और 20 राउंड में छुपे हुए शब्द का अनुमान लगाने का प्रयास किया।
दूसरे (2एएफसी) परीक्षण में, एआई को दो लेखन के टुकड़े दिखाए गए और पूछा गया कि क्या विशिष्ट छुपे हुए शब्द से प्रभावित हुआ है, या क्या यह किसी भी छुपे हुए शब्द को शामिल करता है। चूंकि यादृच्छिक अनुमान 50% सटीकता का उत्पादन करेगा, 50% से ऊपर या नीचे के स्कोर यह संकेत देंगे कि कथित तौर पर छुपाया गया अवधारणा अभी भी लेखन में पता लगाने योग्य है।
इस बात को रोकने के लिए कि एआई केवल पहले दिखाए गए पाठ (या दूसरे) को पसंद करे, शोधकर्ताओं ने प्रत्येक तुलना को पाठ के क्रम को बदलकर दोहराया, अंततः प्रत्येक मॉडल के लिए 420 भेदभाव परीक्षण और 450 पता लगाने वाले परीक्षण किए।
परिणाम
पांच मॉडलों ने छुपी हुई अवधारणाओं की पहचान 64% और 79% के बीच की दर से की,尽管 छुपे हुए शब्द सीधे तौर पर उत्पन्न कहानियों में दिखाई नहीं दिए। इसके बजाय, रिसाव विषयों और छवियों के माध्यम से उत्पन्न हुआ;
<img class=" wp-image-422687" src="https://www.unite.ai/wp-content/uploads/2026/05/table-1.jpg" alt="सिस्टम-प्रॉम्प्ट राज़ वाली कहानियों के लिए 2एएफसी सटीकता, जहां 50% मौका प्रदर्शन को दर्शाता है। 'प्रकट न करें' का अर्थ है कि मॉडल को शब्द का उल्लेख करने या उसका संकेत देने से मना किया गया था; 'सक्रिय रूप से छुपाएं', कि यह संबंधित संघों से बचने के लिए कहा गया था; 'बचाव-सचेत', कि गेसर को स्पष्ट अनुपस्थिति की तलाश करनी चाहिए; और 'मुक्त-प्रतिक्रिया', कि शब्द को 20 राउंड में नाम दिया गया था। सितारे ऊपर-मौका परिणामों को चिह्नित करते हैं और कुल्हाड़ियां नीचे-मौका परिणामों को चिह्नित करती हैं, जिसमें अधिकांश महत्वपूर्ण निष्कर्ष बोनफेरोनी सुधार को छोड़कर बच गए हैं; ग्रोक और जेमिनी ने एपीआई त्रुटियों के कारण थोड़े कम परीक्षणों का उपयोग किया।
जीपीटी-5.4 और जेमिनी 2.5 प्रो ने अलग तरह से व्यवहार किया, क्योंकि छुपे हुए विचार से बचने की कोशिश करना वास्तव में बचाव पैटर्न को ही अधिक पता लगाने योग्य बना देता है। यह प्रभाव हाथ से चुने गए शब्दों, यादृच्छिक सीओसीए संज्ञाओं, और मॉडल द्वारा चुने गए शब्दों के साथ बना रहा।
जीपीटी-5.4 के नीचे-मौका स्कोर व्यवस्थित लगे, न कि यादृच्छिक, कुछ छुपे हुए शब्दों का पता लगाने में बहुत विश्वसनीयता के साथ और दूसरों को लगभग कभी नहीं पहचाना। प्रभाव तब कमजोर हो गया जब राज़ को सिस्टम प्रॉम्प्ट के बजाय उपयोगकर्ता प्रॉम्प्ट में रखा गया, जिससे जीपीटी-5.4 की पता लगाने की सटीकता 56% हो गई।
अधिकांश मॉडलों के लिए, जिन परीक्षणों ने पूछा कि ‘क्या यह पाठ में एक छुपी हुई अवधारणा है?’ ने ‘कौन सी छुपी हुई अवधारणा इस पाठ में है?’ पूछने वाले परीक्षणों के समान परिणाम उत्पादित किए।
इसके अलावा, दो परीक्षण विधियों ने विभिन्न प्रकार के रिसाव को मापा, 2एएफसी परीक्षण जो यह मापते हैं कि क्या एक छुपी हुई थीम अभी भी लेखन में पता लगाने योग्य है, और मुक्त-प्रतिक्रिया परीक्षण जो यह मापते हैं कि क्या रिसाव संकेत पर्याप्त मजबूत हैं ताकि दूसरा एआई छुपे हुए शब्द का अनुमान लगा सके।
लेखक निष्कर्ष निकालते हैं*:
‘हमारे निष्कर्ष सुझाव देते हैं कि एक मॉडल के संदर्भ में सक्रिय जानकारी इसके आउटपुट में विषयगत निशान छोड़ सकती है। सिस्टम प्रॉम्प्ट सामग्री, श्रृंखला के विचार, पुनर्प्राप्त दस्तावेज, उपयोगकर्ता-प्रदान की गई डेटा – इनमें से कोई भी बाहरी पर्यवेक्षक द्वारा पता लगाने योग्य तरीके से रचनात्मक निर्णयों को प्रभावित कर सकता है। ‘
‘रिसाव की डिग्री उत्पन्न कार्य के खुलेपन पर निर्भर करेगी (छोटे चुटकुले सुरक्षित हैं; कहानियां नहीं हैं) और जानकारी की सेमांटिक पहचान दी गई माध्यम में कितनी है।’
‘फिर भी, सेमांटिक रिसाव तब भी अपरिहार्य लगता है, भले ही मॉडल जानकारी को छुपाने की कोशिश कर रहे हों।’
निष्कर्ष
जैसा कि ऊपर उल्लेख किया गया है, लेखक इस समस्या का एक हिस्सा ट्रांसफॉर्मर्स आर्किटेक्चर के मूल सिद्धांतों को देते हैं। इतिहास से पता चलता है कि यह नवीनतम एलएलएम मुद्दा पोस्ट-ट्रेनिंग कंडीशनिंग (संरेखण), सिस्टम प्रॉम्प्ट जो अंतिम उपयोगकर्ता के लिए संपादन योग्य नहीं हैं, फिल्टर, और द्वितीयक प्रणालियों के विविध समूह द्वारा संबोधित किया जाएगा, जो कि स्वाभाविक रूप से बढ़ते हैं क्योंकि डिफ्यूजन मॉडल के साथ मूल समस्याएं सामने आती हैं।
दूसरी प्रणालियों का यह बुनियादी ढांचा जितना बड़ा होगा, वर्तमान पीढ़ी के एसओटीए एआई को जुरासिक पार्क की तरह लगता है, जहां मूल मूल्य प्रस्ताव एक बड़ी संख्या में आशंकाओं के साथ आता है, और बहुत सारे काम के चारों ओर और समझौतों की आवश्यकता होती है।
* लेखकों का अपना जोर, जहां आवश्यक हो मेरे द्वारा समायोजित किया गया (क्योंकि एक लेख उद्धरण पहले से ही इटैलिक में है), और लेखकों के इनलाइन उद्धरण मेरे द्वारा हाइपरलिंक में परिवर्तित किए गए हैं।
† लेखकों का यह देखने में रुचि है कि विभिन्न मॉडल परिवारों में ‘स्व-चुने हुए’ शब्द चुनने में कुछ असंभावित अतिव्यापी है, यह कहते हुए ‘मॉडल समान शब्दों की ओर आकर्षित होते हैं: दूरबीन, स्वतंत्रता और नोस्टाल्जिया प्रत्येक में 3+ मॉडलों की सूची में दिखाई देते हैं।’ वे मॉडल परिवारों के बीच ‘छोटे चुटकुले’ के चुनाव में एक सामान्यिकता को भी नोट करते हैं: ‘[कई] मॉडल 15 रहस्यों में से 11 के लिए ‘वैज्ञानिकों पर क्यों भरोसा नहीं करते? क्योंकि वे सब कुछ बनाते हैं’ लिखते हैं। शेष चार रहस्य (कैक्टस, एंट्रोपी, नोस्टाल्जिया, धैर्य) उसी लाइब्रेरी चुटकुले को प्राप्त करते हैं जो ओपस भी 15 नो-रहस्य स्थितियों में लिखता है – जिसका अर्थ है कि ये चार गुप्त चुटकुले बेसलाइन से अलग नहीं हैं।’
†† आर्काइव मानकों के अनुसार, कागज़ में पुनरावृत्ति और अपने आकर्षक लीड को अत्यधिक विवरण और प्रदर्शन में दफनाने की प्रवृत्ति है। इसलिए मैं पाठक को शेष माध्यमिक प्रयोगों के लिए स्रोत पीडीएफ के लिए कहता हूं।
पहली बार शुक्रवार, 15 मई, 2026 को प्रकाशित। शनिवार, 16 मई, 16:05 ईईटी को व्याकरण सुधारा।












