Anderson का एंगल
भाषा मॉडल्स एक राज़ रखने में असमर्थ हैं

एआई मॉडल्स राज़ नहीं रख सकते। यहां तक कि जब उन्हें खुलासा न करने के लिए कहा जाता है, तो उनका लेखन उन्हें दूर कर देता है, और इसे छिपाने की कोशिश करना इसे और भी आसान बना देता है।
जानबूझकर कुछ न सोचना बहुत मुश्किल है। इसका एक क्लासिक उदाहरण 1960 की ब्रिटिश साइंस फिक्शन थ्रिलर विलेज ऑफ द डैम्ड के अंत में दिखाया गया है, जहां हमारे बलिदानी नायक ने होस्टाइल एलियन आक्रमणकारियों के एन्क्लेव में एक बम को छुपाया है, जो बच्चों के रूप में प्रस्तुत हो रहे हैं। हालांकि, चूंकि उनकी दूरसंचार शक्तियां उनके इरादे को समझने के लिए जोखिम में हैं इससे पहले कि वह दुनिया को खतरे से मुक्त कर सकते हैं, उन्हें समय के लिए देरी करने के लिए किसी भी चीज़ पर ध्यान केंद्रित करने के लिए मजबूर किया जाता है जो नहीं-बम है:
विरोधाभास यह है कि कुछ न सोचने के लिए, आपको इसे किसी तरह से अपना ध्यान केंद्रित करना होगा; और यह जाना जाता है सिंड्रोम अधिकांश लोगों को कम नाटकीय संदर्भों में अनुभव होने की संभावना है।
लार्ज लैंग्वेज मॉडल ( (एलएलएम), जिसका आधार आधार पर है, जानकारी को दबाने में समान कठिनाई का अनुभव करते हैं, क्योंकि उन्हें एक उपयोगकर्ता द्वारा ऐसा करने के लिए कहा जाता है; और चूंकि वे व्यावसायिक जानकारी नेटवर्क के केंद्र में रखे जा रहे हैं, उनकी निर्दोष प्रवृत्ति की कमी कई कंपनियों के लिए एक दायित्व साबित हो सकती है।source)
इस साल की शुरुआत में, एक शोध सहयोग ने चांदर रिसर्च लैब के नेतृत्व में, एलएलएम के संदर्भ में इस चुनौती को प्राइवेट स्टेट इंटरएक्टिव टास्क्स (पीएसआईटी) के रूप में परिभाषित किया, जो ‘एक एजेंट को छुपी हुई जानकारी बनाने और बनाए रखने की आवश्यकता होती है, जबकि सार्वजनिक प्रतिक्रियाओं को संगत बनाए रखने की आवश्यकता होती है’, और पाया कि ओपनएआई और अलीबाबा से परीक्षण मॉडल इस तरह के कार्य को करने में असमर्थ थे।
इसे मत कहो…
हालांकि यह पहले से ही जाना जाता है कि बड़े मॉडल अधिक रिसाव करते हैं, नए शोध से पता चलता है कि राज्य-कला भाषा मॉडल एक कमांड का पालन करेंगे या नहीं जानकारी को दबाने के लिए, जबकि अभी भी एक विषय या थीम में आउटपुट उत्पन्न करने की आवश्यकता है जो ‘प्रतिबंधित’ शब्द या विचार को शामिल कर सकता है।
कागज़ का निष्कर्ष है कि सभी मॉडल जिन्हें यह अध्ययन करता है, कुछ तरह से एक प्रवृत्ति से प्रभावित होते हैं जो ‘राज’ को प्रकट करने के लिए, पाते हैं कि पांच-आलेख (~450 शब्द) और कहानियां ‘स्लिप्स’ के लिए एक विस्तृत कैनवास प्रदान करती हैं – हालांकि बहुत छोटे चुटकुले पर्याप्त स्कोप प्रदान नहीं करते हैं।
इसके अलावा, मॉडल को अधिक जोर से छुपाने के लिए कहा जाता है, जितना अधिक यह जोखिम में है कि यह एक एलएलएम द्वारा बीस लगातार प्रयासों में ‘गुप्त शब्द’ को प्रकट कर देगा।

From the new paper: across five frontier models, long-form writing reliably leaks hidden concepts; short jokes do not; and stronger ‘hide it’ instructions push outputs away from the secret, but make the signal therefore detectable by inversion. Source
यह कार्य व्यावसायिक संचालन के लिए अत्यधिक प्रासंगिक है, जहां विपणन और पीआर आउटरीच से लेकर आंतरिक रिपोर्ट तक विभिन्न चैनलों को जानकारी को चयनात्मक रूप से प्रस्तुत करने की आवश्यकता होती है; हालांकि, इन सभी प्रक्रियाओं को पूरी श्रृंखला की आवश्यकता होती है, यदि केवल यह सुनिश्चित करने के लिए कि क्या दबाना है।

An example scenario from the paper illustrates how concealed information can unintentionally shape unrelated output, with an LLM instructed not to disclose its company’s financial instability, yet nonetheless drifting toward phrases associated with cash shortages and capital stress, allowing a reader to infer the hidden context.
लेखक कहते हैं*:
‘भाषा मॉडल्स छुपी हुई जानकारी को विश्वसनीय रूप से कम्पार्टमेंटलाइज़ नहीं कर सकते। एक राज़ प्रॉम्प्ट में मॉडल के लेखन को आकार देता है, और दूसरा मॉडल उस आकार का पता लगा सकता है। साहित्यिक शब्द हमेशा दबाया जाता है, लेकिन अवधारणा नहीं है। यह सात मॉडलों, तीन शब्द सेट, सिस्टम प्रॉम्प्ट बनाम उपयोगकर्ता प्रॉम्प्ट, और दो स्वतंत्र क्रॉस-मॉडल गेसर्स में समान है।’
‘…हम सोचते हैं कि ट्रांसफॉर्मर्स की उच्च-विश्वास वाली जानकारी तक पहुंच ही उन्हें राज़ रखने में मुश्किल बनाती है। भले ही एक एलएलएम को एक शब्द को रिसाव न करने का प्रयास करने के लिए कहा जाए, तो भी उसे उस शब्द पर ध्यान देना होगा, जिससे आकस्मिक रिसाव का मार्ग प्रदान किया जा सके। ‘
‘किसी चीज़ से बचने के लिए, एक मानव को इसके बारे में सोचना होगा, और एक ट्रांसफॉर्मर को इसके बारे में ध्यान देना होगा। जब दो अवधारणाएं मॉडल द्वारा लगभग समान रूप से पसंद की जाती हैं (जैसे कि एक कार्यालय नौकरी या एक ऑर्केस्ट्रा में दूसरे वायलिन के बारे में एक कहानी लिखना), तो मॉडल के निर्णय लेने में उस जानकारी से प्रभावित होने की संभावना है जिसे यह प्रकट नहीं करना चाहता है।’
हालांकि डीपसीक और चैटजीपीटी-5.4 मॉडल इस तरह से प्रदर्शन करने में अपवाद थे, वे दोनों रिसाव करते थे; जीपीटी-5.4 के मामले में, यह एक परीक्षण में 50% (यानी, मौका स्तर से नीचे) स्कोर किया, जहां इसे एक अवधारणा से बचने के लिए कहा गया था; यह वस्तुतः एक ‘रिवर्स स्पाइक’ या संकेतक के रूप में कार्य करता है, न कि मॉडल को ‘शांत’ रखने के अनुरोध के रूप में।
लेखक इस सिंड्रोम को एलएलएम में परिमित एंट्रोपी बजट के रूप में परिभाषित करते हैं, जहां मॉडल की अप्रत्याशितता (जो इस मामले में बहुत उपयोगी होगी) इसकी अनिवार्य कमी की कमी द्वारा बाधित है। सरल शब्दों में, मॉडल ईंट की दीवार या बेसबॉल स्कोर पर हमारी तरह ध्यान केंद्रित नहीं कर सकता है; हालांकि, लेखक यह भी नोट करते हैं कि मॉडल को एक वैकल्पिक अवधारणा पर विचार करने के लिए देने से समस्या में सुधार हो सकता है, लेकिन इसे समाप्त नहीं किया जा सकता है। हालांकि, मॉडल को निर्देश देने के दौरान एक असंबंधित अवधारणा को ध्यान में रखना आउटपुट में ‘नकली’ अवधारणा को उलझाने के लिए निर्धारित लगता है।
कागज़ के सबसे दिलचस्प निष्कर्षों में से एक यह है कि अध्ययन की स्थिति तब और भी बढ़ जाती है जब नियंत्रण पाठ सीधे उपयोगकर्ता संदेशों में शामिल किया जाता है, न कि सिस्टम प्रॉम्प्ट में (यानी, मानव उपयोगकर्ता द्वारा एआई को दी गई एक सेट पूर्व शर्तें, आदान-प्रदान से पहले), क्योंकि चैटजीपीटी जैसे जीयूआई में प्रश्न टाइप करना वास्तव में इंटरैक्शन के लिए मानक परिदृश्य है।
इसके अलावा, यह ध्यान देने योग्य है कि एक लक्षित परीक्षण में यह पुष्टि की गई है कि छोटे मॉडल इस प्रवृत्ति से पीड़ित नहीं हैं (हालांकि यह संभवतः समान रूप से कम क्षमता के साथ आता है)।
नई कागज़ का शीर्षक है क्या आप एक राज़ रख सकते हैं? भाषा मॉडल लेखन में अनैच्छिक जानकारी रिसाव, और यह शिकागो विश्वविद्यालय और ब्रिटिश कोलंबिया विश्वविद्यालय के दो लेखकों से आता है।
विधि
अध्ययन मुख्य रूप से पांच मुख्य मॉडलों पर केंद्रित है: क्लॉड ओपस 4.6 और सोनेट 4.6, एंथ्रोपिक से; जीपीटी-5.4 ओपनएआई से; लामा 4 मेवरिक मेटा से; और डीपसीक वी3.2। अतिरिक्त मान्यकरण परीक्षण एक्सएआई के ग्रोक 4 और गूगल के जेमिनी 2.5 प्रो के साथ किए गए, जबकि अलग स्केलिंग प्रयोग लामा 3.2 3बी, लामा 3.1 8बी, लामा 3.3 70बी, और गेमा 3 को 4बी, 12बी, और 27बी पैरामीटर के साथ जांचते हैं।
सूक्ष्म रूप से रिसाव को मापने के लिए, शोधकर्ताओं ने एक दो-विकल्प बलपूर्वक चयन (2एएफसी) परीक्षण का उपयोग किया, जो मनोविज्ञान साहित्य में एक मानक मीट्रिक है, जिसमें एक दूसरे मॉडल को दो कहानियां दिखाई जाती हैं और पूछा जाता है कि कौन सी एक छुपे हुए शब्द को छुपाती है।
चूंकि यादृच्छिक अनुमान 50% सटीकता का उत्पादन करेगा, 50% से ऊपर या नीचे के स्कोर यह संकेत देंगे कि लेखन में छुपी हुई सेमांटिक निशान अभी भी पता लगाने योग्य हैं।
पहले प्रयोग में, लेखक-गेसर सेटअप में, एक मॉडल को एक छुपा हुआ शब्द दिया गया था, साथ ही निर्देश थे कि यह छुपा हुआ शब्द को छुपाने के लिए; इसके साथ जुड़े संबंधों से बचने के लिए; या एक डिकॉय अवधारणा की ओर ध्यान दें। सिस्टम को तब कहानियां, निबंध और विभिन्न लंबाई के चुटकुले उत्पन्न करने का काम सौंपा गया था, जबकि दूसरा मॉडल या तो छुपे हुए शब्द को सीधे पहचानने का प्रयास करता था, या विभिन्न छुपे हुए प्रॉम्प्ट से प्रभावित पाठ के बीच अंतर करता था।
पांच स्थितियों का परीक्षण किया गया था;

The five condition tested across the core models.
शोधकर्ताओं ने चार प्रकार के लेखन कार्यों का परीक्षण किया: पांच से आठ अनुच्छेदों की छोटी कहानियां जो लगभग 450 शब्दों की औसत थीं; बहुत छोटे चुटकुले जो लगभग 12 शब्दों की औसत थे; लंबे फॉर्म चुटकुले जो विस्तारित सेटअप के साथ लगभग 450 शब्दों की औसत थे; और पांच-अनुच्छेद निबंध जो लगभग 380 शब्दों की औसत थे।
प्रयोगों में 15 छुपे हुए शब्दों का उपयोग किया गया था, जो तीन श्रेणियों में विभाजित थे: कंक्रीट वस्तुओं में ‘छतरी’, ‘प्रकाशस्तंभ’, ‘वायलिन’, ‘कैक्टस’, और ‘दूरबीन’ शामिल थे; अमूर्त अवधारणाओं में ‘न्याय’, ‘धैर्य’, ‘एंट्रोपी’, ‘नोस्टाल्जिया’, और ‘स्वतंत्रता’ शामिल थे; और तटस्थ शब्द ‘ब्रैकेट’, ‘मंगलवार’, ‘तांबा’, ‘मार्जिन’, और ‘चालान’ शामिल थे।
इन शब्दों पर निर्भरता के प्रभाव की जांच करने के लिए, शोधकर्ताओं ने कॉर्पस ऑफ कंटेम्पररी अमेरिकन इंग्लिश (सीओसीए) से 15 यादृच्छिक रूप से चुने गए संज्ञाओं के साथ प्रयोगों को दोहराया, जिनमें ‘न्यायाधीश’, ‘उपभोक्ता’, ‘बर्फ’, ‘जोड़ी’, ‘निर्माण’, ‘पैनल’, ‘अल्पसंख्यक’, ‘विपणन’, ‘अजनबी’, ‘गोली’, ‘अनुपस्थिति’, ‘गियर’, ‘गाल’, ‘प्रसंस्करण’, और ‘बैंकर’ शामिल थे, साथ ही प्रत्येक परीक्षण मॉडल द्वारा स्वतंत्र रूप से चुने गए 15 अतिरिक्त शब्द।
माप/मीट्रिक
पहले परीक्षण में, एक एआई मॉडल ने या तो एक ही मॉडल के दूसरे उदाहरण द्वारा उत्पन्न पाठ, या एक अलग मॉडल द्वारा उत्पन्न पाठ पढ़ा, और 20 राउंड में छुपे हुए शब्द का अनुमान लगाने का प्रयास किया।
दूसरे (2एएफसी) परीक्षण में, एआई को दो लेखन के टुकड़े दिखाए गए और पूछा गया कि क्या विशिष्ट छुपे हुए शब्द से प्रभावित हुआ है, या क्या यह किसी भी छुपे हुए शब्द को शामिल करता है। चूंकि यादृच्छिक अनुमान 50% सटीकता का उत्पादन करेगा, 50% से ऊपर या नीचे के स्कोर यह संकेत देंगे कि कथित तौर पर छुपाया गया अवधारणा अभी भी लेखन में पता लगाने योग्य है।
इस बात को रोकने के लिए कि एआई केवल पहले दिखाए गए पाठ (या दूसरे) को पसंद करे, शोधकर्ताओं ने प्रत्येक तुलना को पाठ के क्रम को बदलकर दोहराया, अंततः प्रत्येक मॉडल के लिए 420 भेदभाव परीक्षण और 450 पता लगाने वाले परीक्षण किए।
परिणाम
पांच मॉडलों ने छुपी हुई अवधारणाओं की पहचान 64% और 79% के बीच की दर से की, हालांकि छुपे हुए शब्द सीधे तौर पर उत्पन्न कहानियों में दिखाई नहीं दिए। इसके बजाय, रिसाव विषयों और छवियों के माध्यम से उत्पन्न हुआ;

2AFC accuracy for stories with system-prompt secrets, where 50% signifies chance performance. ‘Don’t reveal’ signifies that the model was told not to mention or hint at the word; ‘actively hide’, that it was told to avoid related associations; ‘avoidance-aware’, that the guesser should look for conspicuous absences; and ‘free-response’, that the exact word was named within 20 rounds. Stars mark above-chance results and daggers mark below-chance results, with nearly all significant findings surviving Bonferroni correction except DeepSeek under ‘actively hide’; Grok and Gemini used slightly fewer trials because of API errors.
जीपीटी-5.4 और जेमिनी 2.5 प्रो ने अलग तरह से व्यवहार किया, क्योंकि छुपे हुए विचार से बचने की कोशिश करना वास्तव में बचाव पैटर्न को ही अधिक पता लगाने योग्य बना देता है। यह प्रभाव हाथ से चुने गए शब्दों, यादृच्छिक सीओसीए संज्ञाओं, और मॉडल द्वारा चुने गए शब्दों के साथ बना रहा।
जीपीटी-5.4 के नीचे-मौका स्कोर व्यवस्थित लगे, न कि यादृच्छिक, कुछ छुपे हुए शब्दों का पता लगाने में बहुत विश्वसनीयता के साथ और दूसरों को लगभग कभी नहीं पहचाना। प्रभाव तब कमजोर हो गया जब राज़ को सिस्टम प्रॉम्प्ट के बजाय उपयोगकर्ता प्रॉम्प्ट में रखा गया, जिससे जीपीटी-5.4 की पता लगाने की सटीकता 56% हो गई।
अधिकांश मॉडलों के लिए, जिन परीक्षणों ने पूछा कि ‘क्या यह पाठ में एक छुपी हुई अवधारणा है?’ ने ‘कौन सी छुपी हुई अवधारणा इस पाठ में है?’ पूछने वाले परीक्षणों के समान परिणाम उत्पादित किए।
इसके अलावा, दो परीक्षण विधियों ने विभिन्न प्रकार के रिसाव को मापा, 2एएफसी परीक्षण जो यह मापते हैं कि क्या एक छुपी हुई थीम अभी भी लेखन में पता लगाने योग्य है, और मुक्त-प्रतिक्रिया परीक्षण जो यह मापते हैं कि क्या रिसाव संकेत पर्याप्त मजबूत हैं ताकि दूसरा एआई छुपे हुए शब्द का अनुमान लगा सके।
लेखक निष्कर्ष निकालते हैं*:
‘हमारे निष्कर्ष सुझाव देते हैं कि एक मॉडल के संदर्भ में सक्रिय जानकारी इसके आउटपुट में विषयगत निशान छोड़ सकती है। सिस्टम प्रॉम्प्ट सामग्री, श्रृंखला के विचार, पुनर्प्राप्त दस्तावेज, उपयोगकर्ता-प्रदान की गई डेटा – इनमें से कोई भी बाहरी पर्यवेक्षक द्वारा पता लगाने योग्य तरीके से रचनात्मक निर्णयों को प्रभावित कर सकता है। ‘
‘रिसाव की डिग्री उत्पन्न कार्य के खुलेपन पर निर्भर करेगी (छोटे चुटकुले सुरक्षित हैं; कहानियां नहीं हैं) और जानकारी की सेमांटिक पहचान दी गई माध्यम में कितनी है।’
‘फिर भी, सेमांटिक रिसाव तब भी अपरिहार्य लगता है, भले ही मॉडल जानकारी को छुपाने की कोशिश कर रहे हों।’
निष्कर्ष
जैसा कि ऊपर उल्लेख किया गया है, लेखक इस समस्या का एक हिस्सा ट्रांसफॉर्मर्स आर्किटेक्चर के मूल सिद्धांतों को देते हैं। इतिहास से पता चलता है कि यह नवीनतम एलएलएम मुद्दा पोस्ट-ट्रेनिंग कंडीशनिंग (संरेखण), सिस्टम प्रॉम्प्ट जो अंतिम उपयोगकर्ता के लिए संपादन योग्य नहीं हैं, फिल्टर, और द्वितीयक प्रणालियों के विविध समूह द्वारा संबोधित किया जाएगा, जो कि स्वाभाविक रूप से बढ़ते हैं क्योंकि डिफ्यूजन मॉडल के साथ मूल समस्याएं सामने आती हैं।
दूसरी प्रणालियों का यह बुनियादी ढांचा जितना बड़ा होगा, वर्तमान पीढ़ी के एसओटीए एआई को जुरासिक पार्क की तरह लगता है, जहां मूल मूल्य प्रस्ताव एक बड़ी संख्या में आशंकाओं के साथ आता है, और बहुत सारे काम के चारों ओर और समझौतों की आवश्यकता होती है।
* लेखकों का अपना जोर, जहां आवश्यक हो मेरे द्वारा समायोजित किया गया (क्योंकि एक लेख उद्धरण पहले से ही इटैलिक में है), और लेखकों के इनलाइन उद्धरण मेरे द्वारा हाइपरलिंक में परिवर्तित किए गए हैं।
† लेखकों का यह देखने में रुचि है कि विभिन्न मॉडल परिवारों में ‘स्व-चुने हुए’ शब्द चुनने में कुछ असंभावित अतिव्यापी है, यह कहते हुए ‘मॉडल समान शब्दों की ओर आकर्षित होते हैं: दूरबीन, स्वतंत्रता और नोस्टाल्जिया प्रत्येक में 3+ मॉडलों की सूची में दिखाई देते हैं।’ वे मॉडल परिवारों के बीच ‘छोटे चुटकुले’ के चुनाव में एक सामान्यिकता को भी नोट करते हैं: ‘(कई) मॉडल 15 रहस्यों में से 11 के लिए ‘वैज्ञानिकों पर क्यों भरोसा नहीं करते? क्योंकि वे सब कुछ बनाते हैं’ लिखते हैं। शेष चार रहस्य (कैक्टस, एंट्रोपी, नोस्टाल्जिया, धैर्य) उसी लाइब्रेरी चुटकुले को प्राप्त करते हैं जो ओपस भी 15 नो-रहस्य स्थितियों में लिखता है – जिसका अर्थ है कि ये चार गुप्त चुटकुले बेसलाइन से अलग नहीं हैं।’
†† आर्काइव मानकों के अनुसार, कागज़ में पुनरावृत्ति और अपने आकर्षक लीड को अत्यधिक विवरण और प्रदर्शन में दफनाने की प्रवृत्ति है। इसलिए मैं पाठक को शेष माध्यमिक प्रयोगों के लिए स्रोत पीडीएफ के लिए कहता हूं।
पहली बार शुक्रवार, 15 मई, 2026 को प्रकाशित। शनिवार, 16 मई, 16:05 ईईटी को व्याकरण सुधारा।












