Anderson का एंगल
क्यों एआई लाइटहाउस कीपर्स के बारे में लिखने से प्यार करता है?

जबकि ‘एक कहानी लिखें’ के लिए कहा जाता है, तो ChatGPT और अन्य प्रमुख भाषा मॉडल्स को लगता है कि वे कॉपीराइट उल्लंघन से बचने के लिए एक ही छोटे और अजीब पात्रों के साथ जुड़े हुए हैं, जैसे कि लाइटहाउस कीपर, मछुआरे और घड़ी बनाने वाले।
कॉर्नेल विश्वविद्यालय से एक नए अध्ययन में पाया गया है कि प्रमुख भाषा मॉडल्स में एक अजीब संगति है जब उन्हें सिर्फ ‘एक कहानी लिखें’ के लिए कहा जाता है। चार एलएलएम्स को 20,000 कहानियां लिखने के लिए कहा गया, और उन्होंने पाया कि 88% कहानियों में कम से कम एक विशिष्ट टोकन था, जो ‘स्थान’, ‘नाम’, या ‘पेशा’ की श्रेणी में आता था।

असंभावित कीवर्ड्स की घटनाएं, जो यहां दस लाख में प्राप्त हुईं, शोधकर्ताओं के 20,000 एलएलएम-जनित कहानियों के विश्लेषण से मिलीं। स्रोत
इन 11 सबसे अधिक बार आने वाले शब्दों में नाम एलियास, मारा, एलारा; पेशे कीपर, बेकर, मेयर, घड़ी बनाने वाला, मछुआरा, लाइब्रेरियन, और कंडक्टर; और स्थान लाइटहाउस शामिल हैं।
परीक्षण किए गए मॉडल्स में क्लॉड हाइकु 4.5, जेमिनी 3.1 फ्लैश-लाइट, जीपीटी-5.4-मिनी, और ओएलएमओ 7बी थिंकिंग शामिल थे। सभी को एक ही अनुरोध के साथ पेश किया गया था: ‘एक कहानी लिखें’;
मुझे यह देखने में दिलचस्पी थी कि क्या इस सिंड्रोम को मॉडल्स में पाया जा सकता है जो लेखन के समय उपलब्ध थे, इसलिए मैंने प्रयोग खुद करने का फैसला किया। मैंने पहले अपने माध्यम-स्तर के चैटजीपीटी अकाउंट (बातचीत का लिंक यहां) पर प्रयोग किया:

चैटजीपीटी-5.5 ने शोधकर्ताओं के निष्कर्षों की पुष्टि की। स्रोत
मुझे यह जानने में दिलचस्पी थी कि क्या यह पैटर्न केवल मेरे अकाउंट तक सीमित था या नहीं, इसलिए मैंने एक मुफ्त चैटजीपीटी अकाउंट में लॉग इन किया जिसका मैं एक साल से अधिक समय से उपयोग नहीं कर रहा था, एक फायरफॉक्स निजी ब्राउजिंग विंडो में, और फिर से प्रयास किया (बातचीत का लिंक यहां):

चैटजीपीटी अकाउंट #2 ने भी शोधकर्ताओं के निष्कर्षों की पुष्टि की। स्रोत
मैंने एंथ्रोपिक के डिफ़ॉल्ट सोनेट 4.6 का भी परीक्षण किया, और मुझे निराशा नहीं हुई। फिर से, परिचित कीवर्ड पहले प्रयास में ही आए (बातचीत का लिंक यहां):

क्लॉड सोनेट 4.6 ने भी शोधकर्ताओं के निष्कर्षों की पुष्टि की। स्रोत
मैं गूगल जेमिनी में भी इस पैटर्न को दोहराने में असमर्थ था, जब तक कि मैंने विशेष रूप से मॉडल को जेमिनी 3.1 फ्लैश-लाइट में नहीं बदल दिया, जो कि शोध में उपयोग किया गया था – और फिर, तीसरे प्रयास में (लिंक यहां):

गूगल जेमिनी 3.1 फ्लैश-लाइट ने भी शोधकर्ताओं के निष्कर्षों की पुष्टि की। स्रोत
लाइटहाउस इन द वाइल्ड
महान दिमाग एक जैसे सोचते हैं: एक सप्ताह पहले, शोध पत्र के प्रकाशन से पहले, सॉफ्टवेयर लेखक डैनियल मे ने इलियास और लाइटहाउस कीपर ट्रोप के संयोग की ओर ध्यान दिलाया, जो शोधकर्ताओं द्वारा निकाला गया था*। उन्होंने जेमिनी, डीपसीक, क्वेन और जेमा के आठ संस्करणों का परीक्षण किया, और पाया कि वे सभी लाइटहाउस मेम्स और ‘इलियास थॉर्न’ को एक प्रोटागोनिस्ट के रूप में उत्पादित करेंगे*। हालांकि, यह प्रारंभिक खोज नए शोध पत्र में वर्णित व्यापक स्थायी सामग्री विषयों तक नहीं पहुंची।
मुझे यह जानने में दिलचस्पी थी कि क्या ये पुनरावृत्ति विषय और नाम कभी चैट की सीमाओं से बाहर निकले थे, इसलिए मैंने कुछ शीर्ष 11 कीवर्ड्स और विषयों के लिए गूगल पर खोज की, और पाया कि उन्होंने कई पोस्टों में चैनल किया था:

वेब पर आउटपुट में मेम के तीन उदाहरण। नीचे स्रोत लिंक देखें।
मे ने इलियास थॉर्न (इलियास के बजाय) को एक स्थायी एलएलएम मेम के रूप में पहचाना था, और अमेज़न पर विभिन्न पुस्तकों के लेखकों के रूप में इस नाम का उपयोग किया जाने वाला स्क्रीनशॉट पोस्ट किया था।
एक स्वाद पिछले के लिए
तो बहुत सारे आकस्मिक अवलोकन और सेरेन्डिपिटी के लिए। जबकि कोई एकल ‘जादुई दस्तावेज’ प्रशिक्षण डेटा में नहीं मिला है जो सभी या अधिकांश स्थायित्व की विशेषता रखता है, शोध पत्र के लेखकों का अनुमान है कि एआई विकास में कॉपीराइट फिल्टर कल्पनात्मक आउटपुट को प्रतिबंधित कर सकते हैं जो कि कॉपीराइट के अधीन हैं।
लेखकों का कहना है:
‘हम पाते हैं कि “इलियास इन द लाइटहाउस” कहानियों का प्रभुत्व पूर्व- या पोस्ट-ट्रेनिंग डेटा में प्रचुरता से समझाया नहीं जा सकता है। हम अनुमान लगाते हैं कि मॉडल कॉपीराइट पात्रों और वयस्क सामग्री के संदर्भों से बचने के लिए प्रशिक्षित होते हैं लेकिन इस प्रश्न को भविष्य के काम के लिए स्थगित करते हैं।’
| श्रेणी | टोकन | हमारा | साहित्य | पूर्व गैर-काल्पनिक | पूर्व काल्पनिक | पोस्ट गैर-काल्पनिक | पोस्ट काल्पनिक |
|---|---|---|---|---|---|---|---|
| नाम | इलियास | 2,428 | 2.7 | 2.2 | 4.0 | 0.4 | 52.7 |
| नाम | मारा | 5,200 | 3.9 | 2.5 | 8.7 | 0.4 | 21.7 |
| नाम | एलारा | 1,221 | 0.0 | 0.4 | 1.2 | 0.9 | 108 |
| पेशा | कीपर | 1,495 | 7.2 | 6.3 | 14.7 | 3.5 | 10.0 |
| पेशा | बेकर | 161 | 20 | 11.8 | 10.56 | 1.7 | 11.9 |
| पेशा | मेयर | 198 | 28 | 11.5 | 16.1 | 1.4 | 27.4 |
| पेशा | घड़ी बनाने वाला | 108 | 0.1 | 0.18 | 0.0 | 0.3 | 1.4 |
| पेशा | मछुआरा | 62 | 4.2 | 3.0 | 7.6 | 0.0 | 9.3 |
| पेशा | लाइब्रेरियन | 68 | 5.3 | 7.6 | 5.9 | 2.3 | 11.5 |
| पेशा | कंडक्टर | 96 | 5.0 | 5.9 | 5.7 | 4.7 | 7.5 |
| स्थान | लाइटहाउस | 3,005 | 5.5 | 3.5 | 4.6 | 4.6 | 10.1 |
तुलना तालिका जो दिखाती है कि एलएलएम-जनित कहानियों में पुनरावृत्ति शब्दों की कितनी बार आवृत्ति होती है, प्रकाशित साहित्य, वेब साहित्य और पोस्ट-ट्रेनिंग डेटासेट के साथ तुलना में।
विशेषताओं का पीछा
यह जानने के लिए कि क्या दोहराए जाने वाले ‘लाइटहाउस’ कहानियों को सामान्य कथा सposure द्वारा समझाया जा सकता है, मॉडल्स के पसंदीदा दोहराए जाने वाले शब्दों की तुलना कई बड़े अंग्रेजी भाषा निगमों से की गई थी। CONLIT, एक डेटासेट जिसमें 2007 और 2021 के बीच प्रकाशित 2,700 अंग्रेजी उपन्यास शामिल हैं, जो 12 शैलियों को कवर करते हैं और लगभग 287 मिलियन शब्दों की संख्या है, का उपयोग समकालीन साहित्य की जांच के लिए किया गया था।
‘इलियास’ एलएलएम-जनित कहानियों में प्रकाशित साहित्य की तुलना में लगभग 900 गुना अधिक बार दिखाई देता है. रेडिट के /r/writingprompts समुदाय से अमेच्योर साहित्य ने समान आवृत्तियों का उत्पादन किया, जो दर्शाता है कि यह पैटर्न मानव कथा को प्रतिबिंबित नहीं करता है।
ओएलएमओ 3 निगम, जिसमें लगभग 3.89 बिलियन मुख्य रूप से मानव-लिखित दस्तावेज शामिल हैं, जो कि कॉमन क्रॉल से आंशिक रूप से निकाले गए हैं, का उपयोग पूर्व-प्रशिक्षण डेटा की जांच के लिए किया गया था। शोधकर्ताओं ने पाया कि दोहराए जाने वाले ‘कोर’ शब्द बहुत कम दरों पर दिखाई देते हैं।
एक कथा वर्गीकरणकर्ता का निर्माण जीपीटी-ओएसएस 20बी एनोटेशन और फास्टटेक्स्ट मॉडल का उपयोग करके 200,000 संतुलित नमूनों पर प्रशिक्षित किया गया था। यहां तक कि जब विशेष रूप से काल्पनिक सामग्री के लिए फिल्टर किया गया, तो शब्द जैसे ‘एलारा’ अभी भी एलएलएम-जनित कहानियों की तुलना में बहुत कम दरों पर दिखाई दिए।
निष्कर्ष
शोधकर्ताओं के निष्कर्षों के अनुसार, यह स्पष्ट नहीं है कि यह विशिष्ट शब्दों का संग्रह कैसे एकत्र हुआ और स्व-सहयोगी हो गया, खासकर जब कोई एकल साहित्यिक कार्य (या श्रृंखला) नहीं है जो इन शीर्ष 11 शब्दों की विशेषता रखता हो।
यह सिद्धांत यह मानता है कि विशाल मात्रा में क्लासिक साहित्य प्रशिक्षण नियम में शामिल किया गया होगा, जो असंभव है, क्योंकि जो की जरूरत है वह मॉडल है जो आधुनिक शब्दावली के साथ काम करे और वर्तमान व्यावसायिक आवश्यकताओं के लिए उपयुक्त हो। प्री-इंडस्ट्रियल साहित्य की मात्रा ही इसके समावेश को रोक देगी।
यदि कोई एक विशिष्ट कथा है जो इन दोहराए जाने वाले तत्वों के विभिन्न संयोजनों की विशेषता है, तो यह शायद आसानी से मिल जाएगी; शोधकर्ता खुद इसे नहीं पा सके, और आकस्मिक खोज पूर्व-एआई युग में कोई ऐसा दावेदार नहीं खोज पाई। शायद, यदि ‘लाइटहाउस सिंड्रोम’ एआई एम डैश की तरह प्रसिद्धि प्राप्त करता है, तो कुछ विद्वान प्राधिकरण उत्तर के साथ आगे आएगा।
* मैं मे के लेख में और गहराई से नहीं जा सकता, क्योंकि कारण ऐसे हो सकते हैं जो जब आप इसे पढ़ेंगे तो स्पष्ट हो जाएंगे।
पहली बार बुधवार, 27 मई, 2026 को प्रकाशित। पहले 30 मिनट में एंथ्रोपिक लिंक को ठीक करने के लिए संशोधित किया गया।












