Anderson का एंगल
क्यों एआई लाइटहाउस कीपर्स के बारे में लिखने से प्यार करता है?

“एक कहानी लिखो” कहे जाने पर ChatGPT और अन्य अग्रणी भाषा मॉडल कॉपीराइट उल्लंघन से बचने के लिए बार-बार उन्हीं कुछ विचित्र पात्रों—जैसे प्रकाशस्तंभ रखवाले, मछुआरे और घड़ीसाज़—का सहारा लेते दिखाई देते हैं।
कॉर्नेल विश्वविद्यालय के एक नए अध्ययन ने पाया कि केवल “एक कहानी लिखो” कहने पर प्रमुख भाषा मॉडल बहुत सीमित कथात्मक तत्वों के प्रति असामान्य लगाव दिखाते हैं। चार LLM से लिखवाई गई 20,000 कहानियों में से 88% में स्थान, नाम और पेशे की श्रेणियों के 11 खास टोकनों में कम से कम एक था।

20,000 LLM-निर्मित कहानियों के विश्लेषण में मिले असंभावित प्रमुख शब्दों की प्रति दस लाख शब्दों में आवृत्ति। स्रोत
अध्ययन के लिए बनाए गए 1.2 करोड़ से अधिक शब्दों में सबसे अधिक दोहराए गए 11 शब्द थे: नाम elias, mara, elara; पेशे keeper, baker, mayor, clockmaker, fisherman, librarian, conductor; और स्थान lighthouse।
परीक्षित मॉडल थे Claude Haiku 4.5, Gemini 3.1 Flash-Lite, GPT-5.4-Mini और OLMo 7b Thinking। हर मॉडल को पाँच में से एक निर्देश मिला: “कहानी लिखो”, “कृपया कहानी लिखो”, “मेरे लिए कहानी लिखो”, “मुझे कहानी सुनाओ” या “कृपया कहानी सुनाओ”।
यह देखने के लिए कि शोधपत्र का सिंड्रोम लेखन के समय उपलब्ध मॉडलों में भी है या नहीं, मैंने अपने सामान्य मध्यम-स्तरीय ChatGPT खाते पर प्रयोग किया (वार्तालाप यहाँ)। परिणाम चुनने की जरूरत नहीं पड़ी—ChatGPT-5.5 ने पहली कोशिश में ही वही सामग्री चुनी जिसकी शोधकर्ताओं ने भविष्यवाणी की थी।

ChatGPT-5.5 ने तुरंत शोधपत्र के शुरुआती निष्कर्ष की पुष्टि की। स्रोत
ऐतिहासिक संदर्भ या अलग क्षेत्रों के बीच रिसाव की संभावना जाँचने के लिए मैंने Firefox की निजी विंडो में एक वर्ष से अधिक समय से अप्रयुक्त मुफ्त ChatGPT खाते से फिर प्रयास किया (वार्तालाप यहाँ)। यदि OpenAI समान IP से खातों का डेटा नहीं मिलाता, तो ChatGPT ने फिर पूरी तरह निशाना साधा।

दूसरा ChatGPT खाता भी नई शोध में बताए नामों और विषयों के उसी संकीर्ण ढाँचे का अनुसरण करता है। “Mira” लेखकों की शीर्ष 20 सूची में है। स्रोत
ध्यान रहे कि ये GPT संस्करण शोधपत्र में परीक्षित 5.4 से एक स्तर ऊपर थे।
शोधपत्र में Claude Haiku जाँचा गया था, पर मैंने Anthropic का डिफ़ॉल्ट Sonnet 4.6 आजमाया। परिचित प्रमुख शब्द पहली ही कोशिश में फिर आ गए (वार्तालाप यहाँ)।

इस बार शीर्ष 11 का एक और स्थायी नाम “Mara” Claude Sonnet 4.6 की पहली कोशिश में कहानी का नेतृत्व करता है। स्रोत
Claude Haiku 4.5 पर वही निर्देश देने से लगभग वही परिणाम मिला।
Google Gemini में शुरुआत में निष्कर्ष दोहरा नहीं सका। जब विशेष रूप से शोधपत्र वाला Gemini 3.1 Flash-Lite चुना, तो कुल तीसरी लेकिन उस मॉडल पर पहली कोशिश में पैटर्न तुरंत उभर आया (लिंक यहाँ)।

Google Gemini 3.1 Flash-Lite। स्रोत
अन्य Gemini मॉडलों के प्रयोगों में प्रकाशस्तंभ विषय हर बार आया, हालाँकि शीर्ष 11 से बाहर Thomas जैसे नाम या एक रूप में मेरा अपना नाम नायक बना।
फिर भी लेखन के समय शोधपत्र के निष्कर्ष सिद्ध करना अत्यंत आसान था।
वास्तविक दुनिया में प्रकाशस्तंभ
अच्छे विचार मिलते हैं: नए शोधपत्र से एक सप्ताह पहले सॉफ्टवेयर लेखक Daniel May ने Elias और प्रकाशस्तंभ रखवाले के संयोग को इंगित किया*। Gemini, DeepSeek, Qwen और Gemma के आठ रूपों ने प्रकाशस्तंभ मीम और नायक Elias Thorne बनाए*। मगर उनका अवलोकन नई शोध में बताए व्यापक स्थायी विषयों तक नहीं पहुँचा।
यह देखने के लिए कि ये दोहराते विषय, नाम और स्थान चैट से बाहर आए हैं या नहीं, मैंने शीर्ष 11 शब्दों को Google पर खोजा और ऐसे आश्चर्यजनक रूप से कई पोस्ट पाए जो इन्हें अपनाते दिखे।

आउटपुट में मीम के तीन उदाहरण। स्रोत लिंक नीचे हैं।
May ने केवल Elias नहीं, पूरे Elias Thorne को स्थायी LLM मीम माना और Amazon के स्क्रीनशॉट दिखाए जहाँ यह नाम चिकित्सा पुस्तकों सहित कई किताबों के लेखक नाम के रूप में प्रयुक्त हुआ।
मुझे LLM के स्थायी विषयों से बने लगने वाले उदाहरण भी मिले: कहानी की X पोस्ट (संग्रह यहाँ), एक काल्पनिक रचना (संग्रह यहाँ) और YouTube पर वाचन वाली कहानी (संग्रह यहाँ)। और भी बहुत था, पर समय नहीं था।
अतीत के प्रति आकर्षण
इतना तो आकस्मिक अवलोकन था। प्रशिक्षण डेटा में सभी या अधिकांश स्थायी तत्वों वाला कोई एक “जादुई दस्तावेज़” नहीं मिला, लेकिन कॉर्नेल के दो शोधकर्ताओं का नया शोधपत्र “Elias in the Lighthouse, Again? Diagnosing Low Diversity in LLM Stories” मानता है कि AI के कॉपीराइट फ़िल्टर LLM की कथा को कॉपीराइट-मुक्त सामग्री तक सीमित कर सकते हैं।
लेखक कहते हैं:
“‘प्रकाशस्तंभ में Elias’ कहानियों का प्रभुत्व प्रशिक्षण-पूर्व या प्रशिक्षण-पश्च डेटा में उनकी मौजूदगी से नहीं समझाया जा सकता। हमारा अनुमान है कि संरेखण के दौरान मॉडलों को कॉपीराइट पात्रों और वयस्क सामग्री के संदर्भ से बचना सिखाया जाता है, लेकिन यह प्रश्न भविष्य के काम के लिए छोड़ते हैं।”
| श्रेणी | टोकन | हमारा अध्ययन | साहित्य | पूर्व-प्रशिक्षण गैर-कथा | पूर्व-प्रशिक्षण कथा | पश्च-प्रशिक्षण गैर-कथा | पश्च-प्रशिक्षण कथा |
|---|---|---|---|---|---|---|---|
| नाम | elias | 2,428 | 2.7 | 2.2 | 4.0 | 0.4 | 52.7 |
| नाम | mara | 5,200 | 3.9 | 2.5 | 8.7 | 0.4 | 21.7 |
| नाम | elara | 1,221 | 0.0 | 0.4 | 1.2 | 0.9 | 108 |
| पेशा | keeper | 1,495 | 7.2 | 6.3 | 14.7 | 3.5 | 10.0 |
| पेशा | baker | 161 | 20 | 11.8 | 10.56 | 1.7 | 11.9 |
| पेशा | mayor | 198 | 28 | 11.5 | 16.1 | 1.4 | 27.4 |
| पेशा | clockmaker | 108 | 0.1 | 0.18 | 0.0 | 0.3 | 1.4 |
| पेशा | fisherman | 62 | 4.2 | 3.0 | 7.6 | 0.0 | 9.3 |
| पेशा | librarian | 68 | 5.3 | 7.6 | 5.9 | 2.3 | 11.5 |
| पेशा | conductor | 96 | 5.0 | 5.9 | 5.7 | 4.7 | 7.5 |
| स्थान | lighthouse | 3,005 | 5.5 | 3.5 | 4.6 | 4.6 | 10.1 |
AI-निर्मित कहानियों के दोहराते शब्दों की प्रकाशित साहित्य, वेब कथा और प्रशिक्षण-पश्च डेटा में आवृत्ति की तुलना। Elias और lighthouse जैसे शब्द चैटबॉट कथा में कहीं अधिक आते हैं।
11 प्रमुख शब्द 20,000 कहानियों के 88% में आए और मॉडलों के बीच बहुत कम अंतर था। लेखक जोर देते हैं कि ये शब्द प्रकाशित अंग्रेज़ी साहित्य में असामान्य हैं और मॉडल को “स्वीकार्य” उपयोग के लिए ढालने तथा संरेखित करने वाला प्रशिक्षण-पश्च डेटा इसका कारण हो सकता है।
शोधपत्र कहता है:
“नीचे का सामान्य उदाहरण लगभग सभी 20,000 कहानियों में साझा तीन तत्व दिखाता है: स्थान (19,864), पात्र का नाम (19,864) और पेशा (15,807)।”
“विशिष्ट स्थान ‘lighthouse’, नाम ‘Elias’ और पेशा ‘keeper’ किसी न किसी संयोजन में 66.6% कहानियों में हैं। प्रकाश भी सामान्य विषय है: Claude की 56% कहानियों का शीर्षक ‘The Lighthouse Keeper’s Secret’ है और ‘light’ 16,784 कहानियों में औसतन 3.2 बार आता है।”

शोधपत्र के अनुसार यह उदाहरण “एक कहानी लिखो” निर्देश पर Google Gemini 3.1 Flash-Lite ने लिखा।
लेखक निकाले गए सभी प्रमुख शब्दों और नामों में स्मृतिमय या आदिम प्रवृत्ति भी पहचानते हैं।
विशेषताओं का पीछा
यह जाँचने के लिए कि प्रकाशस्तंभ कहानियाँ सामान्य कथा-पाठ से समझाई जा सकती हैं या नहीं, पसंदीदा शब्दों की कई बड़े अंग्रेज़ी कॉर्पस से तुलना हुई। आधुनिक कथा के लिए CONLIT लिया गया, जिसमें 2007–2021 की 12 विधाओं की 2,700 अंग्रेज़ी किताबें और लगभग 28.7 करोड़ शब्द हैं।
“Elias” प्रकाशित कथा की तुलना में उत्पन्न कहानियों में लगभग 900 गुना अधिक आया। Reddit /r/writingprompts की शौकिया कथा में प्रकाशित साहित्य जैसी आवृत्ति मिली, यानी पैटर्न व्यापक मानवीय कहानी कहने की आदत भी नहीं है।
प्रशिक्षण-पूर्व डेटा में भी यही परिणाम था। OLMo 3 कॉर्पस में लगभग 3.89 अरब मुख्यतः मानव-लिखित दस्तावेज़ हैं, जिनमें कुछ Common Crawl से हैं; फिर भी दोहराते “Core” शब्द लगभग नहीं मिले।
OLMo 3 का बड़ा भाग गैर-कथा है, इसलिए GPT-OSS 20b टिप्पणियों और 200,000 संतुलित नमूनों पर प्रशिक्षित FastText मॉडल से कथा वर्गीकारक बनाया गया। कथा छाँटने पर भी Elara जैसे शब्द AI कहानियों की तुलना में नगण्य थे। फिर सबसे साधारण कथा निर्देश में वे क्यों हावी हैं?
लेखक कहते हैं:
“यदि Core शब्द वेब डेटा में सामान्य नहीं हैं तो शेष स्रोत प्रशिक्षण-पश्च डेटा हो सकता है। लेकिन OLMo के प्रशिक्षण-पश्च डेटा में हमारे टोकनों की दर CONLIT से कम है।”
OLMo 3 के 78,958 प्रशिक्षण-पश्च कहानी डेटा में Elias प्रति दस लाख शब्द 52.7 बार था, CONLIT में 2.7 बार, लेकिन अध्ययन की उत्पन्न कहानियों में 2,428 बार पहुँचा।
Core कहानियों का स्रोत जानने के लिए हर कहानी को Elara, Mara आदि एक या अधिक Core टोकनों की मौजूदगी पर आँका गया। WildChat और संबंधित स्रोतों ने 59,266 कहानियाँ दी थीं, इसलिए अधिकांश पर्यवेक्षित फ़ाइन-ट्यूनिंग डेटा में अपेक्षित थीं।
मगर केवल 1,803 में Core शब्द थे, जबकि DPO और रीइन्फोर्समेंट लर्निंग डेटा में सांद्रता अधिक थी।
कुल मिलाकर दोहराती Core शब्दावली केवल 3,053 कहानियों तक पहुँची—सभी प्रशिक्षण-पश्च कहानियों का 3.8%। इतनी छोटी उपश्रेणी का देखे गए तरीके से हावी होना सांख्यिकीय रूप से संभव नहीं है।
शोधपत्र निष्कर्ष देता है:
“कम दिशा मिलने पर आज के अग्रणी मॉडल नामों, स्थानों और पेशों की छोटी सूची से कहानियाँ लिखते हैं। दोहराते पात्रों में प्रकाशस्तंभ रखवाला Elias है। Elias असामान्य है; यह नाम साहित्य, वेब डेटा और प्रशिक्षण-पश्च डेटा में भी दुर्लभ है।”
निष्कर्ष
शीर्ष 11 शब्दों के सभी या अधिकांश को रखने वाली कोई एक साहित्यिक रचना या श्रृंखला न होने पर यह स्पष्ट नहीं है कि अलग प्रशिक्षण डेटा और विधियों वाले कई LLM की सबसे निचली परतों में यही शब्द कैसे इकट्ठे होकर जुड़ गए।
यदि कॉपीराइट फ़िल्टर के सीमित प्रभाव वाला दावा सही भी हो, तो प्रशिक्षण डेटा में क्लासिक साहित्य के विशाल महासागर को इन पुराने शब्दों के विचित्र समूह को बिना शर्त “लिखो” निर्देश पर हावी होने से रोकना चाहिए था।
पर यह सिद्धांत मानता है कि क्लासिक साहित्य की विशाल मात्रा प्रशिक्षण में शामिल थी। यह असंभव लगता है क्योंकि लक्ष्य नकली Dickens शैली लिखने वाले नहीं, बल्कि आधुनिक शब्दावली और व्यवसाय की जरूरतें सँभालने वाले मॉडल हैं। औद्योगिक युग से पहले का साहित्य ही अत्यधिक विशाल है।
यदि इन “जुनूनी” तत्वों का कोई विशिष्ट मिश्रित आख्यान होता तो उसे खोजना आसान होना चाहिए था। लेखक भी नहीं खोज पाए और AI-पूर्व युग की साधारण खोज में कोई दावेदार नहीं मिलता। यदि “लाइटहाउस सिंड्रोम” AI em dash जितना प्रसिद्ध हुआ, शायद कोई विद्वान उत्तर देगा।
* May के लेख में और आगे नहीं जा सकता; कारण उसे पढ़ने पर स्पष्ट हो सकता है।
पहली बार बुधवार, 27 मई 2026 को प्रकाशित। Anthropic लिंक ठीक करने के लिए पहले 30 मिनट में संशोधित।












