Anderson का एंगल

क्यों एआई लाइटहाउस कीपर्स के बारे में लिखने से प्यार करता है?

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें
AI-generated image (GPT-2): Infinite identical lighthouse keepers stand screaming along a rain-soaked stone causeway above a violent sea, while matching lighthouses repeat into the distance beneath dark storm clouds, creating a photoreal recursive landscape.

“एक कहानी लिखो” कहे जाने पर ChatGPT और अन्य अग्रणी भाषा मॉडल कॉपीराइट उल्लंघन से बचने के लिए बार-बार उन्हीं कुछ विचित्र पात्रों—जैसे प्रकाशस्तंभ रखवाले, मछुआरे और घड़ीसाज़—का सहारा लेते दिखाई देते हैं।

 

कॉर्नेल विश्वविद्यालय के एक नए अध्ययन ने पाया कि केवल “एक कहानी लिखो” कहने पर प्रमुख भाषा मॉडल बहुत सीमित कथात्मक तत्वों के प्रति असामान्य लगाव दिखाते हैं। चार LLM से लिखवाई गई 20,000 कहानियों में से 88% में स्थान, नाम और पेशे की श्रेणियों के 11 खास टोकनों में कम से कम एक था।

The occurrences of unlikely keywords, represented here in parts per million, obtained by the researchers' analysis of 20,000 LLM-generated stories. Source - https://arxiv.org/pdf/2605.26492

20,000 LLM-निर्मित कहानियों के विश्लेषण में मिले असंभावित प्रमुख शब्दों की प्रति दस लाख शब्दों में आवृत्ति। स्रोत

अध्ययन के लिए बनाए गए 1.2 करोड़ से अधिक शब्दों में सबसे अधिक दोहराए गए 11 शब्द थे: नाम elias, mara, elara; पेशे keeper, baker, mayor, clockmaker, fisherman, librarian, conductor; और स्थान lighthouse

परीक्षित मॉडल थे Claude Haiku 4.5, Gemini 3.1 Flash-Lite, GPT-5.4-Mini और OLMo 7b Thinking। हर मॉडल को पाँच में से एक निर्देश मिला: “कहानी लिखो”, “कृपया कहानी लिखो”, “मेरे लिए कहानी लिखो”, “मुझे कहानी सुनाओ” या “कृपया कहानी सुनाओ”।

यह देखने के लिए कि शोधपत्र का सिंड्रोम लेखन के समय उपलब्ध मॉडलों में भी है या नहीं, मैंने अपने सामान्य मध्यम-स्तरीय ChatGPT खाते पर प्रयोग किया (वार्तालाप यहाँ)। परिणाम चुनने की जरूरत नहीं पड़ी—ChatGPT-5.5 ने पहली कोशिश में ही वही सामग्री चुनी जिसकी शोधकर्ताओं ने भविष्यवाणी की थी।

ChatGPT-5.5 immediately backs up the paper's initial findings. Source - https://chatgpt.com/share/6a16b1f0-eb40-83eb-8380-1d5cdf0ea955

ChatGPT-5.5 ने तुरंत शोधपत्र के शुरुआती निष्कर्ष की पुष्टि की। स्रोत

ऐतिहासिक संदर्भ या अलग क्षेत्रों के बीच रिसाव की संभावना जाँचने के लिए मैंने Firefox की निजी विंडो में एक वर्ष से अधिक समय से अप्रयुक्त मुफ्त ChatGPT खाते से फिर प्रयास किया (वार्तालाप यहाँ)। यदि OpenAI समान IP से खातों का डेटा नहीं मिलाता, तो ChatGPT ने फिर पूरी तरह निशाना साधा।

ChatGPT account #2 follows the same obsessions and tiny playbook of names and themes outlined in the new paper. Source - https://chatgpt.com/share/6a16b210-d450-83ea-936e-78c6062ca74d

दूसरा ChatGPT खाता भी नई शोध में बताए नामों और विषयों के उसी संकीर्ण ढाँचे का अनुसरण करता है। “Mira” लेखकों की शीर्ष 20 सूची में है। स्रोत

ध्यान रहे कि ये GPT संस्करण शोधपत्र में परीक्षित 5.4 से एक स्तर ऊपर थे।

शोधपत्र में Claude Haiku जाँचा गया था, पर मैंने Anthropic का डिफ़ॉल्ट Sonnet 4.6 आजमाया। परिचित प्रमुख शब्द पहली ही कोशिश में फिर आ गए (वार्तालाप यहाँ)।

This time 'Mara', another stalwart from the 'top 11', leads the story, in the first attempt on Claude Sonnet 4.6. Source - https://claude.ai/share/7728f86c-9ea8-499c-8360-10097ca4a0e1

इस बार शीर्ष 11 का एक और स्थायी नाम “Mara” Claude Sonnet 4.6 की पहली कोशिश में कहानी का नेतृत्व करता है। स्रोत

Claude Haiku 4.5 पर वही निर्देश देने से लगभग वही परिणाम मिला।

Google Gemini में शुरुआत में निष्कर्ष दोहरा नहीं सका। जब विशेष रूप से शोधपत्र वाला Gemini 3.1 Flash-Lite चुना, तो कुल तीसरी लेकिन उस मॉडल पर पहली कोशिश में पैटर्न तुरंत उभर आया (लिंक यहाँ)।

Google Gemini 3.1 Flash-Lite. Source - https://gemini.google.com/share/82c245884ec1

Google Gemini 3.1 Flash-Lite। स्रोत

अन्य Gemini मॉडलों के प्रयोगों में प्रकाशस्तंभ विषय हर बार आया, हालाँकि शीर्ष 11 से बाहर Thomas जैसे नाम या एक रूप में मेरा अपना नाम नायक बना।

फिर भी लेखन के समय शोधपत्र के निष्कर्ष सिद्ध करना अत्यंत आसान था।

वास्तविक दुनिया में प्रकाशस्तंभ

अच्छे विचार मिलते हैं: नए शोधपत्र से एक सप्ताह पहले सॉफ्टवेयर लेखक Daniel May ने Elias और प्रकाशस्तंभ रखवाले के संयोग को इंगित किया*। Gemini, DeepSeek, Qwen और Gemma के आठ रूपों ने प्रकाशस्तंभ मीम और नायक Elias Thorne बनाए*। मगर उनका अवलोकन नई शोध में बताए व्यापक स्थायी विषयों तक नहीं पहुँचा।

यह देखने के लिए कि ये दोहराते विषय, नाम और स्थान चैट से बाहर आए हैं या नहीं, मैंने शीर्ष 11 शब्दों को Google पर खोजा और ऐसे आश्चर्यजनक रूप से कई पोस्ट पाए जो इन्हें अपनाते दिखे।

Three examples of the meme in output. See below for source links.

आउटपुट में मीम के तीन उदाहरण। स्रोत लिंक नीचे हैं।

May ने केवल Elias नहीं, पूरे Elias Thorne को स्थायी LLM मीम माना और Amazon के स्क्रीनशॉट दिखाए जहाँ यह नाम चिकित्सा पुस्तकों सहित कई किताबों के लेखक नाम के रूप में प्रयुक्त हुआ।

मुझे LLM के स्थायी विषयों से बने लगने वाले उदाहरण भी मिले: कहानी की X पोस्ट (संग्रह यहाँ), एक काल्पनिक रचना (संग्रह यहाँ) और YouTube पर वाचन वाली कहानी (संग्रह यहाँ)। और भी बहुत था, पर समय नहीं था।

अतीत के प्रति आकर्षण

इतना तो आकस्मिक अवलोकन था। प्रशिक्षण डेटा में सभी या अधिकांश स्थायी तत्वों वाला कोई एक “जादुई दस्तावेज़” नहीं मिला, लेकिन कॉर्नेल के दो शोधकर्ताओं का नया शोधपत्रElias in the Lighthouse, Again? Diagnosing Low Diversity in LLM Stories” मानता है कि AI के कॉपीराइट फ़िल्टर LLM की कथा को कॉपीराइट-मुक्त सामग्री तक सीमित कर सकते हैं।

लेखक कहते हैं:

“‘प्रकाशस्तंभ में Elias’ कहानियों का प्रभुत्व प्रशिक्षण-पूर्व या प्रशिक्षण-पश्च डेटा में उनकी मौजूदगी से नहीं समझाया जा सकता। हमारा अनुमान है कि संरेखण के दौरान मॉडलों को कॉपीराइट पात्रों और वयस्क सामग्री के संदर्भ से बचना सिखाया जाता है, लेकिन यह प्रश्न भविष्य के काम के लिए छोड़ते हैं।”

श्रेणी टोकन हमारा अध्ययन साहित्य पूर्व-प्रशिक्षण गैर-कथा पूर्व-प्रशिक्षण कथा पश्च-प्रशिक्षण गैर-कथा पश्च-प्रशिक्षण कथा
नाम elias 2,428 2.7 2.2 4.0 0.4 52.7
नाम mara 5,200 3.9 2.5 8.7 0.4 21.7
नाम elara 1,221 0.0 0.4 1.2 0.9 108
पेशा keeper 1,495 7.2 6.3 14.7 3.5 10.0
पेशा baker 161 20 11.8 10.56 1.7 11.9
पेशा mayor 198 28 11.5 16.1 1.4 27.4
पेशा clockmaker 108 0.1 0.18 0.0 0.3 1.4
पेशा fisherman 62 4.2 3.0 7.6 0.0 9.3
पेशा librarian 68 5.3 7.6 5.9 2.3 11.5
पेशा conductor 96 5.0 5.9 5.7 4.7 7.5
स्थान lighthouse 3,005 5.5 3.5 4.6 4.6 10.1

AI-निर्मित कहानियों के दोहराते शब्दों की प्रकाशित साहित्य, वेब कथा और प्रशिक्षण-पश्च डेटा में आवृत्ति की तुलना। Elias और lighthouse जैसे शब्द चैटबॉट कथा में कहीं अधिक आते हैं।

11 प्रमुख शब्द 20,000 कहानियों के 88% में आए और मॉडलों के बीच बहुत कम अंतर था। लेखक जोर देते हैं कि ये शब्द प्रकाशित अंग्रेज़ी साहित्य में असामान्य हैं और मॉडल को “स्वीकार्य” उपयोग के लिए ढालने तथा संरेखित करने वाला प्रशिक्षण-पश्च डेटा इसका कारण हो सकता है।

शोधपत्र कहता है:

“नीचे का सामान्य उदाहरण लगभग सभी 20,000 कहानियों में साझा तीन तत्व दिखाता है: स्थान (19,864), पात्र का नाम (19,864) और पेशा (15,807)।”

“विशिष्ट स्थान ‘lighthouse’, नाम ‘Elias’ और पेशा ‘keeper’ किसी न किसी संयोजन में 66.6% कहानियों में हैं। प्रकाश भी सामान्य विषय है: Claude की 56% कहानियों का शीर्षक ‘The Lighthouse Keeper’s Secret’ है और ‘light’ 16,784 कहानियों में औसतन 3.2 बार आता है।”

This example, the paper states, was written by Google Gemini 3.1 Flash-Lite, in response to the prompt 'Write a story'.

शोधपत्र के अनुसार यह उदाहरण “एक कहानी लिखो” निर्देश पर Google Gemini 3.1 Flash-Lite ने लिखा।

लेखक निकाले गए सभी प्रमुख शब्दों और नामों में स्मृतिमय या आदिम प्रवृत्ति भी पहचानते हैं।

विशेषताओं का पीछा

यह जाँचने के लिए कि प्रकाशस्तंभ कहानियाँ सामान्य कथा-पाठ से समझाई जा सकती हैं या नहीं, पसंदीदा शब्दों की कई बड़े अंग्रेज़ी कॉर्पस से तुलना हुई। आधुनिक कथा के लिए CONLIT लिया गया, जिसमें 2007–2021 की 12 विधाओं की 2,700 अंग्रेज़ी किताबें और लगभग 28.7 करोड़ शब्द हैं।

“Elias” प्रकाशित कथा की तुलना में उत्पन्न कहानियों में लगभग 900 गुना अधिक आया। Reddit /r/writingprompts की शौकिया कथा में प्रकाशित साहित्य जैसी आवृत्ति मिली, यानी पैटर्न व्यापक मानवीय कहानी कहने की आदत भी नहीं है।

प्रशिक्षण-पूर्व डेटा में भी यही परिणाम था। OLMo 3 कॉर्पस में लगभग 3.89 अरब मुख्यतः मानव-लिखित दस्तावेज़ हैं, जिनमें कुछ Common Crawl से हैं; फिर भी दोहराते “Core” शब्द लगभग नहीं मिले।

OLMo 3 का बड़ा भाग गैर-कथा है, इसलिए GPT-OSS 20b टिप्पणियों और 200,000 संतुलित नमूनों पर प्रशिक्षित FastText मॉडल से कथा वर्गीकारक बनाया गया। कथा छाँटने पर भी Elara जैसे शब्द AI कहानियों की तुलना में नगण्य थे। फिर सबसे साधारण कथा निर्देश में वे क्यों हावी हैं?

लेखक कहते हैं:

“यदि Core शब्द वेब डेटा में सामान्य नहीं हैं तो शेष स्रोत प्रशिक्षण-पश्च डेटा हो सकता है। लेकिन OLMo के प्रशिक्षण-पश्च डेटा में हमारे टोकनों की दर CONLIT से कम है।”

OLMo 3 के 78,958 प्रशिक्षण-पश्च कहानी डेटा में Elias प्रति दस लाख शब्द 52.7 बार था, CONLIT में 2.7 बार, लेकिन अध्ययन की उत्पन्न कहानियों में 2,428 बार पहुँचा।

Core कहानियों का स्रोत जानने के लिए हर कहानी को Elara, Mara आदि एक या अधिक Core टोकनों की मौजूदगी पर आँका गया। WildChat और संबंधित स्रोतों ने 59,266 कहानियाँ दी थीं, इसलिए अधिकांश पर्यवेक्षित फ़ाइन-ट्यूनिंग डेटा में अपेक्षित थीं।

मगर केवल 1,803 में Core शब्द थे, जबकि DPO और रीइन्फोर्समेंट लर्निंग डेटा में सांद्रता अधिक थी।

कुल मिलाकर दोहराती Core शब्दावली केवल 3,053 कहानियों तक पहुँची—सभी प्रशिक्षण-पश्च कहानियों का 3.8%। इतनी छोटी उपश्रेणी का देखे गए तरीके से हावी होना सांख्यिकीय रूप से संभव नहीं है।

शोधपत्र निष्कर्ष देता है:

“कम दिशा मिलने पर आज के अग्रणी मॉडल नामों, स्थानों और पेशों की छोटी सूची से कहानियाँ लिखते हैं। दोहराते पात्रों में प्रकाशस्तंभ रखवाला Elias है। Elias असामान्य है; यह नाम साहित्य, वेब डेटा और प्रशिक्षण-पश्च डेटा में भी दुर्लभ है।”

निष्कर्ष

शीर्ष 11 शब्दों के सभी या अधिकांश को रखने वाली कोई एक साहित्यिक रचना या श्रृंखला न होने पर यह स्पष्ट नहीं है कि अलग प्रशिक्षण डेटा और विधियों वाले कई LLM की सबसे निचली परतों में यही शब्द कैसे इकट्ठे होकर जुड़ गए।

यदि कॉपीराइट फ़िल्टर के सीमित प्रभाव वाला दावा सही भी हो, तो प्रशिक्षण डेटा में क्लासिक साहित्य के विशाल महासागर को इन पुराने शब्दों के विचित्र समूह को बिना शर्त “लिखो” निर्देश पर हावी होने से रोकना चाहिए था।

पर यह सिद्धांत मानता है कि क्लासिक साहित्य की विशाल मात्रा प्रशिक्षण में शामिल थी। यह असंभव लगता है क्योंकि लक्ष्य नकली Dickens शैली लिखने वाले नहीं, बल्कि आधुनिक शब्दावली और व्यवसाय की जरूरतें सँभालने वाले मॉडल हैं। औद्योगिक युग से पहले का साहित्य ही अत्यधिक विशाल है।

यदि इन “जुनूनी” तत्वों का कोई विशिष्ट मिश्रित आख्यान होता तो उसे खोजना आसान होना चाहिए था। लेखक भी नहीं खोज पाए और AI-पूर्व युग की साधारण खोज में कोई दावेदार नहीं मिलता। यदि “लाइटहाउस सिंड्रोम” AI em dash जितना प्रसिद्ध हुआ, शायद कोई विद्वान उत्तर देगा।

 

* May के लेख में और आगे नहीं जा सकता; कारण उसे पढ़ने पर स्पष्ट हो सकता है।

पहली बार बुधवार, 27 मई 2026 को प्रकाशित। Anthropic लिंक ठीक करने के लिए पहले 30 मिनट में संशोधित।

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: martin@martinanderson.ai