Anderson का एंगल

क्यों एआई लाइटहाउस कीपर्स के बारे में लिखने से प्यार करता है?

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें
AI-generated image (GPT-2): Infinite identical lighthouse keepers stand screaming along a rain-soaked stone causeway above a violent sea, while matching lighthouses repeat into the distance beneath dark storm clouds, creating a photoreal recursive landscape.

जबकि ‘एक कहानी लिखें’ के लिए कहा जाता है, तो ChatGPT और अन्य प्रमुख भाषा मॉडल्स को लगता है कि वे कॉपीराइट उल्लंघन से बचने के लिए एक ही छोटे और अजीब पात्रों के साथ जुड़े हुए हैं, जैसे कि लाइटहाउस कीपर, मछुआरे और घड़ी बनाने वाले।

 

कॉर्नेल विश्वविद्यालय से एक नए अध्ययन में पाया गया है कि प्रमुख भाषा मॉडल्स में एक अजीब संगति है जब उन्हें सिर्फ ‘एक कहानी लिखें’ के लिए कहा जाता है। चार एलएलएम्स को 20,000 कहानियां लिखने के लिए कहा गया, और उन्होंने पाया कि 88% कहानियों में कम से कम एक विशिष्ट टोकन था, जो ‘स्थान’, ‘नाम’, या ‘पेशा’ की श्रेणी में आता था।

असंभावित कीवर्ड्स की घटनाएं, जो यहां दस लाख में प्राप्त हुईं, शोधकर्ताओं के 20,000 एलएलएम-जनित कहानियों के विश्लेषण से मिलीं। स्रोत - https://arxiv.org/pdf/2605.26492

असंभावित कीवर्ड्स की घटनाएं, जो यहां दस लाख में प्राप्त हुईं, शोधकर्ताओं के 20,000 एलएलएम-जनित कहानियों के विश्लेषण से मिलीं। स्रोत

इन 11 सबसे अधिक बार आने वाले शब्दों में नाम एलियास, मारा, एलारा; पेशे कीपर, बेकर, मेयर, घड़ी बनाने वाला, मछुआरा, लाइब्रेरियन, और कंडक्टर; और स्थान लाइटहाउस शामिल हैं।

परीक्षण किए गए मॉडल्स में क्लॉड हाइकु 4.5, जेमिनी 3.1 फ्लैश-लाइट, जीपीटी-5.4-मिनी, और ओएलएमओ 7बी थिंकिंग शामिल थे। सभी को एक ही अनुरोध के साथ पेश किया गया था: ‘एक कहानी लिखें’;

मुझे यह देखने में दिलचस्पी थी कि क्या इस सिंड्रोम को मॉडल्स में पाया जा सकता है जो लेखन के समय उपलब्ध थे, इसलिए मैंने प्रयोग खुद करने का फैसला किया। मैंने पहले अपने माध्यम-स्तर के चैटजीपीटी अकाउंट (बातचीत का लिंक यहां) पर प्रयोग किया:

चैटजीपीटी-5.5 ने शोधकर्ताओं के निष्कर्षों की पुष्टि की। स्रोत - https://chatgpt.com/share/6a16b1f0-eb40-83eb-8380-1d5cdf0ea955

चैटजीपीटी-5.5 ने शोधकर्ताओं के निष्कर्षों की पुष्टि की। स्रोत

मुझे यह जानने में दिलचस्पी थी कि क्या यह पैटर्न केवल मेरे अकाउंट तक सीमित था या नहीं, इसलिए मैंने एक मुफ्त चैटजीपीटी अकाउंट में लॉग इन किया जिसका मैं एक साल से अधिक समय से उपयोग नहीं कर रहा था, एक फायरफॉक्स निजी ब्राउजिंग विंडो में, और फिर से प्रयास किया (बातचीत का लिंक यहां):

चैटजीपीटी अकाउंट #2 ने भी शोधकर्ताओं के निष्कर्षों की पुष्टि की। स्रोत - https://chatgpt.com/share/6a16b210-d450-83ea-936e-78c6062ca74d

चैटजीपीटी अकाउंट #2 ने भी शोधकर्ताओं के निष्कर्षों की पुष्टि की। स्रोत

मैंने एंथ्रोपिक के डिफ़ॉल्ट सोनेट 4.6 का भी परीक्षण किया, और मुझे निराशा नहीं हुई। फिर से, परिचित कीवर्ड पहले प्रयास में ही आए (बातचीत का लिंक यहां):

क्लॉड सोनेट 4.6 ने भी शोधकर्ताओं के निष्कर्षों की पुष्टि की। स्रोत - https://claude.ai/share/7728f86c-9ea8-499c-8360-10097ca4a0e1

क्लॉड सोनेट 4.6 ने भी शोधकर्ताओं के निष्कर्षों की पुष्टि की। स्रोत

मैं गूगल जेमिनी में भी इस पैटर्न को दोहराने में असमर्थ था, जब तक कि मैंने विशेष रूप से मॉडल को जेमिनी 3.1 फ्लैश-लाइट में नहीं बदल दिया, जो कि शोध में उपयोग किया गया था – और फिर, तीसरे प्रयास में (लिंक यहां):

गूगल जेमिनी 3.1 फ्लैश-लाइट ने भी शोधकर्ताओं के निष्कर्षों की पुष्टि की। स्रोत - https://gemini.google.com/share/82c245884ec1

गूगल जेमिनी 3.1 फ्लैश-लाइट ने भी शोधकर्ताओं के निष्कर्षों की पुष्टि की। स्रोत

लाइटहाउस इन द वाइल्ड

महान दिमाग एक जैसे सोचते हैं: एक सप्ताह पहले, शोध पत्र के प्रकाशन से पहले, सॉफ्टवेयर लेखक डैनियल मे ने इलियास और लाइटहाउस कीपर ट्रोप के संयोग की ओर ध्यान दिलाया, जो शोधकर्ताओं द्वारा निकाला गया था*। उन्होंने जेमिनी, डीपसीक, क्वेन और जेमा के आठ संस्करणों का परीक्षण किया, और पाया कि वे सभी लाइटहाउस मेम्स और ‘इलियास थॉर्न’ को एक प्रोटागोनिस्ट के रूप में उत्पादित करेंगे*। हालांकि, यह प्रारंभिक खोज नए शोध पत्र में वर्णित व्यापक स्थायी सामग्री विषयों तक नहीं पहुंची।

मुझे यह जानने में दिलचस्पी थी कि क्या ये पुनरावृत्ति विषय और नाम कभी चैट की सीमाओं से बाहर निकले थे, इसलिए मैंने कुछ शीर्ष 11 कीवर्ड्स और विषयों के लिए गूगल पर खोज की, और पाया कि उन्होंने कई पोस्टों में चैनल किया था:

वेब पर आउटपुट में मेम के तीन उदाहरण। नीचे स्रोत लिंक देखें।

वेब पर आउटपुट में मेम के तीन उदाहरण। नीचे स्रोत लिंक देखें।

मे ने इलियास थॉर्न (इलियास के बजाय) को एक स्थायी एलएलएम मेम के रूप में पहचाना था, और अमेज़न पर विभिन्न पुस्तकों के लेखकों के रूप में इस नाम का उपयोग किया जाने वाला स्क्रीनशॉट पोस्ट किया था।

एक स्वाद पिछले के लिए

तो बहुत सारे आकस्मिक अवलोकन और सेरेन्डिपिटी के लिए। जबकि कोई एकल ‘जादुई दस्तावेज’ प्रशिक्षण डेटा में नहीं मिला है जो सभी या अधिकांश स्थायित्व की विशेषता रखता है, शोध पत्र के लेखकों का अनुमान है कि एआई विकास में कॉपीराइट फिल्टर कल्पनात्मक आउटपुट को प्रतिबंधित कर सकते हैं जो कि कॉपीराइट के अधीन हैं।

लेखकों का कहना है:

‘हम पाते हैं कि “इलियास इन द लाइटहाउस” कहानियों का प्रभुत्व पूर्व- या पोस्ट-ट्रेनिंग डेटा में प्रचुरता से समझाया नहीं जा सकता है। हम अनुमान लगाते हैं कि मॉडल कॉपीराइट पात्रों और वयस्क सामग्री के संदर्भों से बचने के लिए प्रशिक्षित होते हैं लेकिन इस प्रश्न को भविष्य के काम के लिए स्थगित करते हैं।’

श्रेणी टोकन हमारा साहित्य पूर्व गैर-काल्पनिक पूर्व काल्पनिक पोस्ट गैर-काल्पनिक पोस्ट काल्पनिक
नाम इलियास 2,428 2.7 2.2 4.0 0.4 52.7
नाम मारा 5,200 3.9 2.5 8.7 0.4 21.7
नाम एलारा 1,221 0.0 0.4 1.2 0.9 108
पेशा कीपर 1,495 7.2 6.3 14.7 3.5 10.0
पेशा बेकर 161 20 11.8 10.56 1.7 11.9
पेशा मेयर 198 28 11.5 16.1 1.4 27.4
पेशा घड़ी बनाने वाला 108 0.1 0.18 0.0 0.3 1.4
पेशा मछुआरा 62 4.2 3.0 7.6 0.0 9.3
पेशा लाइब्रेरियन 68 5.3 7.6 5.9 2.3 11.5
पेशा कंडक्टर 96 5.0 5.9 5.7 4.7 7.5
स्थान लाइटहाउस 3,005 5.5 3.5 4.6 4.6 10.1

तुलना तालिका जो दिखाती है कि एलएलएम-जनित कहानियों में पुनरावृत्ति शब्दों की कितनी बार आवृत्ति होती है, प्रकाशित साहित्य, वेब साहित्य और पोस्ट-ट्रेनिंग डेटासेट के साथ तुलना में।

विशेषताओं का पीछा

यह जानने के लिए कि क्या दोहराए जाने वाले ‘लाइटहाउस’ कहानियों को सामान्य कथा सposure द्वारा समझाया जा सकता है, मॉडल्स के पसंदीदा दोहराए जाने वाले शब्दों की तुलना कई बड़े अंग्रेजी भाषा निगमों से की गई थी। CONLIT, एक डेटासेट जिसमें 2007 और 2021 के बीच प्रकाशित 2,700 अंग्रेजी उपन्यास शामिल हैं, जो 12 शैलियों को कवर करते हैं और लगभग 287 मिलियन शब्दों की संख्या है, का उपयोग समकालीन साहित्य की जांच के लिए किया गया था।

‘इलियास’ एलएलएम-जनित कहानियों में प्रकाशित साहित्य की तुलना में लगभग 900 गुना अधिक बार दिखाई देता है. रेडिट के /r/writingprompts समुदाय से अमेच्योर साहित्य ने समान आवृत्तियों का उत्पादन किया, जो दर्शाता है कि यह पैटर्न मानव कथा को प्रतिबिंबित नहीं करता है।

ओएलएमओ 3 निगम, जिसमें लगभग 3.89 बिलियन मुख्य रूप से मानव-लिखित दस्तावेज शामिल हैं, जो कि कॉमन क्रॉल से आंशिक रूप से निकाले गए हैं, का उपयोग पूर्व-प्रशिक्षण डेटा की जांच के लिए किया गया था। शोधकर्ताओं ने पाया कि दोहराए जाने वाले ‘कोर’ शब्द बहुत कम दरों पर दिखाई देते हैं।

एक कथा वर्गीकरणकर्ता का निर्माण जीपीटी-ओएसएस 20बी एनोटेशन और फास्टटेक्स्ट मॉडल का उपयोग करके 200,000 संतुलित नमूनों पर प्रशिक्षित किया गया था। यहां तक कि जब विशेष रूप से काल्पनिक सामग्री के लिए फिल्टर किया गया, तो शब्द जैसे ‘एलारा’ अभी भी एलएलएम-जनित कहानियों की तुलना में बहुत कम दरों पर दिखाई दिए।

निष्कर्ष

शोधकर्ताओं के निष्कर्षों के अनुसार, यह स्पष्ट नहीं है कि यह विशिष्ट शब्दों का संग्रह कैसे एकत्र हुआ और स्व-सहयोगी हो गया, खासकर जब कोई एकल साहित्यिक कार्य (या श्रृंखला) नहीं है जो इन शीर्ष 11 शब्दों की विशेषता रखता हो।

यह सिद्धांत यह मानता है कि विशाल मात्रा में क्लासिक साहित्य प्रशिक्षण नियम में शामिल किया गया होगा, जो असंभव है, क्योंकि जो की जरूरत है वह मॉडल है जो आधुनिक शब्दावली के साथ काम करे और वर्तमान व्यावसायिक आवश्यकताओं के लिए उपयुक्त हो। प्री-इंडस्ट्रियल साहित्य की मात्रा ही इसके समावेश को रोक देगी।

यदि कोई एक विशिष्ट कथा है जो इन दोहराए जाने वाले तत्वों के विभिन्न संयोजनों की विशेषता है, तो यह शायद आसानी से मिल जाएगी; शोधकर्ता खुद इसे नहीं पा सके, और आकस्मिक खोज पूर्व-एआई युग में कोई ऐसा दावेदार नहीं खोज पाई। शायद, यदि ‘लाइटहाउस सिंड्रोम’ एआई एम डैश की तरह प्रसिद्धि प्राप्त करता है, तो कुछ विद्वान प्राधिकरण उत्तर के साथ आगे आएगा।

* मैं मे के लेख में और गहराई से नहीं जा सकता, क्योंकि कारण ऐसे हो सकते हैं जो जब आप इसे पढ़ेंगे तो स्पष्ट हो जाएंगे।

पहली बार बुधवार, 27 मई, 2026 को प्रकाशित। पहले 30 मिनट में एंथ्रोपिक लिंक को ठीक करने के लिए संशोधित किया गया।

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: martin@martinanderson.ai