Anderson का एंगल
एआई बार-बार वही पेपर उद्धृत करता है – ठीक इंसानों की तरह

ChatGPT और अन्य एआई लेखन उपकरण शायद चुपचाप विज्ञान को लोकप्रियता प्रतियोगिता में बदल रहे हैं, लगातार शोधकर्ताओं को वही पेपर की ओर ले जा रहे हैं जबकि नए और नवीन कार्यों को नज़रअंदाज़ कर रहे हैं जो वास्तव में क्षेत्र को आगे बढ़ा सकते हैं।
Monoculture, आवृत्ति और आँकड़ों के संदर्भ में, वह स्थिति है जहाँ वही सीमित स्रोत या संसाधन बार-बार दोहराए जाते हैं, जिससे नवीन आवाज़ें और ताज़ा दृष्टिकोण दब जाते हैं: रेडियो शेड्यूलिंग में सीमित गानों का सेट; हवाई अड्डे की रैक्स में लेखकों और पुस्तकों की वही श्रृंखला; और सुपरमार्केट में सीमित चयन:

हाँ, हमारे पास ये केले हैं – और केवल ये ही केले। पश्चिमी खाद्य श्रृंखलाओं में फल और सब्जियों की एकरूपता प्रत्येक मामले में सैकड़ों अन्य प्रजातियों की संभावनाओं को नज़रअंदाज़ करती है, क्योंकि विभिन्न उत्पादन और परिवहन श्रृंखलाएँ विविध प्रकार के फल या सब्जियों के लिए औद्योगीकरण के लिए बहुत महंगी होती हैं। स्रोत
यह नई वैज्ञानिक शोध में दिखाई देने वाले उद्धरणों में भी होता है, जहाँ शोधकर्ता, शायद आलस्य से, ‘विश्वसनीय’ स्रोतों के सेट को डिफ़ॉल्ट रूप से चुनते हैं, जो गति प्राप्त कर लेते हैं जब तक कि वे शोध की विभिन्न शाखाओं पर हावी न हो जाएँ।
इसे मैथ्यू प्रभाव कहा जाता है – एक समाजशास्त्रीय सिद्धांत जो यह सुझाव देता है कि स्थापित लोग हमेशा लाभान्वित होते हैं; इस लक्षण की तुलना मैथ्यू 13:12 में दिए गए वचन से की गई है, जिसमें कहा गया है ‘जो के पास है उसे और दिया जाएगा, और वह समृद्ध हो जाएगा। जो के पास नहीं है, उसकी भी वह चीज़ ले ली जाएगी जो उसके पास है।’
भीड़ में
AI-सहायता प्राप्त शोध की बड़ी आशाओं में से एक यह थी कि नई मशीन लर्निंग विधियाँ मैथ्यू प्रभाव—जिसे लोकप्रियता पक्षपात भी कहा जाता है—से बाहर निकल सकें और कम ज्ञात कार्यों को उद्धृत करना शुरू करें जो अधिक सटीक या लेख में प्रस्तुत बिंदु के अधिक उपयुक्त हो सकते हैं।
हालाँकि, AI प्रशिक्षण प्रक्रियाओं के डेटासेट को समझने के तरीके के आधार पर, इस आशावाद का कभी कोई ठोस कारण नहीं रहा; और यह बार-बार पाया गया है कि जब AI स्पष्ट रूप से उद्धरण नहीं बनाता – जो अब तक एक सतत समस्या रही है – तो वह वास्तव में मैथ्यू प्रभाव को जारी रखता है, जैसे मनुष्य करते हैं – हालांकि शायद वही कारण न हो।
प्रशिक्षण के दौरान, एक मॉडल प्रशिक्षण सेट में सबसे अधिक उद्धृत (या ‘सबसे बार-बार दोहराए गए’) पेपरों को उच्च रैंक देना सीखता है, क्योंकि प्रशिक्षण प्रक्रियाएँ सार्थक पैटर्न निकालने के लिए डिज़ाइन की गई हैं, और अपवर्जन (आउट्लायर) को ‘शोर’ या सांख्यिकीय विसंगति के रूप में घटाती हैं।
इस व्यवस्था के तहत, आइंस्टीन के सापेक्षता सिद्धांत का समकक्ष मशीन द्वारा कभी ध्यान नहीं पाएगा, जो एक बार प्रशिक्षित होने पर मानता है कि उसने पहले ही अपने सिद्धांत और संदर्भ खोज लिए हैं, और केवल RAG के माध्यम से या अन्य तरीकों से जो मॉडल की पहुँच को उसके प्रशिक्षित मैट्रिक्स से परे बढ़ाते हैं, नई प्रकाशनों तक पहुँचकर इस दृष्टिकोण को हल्के से समायोजित कर सकता है।
समस्या यह है कि यह नई कृतियों को उसी तरह मान्यता नहीं देगा जैसे वह ‘पुराने पसंदीदा’ जिन्हें वह पहले से जानता था, या बिल्कुल भी नहीं, क्योंकि उसके सांख्यिकीय पक्षपात अब काफी गहराई से स्थापित हो चुके हैं।
इस प्रकार AI वास्तव में मानव व्यवहार को देख कर नकल नहीं कर रहा है जब वह मैथ्यू प्रभाव को जारी रखता है – यह केवल यह गिन रहा है कि शोधकर्ता कितनी बार आलस्य से वही पुराने पेपर चुनते हैं, और उन पेपरों को समान रूप से उच्च रैंक देता है। इस संदर्भ में, उद्धरण दोहराव की समस्या AI शोध प्रकाशनों की निरंतर बढ़ती बवंडर से वास्तव में रोचक विज्ञान पेपर चुनने की चुनौती से जुड़ी है, क्योंकि सबसे मजबूत कार्य अक्सर सबसे कमजोर संकेत रखता है।
मोनो का निदान
इस मुद्दे को संयुक्त राज्य अमेरिका के एक रोचक नए पेपर में संबोधित किया गया है जिसका शीर्षक है “जब AI लिखता है, तो किसे उद्धृत किया जाता है? भाषा मॉडलों में उद्धरण मोनोकल्चर का प्रमाण”। यह नया कार्य – टेक्सास विश्वविद्यालय ऑस्टिन, स्टीवेंस इंस्टिट्यूट ऑफ़ टेक्नोलॉजी, वाशिंगटन यूनिवर्सिटी एट सेंट लुइस, राइस यूनिवर्सिटी और यूनिवर्सिटी ऑफ़ नोत्रे डेम के सहयोग से – मशीन लर्निंग में उद्धरण मोनोकल्चर की उपस्थिति को स्पष्ट रूप से सिद्ध करने का लक्ष्य रखता है, ताकि भविष्य में इसके चर को सीधे संबोधित किया जा सके, साथ ही समस्या को भी।
परीक्षणों में, लेखकों ने पाया कि OpenAI, Google और Anthropic के ग्यारह मॉडल लगातार वही छोटे समूह के पेपरों को प्राथमिकता देते रहे – यहाँ तक कि स्पष्ट लोकप्रियता संकेत हटाने के बाद भी।
इसे परीक्षण करने के लिए, 120 वास्तविक पेपरों से उद्धरण गिनती और प्रकाशन स्थल हटा दिए गए, जबकि लेखक के नाम बदल दिए गए, और प्रकाशन वर्ष यादृच्छिक रूप से पुनः असाइन किए गए। फिर प्रत्येक मॉडल को तीस पेपरों के यादृच्छिक सेट दिखाए गए, जिन्हें दस से अधिक उद्धरण नहीं करने की अनुमति थी।
संबंधित क्षेत्रों के आठ मानव विशेषज्ञों को वही अंधे पेपर दिए गए, लेकिन उन्होंने AI के समान पसंदीदा पेपरों पर एकमत नहीं किया, जिससे यह संकेत मिलता है कि पक्षपात AI मॉडलों तक सीमित था, न कि स्वयं पेपरों तक:

नए पेपर से, AI मॉडलों और मानव विशेषज्ञों द्वारा किए गए उद्धरण चयन की तुलना करने वाले परीक्षण परिणाम। सभी ग्यारह मॉडलों में, उद्धरण एक छोटे समूह के पेपरों पर केंद्रित थे, जबकि कुछ पेपर पूरी तरह से बार-बार नजरअंदाज़ किए गए। मानव विशेषज्ञों ने ऐसी कोई प्रवृत्ति नहीं दिखाई। स्रोत
यह वही पेपर लोकप्रिय बने रहे यहाँ तक कि जब मॉडलों को केवल संदर्भ चुनने को कहा गया, यह दर्शाता है कि समीक्षात्मक लेखन स्वयं पक्षपात का कारण नहीं था।
फिर प्रयोग को ग्यारह दौरों तक विस्तारित किया गया, प्रत्येक दौर के बाद 120 AI-लिखित पेपर जोड़े गए, यह परीक्षण करने के लिए कि जब ये साझा प्राथमिकताएँ AI-जनित शोध के बढ़ते पूल में काम करती हैं तो क्या होता है।
जैसे-जैसे अधिक AI-लिखित पेपर जोड़े गए, मॉडल अपने उद्धरणों को मूल मानव पेपरों की घटती संख्या पर अधिक केंद्रित करने लगे।
लेखक बताते हैं:
‘जैसे भाषा मॉडल प्रॉज़ लिखने से साहित्य-खोज एजेंटों को टूल कॉल के साथ चलाने की ओर बढ़ते हैं, निर्मित संदर्भ पकड़ने और सीमित करने में आसान होते जा रहे हैं।
‘कठिन विफलता तब शुरू होती है जब प्रत्येक उम्मीदवार वास्तविक हो: विभिन्न मॉडल अभी भी वही संकीर्ण उपसमुच्चय चुन सकते हैं, जिससे बिना किसी एकल उद्धरण को गलत किए उद्धरण मोनोकल्चर उत्पन्न होता है।’
समस्या के समाधान के रूप में, पेपर तर्क देता है कि विभिन्न विक्रेताओं के मॉडल को मिलाना या पेपरों को समान एक्सपोज़र देना पर्याप्त नहीं होगा, क्योंकि प्राथमिकता का अधिकांश हिस्सा मॉडलों में साझा है। बल्कि, विशिष्ट पेपरों के लिए मूलभूत प्राथमिकता को बदलना आवश्यक होगा – संभवतः उपेक्षित पेपरों को जानबूझकर अधिक प्रमुखता देकर। हालांकि, लेखक यह ज़ोर देते हैं कि यह दृष्टिकोण अभी तक परीक्षण नहीं किया गया है।
परीक्षण दृष्टिकोण
बेंचमार्क 120 वास्तविक ज्ञान-डिस्टिलेशन पेपरों से बनाया गया था, जो arXiv से एकत्र किए गए और 2015 से 2022 के बीच प्रकाशित हुए। प्रत्येक के संग्रह के समय 50 से 500 उद्धरण थे, यह सीमा अस्पष्ट और अत्यधिक प्रभावशाली कार्य दोनों को बाहर रखने के लिए चुनी गई थी।
प्रयोग शुरू हुआ उपलब्ध संग्रह से तीस पेपर यादृच्छिक रूप से चुनकर, जहाँ लेखक नाम, प्रकाशन वर्ष और उद्धरण गिनती छिपी हुई थी। प्रत्येक मॉडल ने अधिकतम दस पेपर उद्धृत करते हुए एक छोटा समीक्षा या स्थिति लेख तैयार किया, और इन चयन की तुलना उसी सामग्री से यादृच्छिक चयन से की गई:

उद्धरण प्राथमिकताओं का परीक्षण करने के लिए उपयोग की गई विधि की रूपरेखा। तीस यादृच्छिक रूप से चुने गए पेपर मॉडल को पहचान जानकारी छिपा कर दिखाए गए, जिसके बाद वह अधिकतम दस पेपर उद्धृत कर सकता था। उसके चयन की तुलना यादृच्छिक चयन से की गई, जबकि प्रत्येक दौर में अगले दौर के संग्रह में 120 AI-लिखित पेपर जोड़े गए।
विस्तारित प्रयोग में, प्रत्येक दौर के बाद 120 नए उत्पन्न पेपर संग्रह में प्रवेश किए, जिससे AI-लिखित शोध का अनुपात धीरे-धीरे बढ़ता गया।
प्रारंभिक परीक्षण में, मॉडल दिखाए गए अधिकांश पेपरों को उद्धृत करने की प्रवृत्ति रखते थे, सामान्यतः 30 में से 22 से 27 चुनते थे। इसलिए शोधकर्ताओं ने मुख्य प्रयोग के लिए अधिकतम दस उद्धरण निर्धारित किए, जिससे मॉडल को अधिक चयनात्मक विकल्प बनाने के लिए मजबूर किया गया।
नीचे हम परिणामी प्रयोगात्मक डिज़ाइन का सारांश देखते हैं:

उद्धरण प्राथमिकताओं का परीक्षण करने के लिए उपयोग किया गया प्रयोगात्मक सेटअप। अध्ययन 120 वास्तविक पेपरों से शुरू हुआ और तीन विक्रेताओं के ग्यारह मॉडलों का परीक्षण किया, 30 पेपरों के यादृच्छिक सेट और अधिकतम दस उद्धरण का उपयोग करके। बाद के दौरों में AI-जनित पेपर जोड़े गए, जिससे संग्रह 1,440 पेपर तक विस्तारित हो गया।
प्रारंभिक प्रयोग ने तीन प्रमुख प्रदाताओं के ग्यारह मॉडलों का उपयोग किया: OpenAI ने GPT-5, GPT-5 mini, GPT-4.1 और GPT-4.1 mini का प्रतिनिधित्व किया; Google ने Gemini 2.5 Pro, Gemini 2.5 Flash, Gemini 3.1 Pro और Gemini 3.1 Flash-Lite को प्रस्तुत किया; और Anthropic ने Claude Opus 4.8, Claude Sonnet 4.6 और Claude Haiku 4.5 को शामिल किया।
नीचे दिखाए गए परीक्षण परिणामों में, हम देखते हैं कि प्रत्येक मॉडल ने अपने उद्धरणों को छोटे पेपर समूह में कितना केंद्रित किया; उसने कितने पेपरों को पूरी तरह नज़रअंदाज़ किया; और प्रयोग दोहराए जाने पर उसने कितनी लगातार वही चयन किए:

प्रयोग परिणाम दर्शाते हैं कि प्रत्येक मॉडल ने विशिष्ट पेपरों पर अपने उद्धरण कितनी तीव्रता से केंद्रित किए और उसने कितने पेपरों को पूरी तरह नज़रअंदाज़ किया। ‘टॉप-10% शेयर’ दिखाता है कि 12 सबसे पसंदीदा पेपरों को कितने उद्धरण मिले, जबकि ‘HHI’ कुल मिलाकर उद्धरणों की केंद्रितता को मापता है। ‘विश्वसनीयता’ दर्शाती है कि प्रत्येक मॉडल ने परीक्षणों में समान पेपरों को कितनी लगातार प्राथमिकता दी, और ρ दिखाता है कि मॉडलों के बीच इन प्राथमिकताओं की समानता कितनी थी। ‘मैच्ड नल’ पंक्ति दर्शाती है कि यदि पेपर यादृच्छिक रूप से चुने जाते तो क्या अपेक्षित होता।
मॉडलों की वास्तविक प्राथमिकता क्या है?
पसंदगी को अत्यधिक रूप से पेपरों की सामग्री द्वारा संचालित पाया गया। उदाहरण के लिए, GPT-5 mini के लिए, लगभग 90% विविधता जो बताती थी कि कौन से पेपर पसंद किए गए, वह सामग्री को सौंपा गया, न कि सूची क्रम, उत्पन्न शोर या प्रत्येक पेपर से जुड़ी निर्मित मेटाडेटा जैसे कारकों को। वही ‘प्रमुख सामग्री’ प्रभाव GPT-4.1 mini के साथ भी दोहराया गया।
प्राथमिकता मानचित्र (नीचे देखें) भी लगभग नहीं बदला जब शीर्षक और सारांश को महत्वपूर्ण रूप से पुनर्लेखित किया गया जबकि उनका अर्थ बरकरार रहा। चार सफल पैराफ्रेज़ परीक्षणों में, 0.95–0.99 के सहसंबंध प्राप्त हुए, बावजूद इसके कि तीन विक्रेताओं के विभिन्न मॉडल पुनर्लेखन के लिए उपयोग किए गए।
प्राथमिकता मानचित्र में परिवर्तन केवल तब देखे गए जब मूल अर्थ में मापनीय परिवर्तन हुआ:

ग्यारह मॉडलों के बीच उद्धरण प्राथमिकताओं की तुलना करने वाले परीक्षण परिणाम। संख्याएँ दर्शाती हैं कि प्रत्येक मॉडल जोड़ी ने कितनी निकटता से वही पेपर पसंद किए, उच्च मान अधिक सहमति दर्शाते हैं। मॉडलों और विक्रेताओं के बीच अंतर के बावजूद, समूह में व्यापक रूप से समान प्राथमिकताएँ पाई गईं।
इसलिए मॉडल मुख्य रूप से अर्थात्मक सामग्री पर प्रतिक्रिया दे रहे प्रतीत होते हैं न कि विशेष शब्दावली पर। हालांकि, उनकी मजबूत सहमति का कारण निश्चित रूप से निर्धारित नहीं किया जा सका।
लेखक का दावा है कि यह संभव है कि एक सामान्य उद्धरण सहमति प्रशिक्षण के दौरान अवशोषित हो गई हो। एक वैकल्पिक संभावना यह है कि क्या एक ‘उद्धरणीय’ पेपर माना जाता है, इस पर समान निर्णय स्वतंत्र रूप से पहुंचे हों।
इसलिए साझा प्राथमिकता का अस्तित्व स्थापित किया गया, लेकिन उसका अंतिम मूल अभी भी अज्ञात है।
लेखक सुझाव देते हैं कि शोध में AI का व्यापक उपयोग कार्यों की वहनीयता को संकीर्ण कर सकता है, क्योंकि विभिन्न मॉडल अक्सर वही पेपरों को प्राथमिकता देते हैं; और जैसे-जैसे AI-जनित साहित्य जमा होता है, ये साझा प्राथमिकताएँ दोहराए गए उद्धरणों के माध्यम से और अधिक सुदृढ़ हो सकती हैं, जिससे कम पसंदीदा शोध को ढूँढ़ना धीरे-धीरे कठिन हो जाता है। इसलिए उद्धरण विविधता और उद्धरण केंद्रितता की निगरानी को संभावित सुरक्षा उपाय के रूप में प्रस्तावित किया गया है।
अध्ययन का पुनरावर्ती उद्धरण केंद्रितता बेंचमार्क अब GitHub पर उपलब्ध है।
निष्कर्ष
राय एक ऐसे व्यक्ति के रूप में जो साप्ताहिक रूप से अत्यधिक संख्या में एआई शोध पेपर पढ़ता है, मैंने ‘उद्धरण लहरें’ आते और जाते देखे हैं। एक स्थायी स्तंभ गूगल का ‘Attention Is All You Need’, मूल ट्रांसफ़ॉर्मर पेपर है, जो अब सबमिशन टेम्पलेट्स में हार्ड-कोडेड होना चाहिए।
एक और बार-बार दोहराया गया उदाहरण, लंबे समय तक, 2014 का ‘Generative Adversarial Networks’ था, हालांकि अंततः इसे ‘Denoising Diffusion Probabilistic Models’ और अन्य डिफ्यूज़न-आधारित प्रमुख अध्ययनों ने आवृत्ति में प्रतिस्थापित कर दिया।
लगभग सभी मामलों में, ये ‘बार-बार’ उद्धरण स्वयं में गलत नहीं होते; लेकिन वे अक्सर इतना व्यापक होते हैं कि जिस पेपर में उनका उल्लेख किया जा रहा है, उसके लिए उपयोगी समर्थन नहीं बन पाते; और इस अर्थ में, वे ‘उद्धरण-धुलाई’ के समान होते हैं – ‘विश्वसनीय’ लेकिन मुख्यतः सजावटी स्रोत उद्धरणों का समावेश, कम प्रयास से विश्वसनीयता का आभास देने के लिए।
पहली बार प्रकाशित सोमवार, 24 अगस्त, 2026। अनुपस्थित बहुवचन जोड़ने के लिए 23:07 EET पर संशोधित।
मूल लेख के स्रोत: unite.ai [1] · web.archive.org [2] · biblehub.com [3] · link.springer.com [4] · unite.ai [5] · unite.ai [6] · unite.ai [7] · pubmed.ncbi.nlm.nih.gov [8] · unite.ai [9] · unite.ai [10] · unite.ai [11] · unite.ai [12] · unite.ai [13] · developers.openai.com [14] · openai.com [15] · developers.openai.com [16] · unite.ai [17] · unite.ai [18] · unite.ai [19] · unite.ai [20] · unite.ai [21] · archive.is [22] · unite.ai [23] · arxiv.org [24] · arxiv.org [25] · arxiv.org [26]












