Anderson का एंगल

एआई बार-बार वही पेपर उद्धृत करता है – ठीक इंसानों की तरह

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें
AI-generated article image (GPT Image 2): an industrial humanoid robot sits with its feet raised, reading Popular Mechanics beside a turntable playing a record and a partially filled metal record rack. A cat sleeps on otherwise empty shelving behind it. A yellow-and-black border reads ‘AI FANTASY INSIDE’ and ‘REALITY OUTSIDE’.

ChatGPT और अन्य एआई लेखन उपकरण शायद चुपचाप विज्ञान को लोकप्रियता प्रतियोगिता में बदल रहे हैं, लगातार शोधकर्ताओं को वही पेपर की ओर ले जा रहे हैं जबकि नए और नवीन कार्यों को नज़रअंदाज़ कर रहे हैं जो वास्तव में क्षेत्र को आगे बढ़ा सकते हैं।

 

Monoculture, आवृत्ति और आँकड़ों के संदर्भ में, वह स्थिति है जहाँ वही सीमित स्रोत या संसाधन बार-बार दोहराए जाते हैं, जिससे नवीन आवाज़ें और ताज़ा दृष्टिकोण दब जाते हैं: रेडियो शेड्यूलिंग में सीमित गानों का सेट; हवाई अड्डे की रैक्स में लेखकों और पुस्तकों की वही श्रृंखला; और सुपरमार्केट में सीमित चयन:

Yes, we have these bananas, and only these bananas. Source - https://www.thaitissues.com/en/post/a-deep-dive-into-the-grand-naine-banana-the-king-of-the-global-banana-market-and-its-crossroads-f

हाँ, हमारे पास ये केले हैं – और केवल ये ही केले। पश्चिमी खाद्य श्रृंखलाओं में फल और सब्जियों की एकरूपता प्रत्येक मामले में सैकड़ों अन्य प्रजातियों की संभावनाओं को नज़रअंदाज़ करती है, क्योंकि विभिन्न उत्पादन और परिवहन श्रृंखलाएँ विविध प्रकार के फल या सब्जियों के लिए औद्योगीकरण के लिए बहुत महंगी होती हैं। स्रोत

यह नई वैज्ञानिक शोध में दिखाई देने वाले उद्धरणों में भी होता है, जहाँ शोधकर्ता, शायद आलस्य से, ‘विश्वसनीय’ स्रोतों के सेट को डिफ़ॉल्ट रूप से चुनते हैं, जो गति प्राप्त कर लेते हैं जब तक कि वे शोध की विभिन्न शाखाओं पर हावी न हो जाएँ।

इसे मैथ्यू प्रभाव कहा जाता है – एक समाजशास्त्रीय सिद्धांत जो यह सुझाव देता है कि स्थापित लोग हमेशा लाभान्वित होते हैं; इस लक्षण की तुलना मैथ्यू 13:12 में दिए गए वचन से की गई है, जिसमें कहा गया है ‘जो के पास है उसे और दिया जाएगा, और वह समृद्ध हो जाएगा। जो के पास नहीं है, उसकी भी वह चीज़ ले ली जाएगी जो उसके पास है।’

भीड़ में

AI-सहायता प्राप्त शोध की बड़ी आशाओं में से एक यह थी कि नई मशीन लर्निंग विधियाँ मैथ्यू प्रभाव—जिसे लोकप्रियता पक्षपात भी कहा जाता है—से बाहर निकल सकें और कम ज्ञात कार्यों को उद्धृत करना शुरू करें जो अधिक सटीक या लेख में प्रस्तुत बिंदु के अधिक उपयुक्त हो सकते हैं।

हालाँकि, AI प्रशिक्षण प्रक्रियाओं के डेटासेट को समझने के तरीके के आधार पर, इस आशावाद का कभी कोई ठोस कारण नहीं रहा; और यह बार-बार पाया गया है कि जब AI स्पष्ट रूप से उद्धरण नहीं बनाता – जो अब तक एक सतत समस्या रही है – तो वह वास्तव में मैथ्यू प्रभाव को जारी रखता है, जैसे मनुष्य करते हैं – हालांकि शायद वही कारण न हो।

प्रशिक्षण के दौरान, एक मॉडल प्रशिक्षण सेट में सबसे अधिक उद्धृत (या ‘सबसे बार-बार दोहराए गए’) पेपरों को उच्च रैंक देना सीखता है, क्योंकि प्रशिक्षण प्रक्रियाएँ सार्थक पैटर्न निकालने के लिए डिज़ाइन की गई हैं, और अपवर्जन (आउट्लायर) को ‘शोर’ या सांख्यिकीय विसंगति के रूप में घटाती हैं।

इस व्यवस्था के तहत, आइंस्टीन के सापेक्षता सिद्धांत का समकक्ष मशीन द्वारा कभी ध्यान नहीं पाएगा, जो एक बार प्रशिक्षित होने पर मानता है कि उसने पहले ही अपने सिद्धांत और संदर्भ खोज लिए हैं, और केवल RAG के माध्यम से या अन्य तरीकों से जो मॉडल की पहुँच को उसके प्रशिक्षित मैट्रिक्स से परे बढ़ाते हैं, नई प्रकाशनों तक पहुँचकर इस दृष्टिकोण को हल्के से समायोजित कर सकता है।

समस्या यह है कि यह नई कृतियों को उसी तरह मान्यता नहीं देगा जैसे वह ‘पुराने पसंदीदा’ जिन्हें वह पहले से जानता था, या बिल्कुल भी नहीं, क्योंकि उसके सांख्यिकीय पक्षपात अब काफी गहराई से स्थापित हो चुके हैं।

इस प्रकार AI वास्तव में मानव व्यवहार को देख कर नकल नहीं कर रहा है जब वह मैथ्यू प्रभाव को जारी रखता है – यह केवल यह गिन रहा है कि शोधकर्ता कितनी बार आलस्य से वही पुराने पेपर चुनते हैं, और उन पेपरों को समान रूप से उच्च रैंक देता है। इस संदर्भ में, उद्धरण दोहराव की समस्या AI शोध प्रकाशनों की निरंतर बढ़ती बवंडर से वास्तव में रोचक विज्ञान पेपर चुनने की चुनौती से जुड़ी है, क्योंकि सबसे मजबूत कार्य अक्सर सबसे कमजोर संकेत रखता है।

मोनो का निदान

इस मुद्दे को संयुक्त राज्य अमेरिका के एक रोचक नए पेपर में संबोधित किया गया है जिसका शीर्षक है “जब AI लिखता है, तो किसे उद्धृत किया जाता है? भाषा मॉडलों में उद्धरण मोनोकल्चर का प्रमाण”। यह नया कार्य – टेक्सास विश्वविद्यालय ऑस्टिन, स्टीवेंस इंस्टिट्यूट ऑफ़ टेक्नोलॉजी, वाशिंगटन यूनिवर्सिटी एट सेंट लुइस, राइस यूनिवर्सिटी और यूनिवर्सिटी ऑफ़ नोत्रे डेम के सहयोग से – मशीन लर्निंग में उद्धरण मोनोकल्चर की उपस्थिति को स्पष्ट रूप से सिद्ध करने का लक्ष्य रखता है, ताकि भविष्य में इसके चर को सीधे संबोधित किया जा सके, साथ ही समस्या को भी।

परीक्षणों में, लेखकों ने पाया कि OpenAI, Google और Anthropic के ग्यारह मॉडल लगातार वही छोटे समूह के पेपरों को प्राथमिकता देते रहे – यहाँ तक कि स्पष्ट लोकप्रियता संकेत हटाने के बाद भी।

इसे परीक्षण करने के लिए, 120 वास्तविक पेपरों से उद्धरण गिनती और प्रकाशन स्थल हटा दिए गए, जबकि लेखक के नाम बदल दिए गए, और प्रकाशन वर्ष यादृच्छिक रूप से पुनः असाइन किए गए। फिर प्रत्येक मॉडल को तीस पेपरों के यादृच्छिक सेट दिखाए गए, जिन्हें दस से अधिक उद्धरण नहीं करने की अनुमति थी।

संबंधित क्षेत्रों के आठ मानव विशेषज्ञों को वही अंधे पेपर दिए गए, लेकिन उन्होंने AI के समान पसंदीदा पेपरों पर एकमत नहीं किया, जिससे यह संकेत मिलता है कि पक्षपात AI मॉडलों तक सीमित था, न कि स्वयं पेपरों तक:

From the new paper, test results comparing citation choices by AI models and human experts. Across all eleven models, citations were concentrated on a smaller group of papers, while some papers were repeatedly passed over entirely. Human experts showed neither tendency. Source - https://arxiv.org/pdf/2608.19230

नए पेपर से, AI मॉडलों और मानव विशेषज्ञों द्वारा किए गए उद्धरण चयन की तुलना करने वाले परीक्षण परिणाम। सभी ग्यारह मॉडलों में, उद्धरण एक छोटे समूह के पेपरों पर केंद्रित थे, जबकि कुछ पेपर पूरी तरह से बार-बार नजरअंदाज़ किए गए। मानव विशेषज्ञों ने ऐसी कोई प्रवृत्ति नहीं दिखाई। स्रोत

यह वही पेपर लोकप्रिय बने रहे यहाँ तक कि जब मॉडलों को केवल संदर्भ चुनने को कहा गया, यह दर्शाता है कि समीक्षात्मक लेखन स्वयं पक्षपात का कारण नहीं था।

फिर प्रयोग को ग्यारह दौरों तक विस्तारित किया गया, प्रत्येक दौर के बाद 120 AI-लिखित पेपर जोड़े गए, यह परीक्षण करने के लिए कि जब ये साझा प्राथमिकताएँ AI-जनित शोध के बढ़ते पूल में काम करती हैं तो क्या होता है।

जैसे-जैसे अधिक AI-लिखित पेपर जोड़े गए, मॉडल अपने उद्धरणों को मूल मानव पेपरों की घटती संख्या पर अधिक केंद्रित करने लगे।

लेखक बताते हैं:

‘जैसे भाषा मॉडल प्रॉज़ लिखने से साहित्य-खोज एजेंटों को टूल कॉल के साथ चलाने की ओर बढ़ते हैं, निर्मित संदर्भ पकड़ने और सीमित करने में आसान होते जा रहे हैं।

‘कठिन विफलता तब शुरू होती है जब प्रत्येक उम्मीदवार वास्तविक हो: विभिन्न मॉडल अभी भी वही संकीर्ण उपसमुच्चय चुन सकते हैं, जिससे बिना किसी एकल उद्धरण को गलत किए उद्धरण मोनोकल्चर उत्पन्न होता है।’

समस्या के समाधान के रूप में, पेपर तर्क देता है कि विभिन्न विक्रेताओं के मॉडल को मिलाना या पेपरों को समान एक्सपोज़र देना पर्याप्त नहीं होगा, क्योंकि प्राथमिकता का अधिकांश हिस्सा मॉडलों में साझा है। बल्कि, विशिष्ट पेपरों के लिए मूलभूत प्राथमिकता को बदलना आवश्यक होगा – संभवतः उपेक्षित पेपरों को जानबूझकर अधिक प्रमुखता देकर। हालांकि, लेखक यह ज़ोर देते हैं कि यह दृष्टिकोण अभी तक परीक्षण नहीं किया गया है।

परीक्षण दृष्टिकोण

बेंचमार्क 120 वास्तविक ज्ञान-डिस्टिलेशन पेपरों से बनाया गया था, जो arXiv से एकत्र किए गए और 2015 से 2022 के बीच प्रकाशित हुए। प्रत्येक के संग्रह के समय 50 से 500 उद्धरण थे, यह सीमा अस्पष्ट और अत्यधिक प्रभावशाली कार्य दोनों को बाहर रखने के लिए चुनी गई थी।

प्रयोग शुरू हुआ उपलब्ध संग्रह से तीस पेपर यादृच्छिक रूप से चुनकर, जहाँ लेखक नाम, प्रकाशन वर्ष और उद्धरण गिनती छिपी हुई थी। प्रत्येक मॉडल ने अधिकतम दस पेपर उद्धृत करते हुए एक छोटा समीक्षा या स्थिति लेख तैयार किया, और इन चयन की तुलना उसी सामग्री से यादृच्छिक चयन से की गई:

Method used to test citation preferences. Thirty randomly selected papers were shown to a model with identifying information hidden, after which it could cite up to ten. Its choices were compared with random selection, while each round added 120 AI-written papers to the next round's collection.

उद्धरण प्राथमिकताओं का परीक्षण करने के लिए उपयोग की गई विधि की रूपरेखा। तीस यादृच्छिक रूप से चुने गए पेपर मॉडल को पहचान जानकारी छिपा कर दिखाए गए, जिसके बाद वह अधिकतम दस पेपर उद्धृत कर सकता था। उसके चयन की तुलना यादृच्छिक चयन से की गई, जबकि प्रत्येक दौर में अगले दौर के संग्रह में 120 AI-लिखित पेपर जोड़े गए।

विस्तारित प्रयोग में, प्रत्येक दौर के बाद 120 नए उत्पन्न पेपर संग्रह में प्रवेश किए, जिससे AI-लिखित शोध का अनुपात धीरे-धीरे बढ़ता गया।

प्रारंभिक परीक्षण में, मॉडल दिखाए गए अधिकांश पेपरों को उद्धृत करने की प्रवृत्ति रखते थे, सामान्यतः 30 में से 22 से 27 चुनते थे। इसलिए शोधकर्ताओं ने मुख्य प्रयोग के लिए अधिकतम दस उद्धरण निर्धारित किए, जिससे मॉडल को अधिक चयनात्मक विकल्प बनाने के लिए मजबूर किया गया।

नीचे हम परिणामी प्रयोगात्मक डिज़ाइन का सारांश देखते हैं:

Experimental setup used to test citation preferences. The study began with 120 real papers and tested eleven models from three vendors, using randomized sets of 30 papers and a maximum of ten citations. Later rounds added AI-generated papers, expanding the collection to 1,440 papers.

उद्धरण प्राथमिकताओं का परीक्षण करने के लिए उपयोग किया गया प्रयोगात्मक सेटअप। अध्ययन 120 वास्तविक पेपरों से शुरू हुआ और तीन विक्रेताओं के ग्यारह मॉडलों का परीक्षण किया, 30 पेपरों के यादृच्छिक सेट और अधिकतम दस उद्धरण का उपयोग करके। बाद के दौरों में AI-जनित पेपर जोड़े गए, जिससे संग्रह 1,440 पेपर तक विस्तारित हो गया।

प्रारंभिक प्रयोग ने तीन प्रमुख प्रदाताओं के ग्यारह मॉडलों का उपयोग किया: OpenAI ने GPT-5, GPT-5 mini, GPT-4.1 और GPT-4.1 mini का प्रतिनिधित्व किया; Google ने Gemini 2.5 Pro, Gemini 2.5 Flash, Gemini 3.1 Pro और Gemini 3.1 Flash-Lite को प्रस्तुत किया; और Anthropic ने Claude Opus 4.8, Claude Sonnet 4.6 और Claude Haiku 4.5 को शामिल किया।

नीचे दिखाए गए परीक्षण परिणामों में, हम देखते हैं कि प्रत्येक मॉडल ने अपने उद्धरणों को छोटे पेपर समूह में कितना केंद्रित किया; उसने कितने पेपरों को पूरी तरह नज़रअंदाज़ किया; और प्रयोग दोहराए जाने पर उसने कितनी लगातार वही चयन किए:

Test results showing how strongly each model concentrated its citations on particular papers and how many papers it ignored entirely. 'Top-10% share' shows how many citations went to the 12 most-favored papers, while 'HHI' measures how concentrated citations were overall. 'Reliability' shows how consistently each model favored the same papers across tests, and ρ shows how similar those preferences were across models. The 'Matched null' row indicates what would be expected if papers were chosen at random.

प्रयोग परिणाम दर्शाते हैं कि प्रत्येक मॉडल ने विशिष्ट पेपरों पर अपने उद्धरण कितनी तीव्रता से केंद्रित किए और उसने कितने पेपरों को पूरी तरह नज़रअंदाज़ किया। ‘टॉप-10% शेयर’ दिखाता है कि 12 सबसे पसंदीदा पेपरों को कितने उद्धरण मिले, जबकि ‘HHI’ कुल मिलाकर उद्धरणों की केंद्रितता को मापता है। ‘विश्वसनीयता’ दर्शाती है कि प्रत्येक मॉडल ने परीक्षणों में समान पेपरों को कितनी लगातार प्राथमिकता दी, और ρ दिखाता है कि मॉडलों के बीच इन प्राथमिकताओं की समानता कितनी थी। ‘मैच्ड नल’ पंक्ति दर्शाती है कि यदि पेपर यादृच्छिक रूप से चुने जाते तो क्या अपेक्षित होता।

मॉडलों की वास्तविक प्राथमिकता क्या है?

पसंदगी को अत्यधिक रूप से पेपरों की सामग्री द्वारा संचालित पाया गया। उदाहरण के लिए, GPT-5 mini के लिए, लगभग 90% विविधता जो बताती थी कि कौन से पेपर पसंद किए गए, वह सामग्री को सौंपा गया, न कि सूची क्रम, उत्पन्न शोर या प्रत्येक पेपर से जुड़ी निर्मित मेटाडेटा जैसे कारकों को। वही ‘प्रमुख सामग्री’ प्रभाव GPT-4.1 mini के साथ भी दोहराया गया।

प्राथमिकता मानचित्र (नीचे देखें) भी लगभग नहीं बदला जब शीर्षक और सारांश को महत्वपूर्ण रूप से पुनर्लेखित किया गया जबकि उनका अर्थ बरकरार रहा। चार सफल पैराफ्रेज़ परीक्षणों में, 0.95–0.99 के सहसंबंध प्राप्त हुए, बावजूद इसके कि तीन विक्रेताओं के विभिन्न मॉडल पुनर्लेखन के लिए उपयोग किए गए।

प्राथमिकता मानचित्र में परिवर्तन केवल तब देखे गए जब मूल अर्थ में मापनीय परिवर्तन हुआ:

Test results comparing citation preferences across the eleven models. The numbers show how closely each pair of models favored the same papers, with higher values indicating greater agreement. Despite differences between models and vendors, broadly similar preferences were found across the group

ग्यारह मॉडलों के बीच उद्धरण प्राथमिकताओं की तुलना करने वाले परीक्षण परिणाम। संख्याएँ दर्शाती हैं कि प्रत्येक मॉडल जोड़ी ने कितनी निकटता से वही पेपर पसंद किए, उच्च मान अधिक सहमति दर्शाते हैं। मॉडलों और विक्रेताओं के बीच अंतर के बावजूद, समूह में व्यापक रूप से समान प्राथमिकताएँ पाई गईं।

इसलिए मॉडल मुख्य रूप से अर्थात्मक सामग्री पर प्रतिक्रिया दे रहे प्रतीत होते हैं न कि विशेष शब्दावली पर। हालांकि, उनकी मजबूत सहमति का कारण निश्चित रूप से निर्धारित नहीं किया जा सका।

लेखक का दावा है कि यह संभव है कि एक सामान्य उद्धरण सहमति प्रशिक्षण के दौरान अवशोषित हो गई हो। एक वैकल्पिक संभावना यह है कि क्या एक ‘उद्धरणीय’ पेपर माना जाता है, इस पर समान निर्णय स्वतंत्र रूप से पहुंचे हों।

इसलिए साझा प्राथमिकता का अस्तित्व स्थापित किया गया, लेकिन उसका अंतिम मूल अभी भी अज्ञात है।

लेखक सुझाव देते हैं कि शोध में AI का व्यापक उपयोग कार्यों की वहनीयता को संकीर्ण कर सकता है, क्योंकि विभिन्न मॉडल अक्सर वही पेपरों को प्राथमिकता देते हैं; और जैसे-जैसे AI-जनित साहित्य जमा होता है, ये साझा प्राथमिकताएँ दोहराए गए उद्धरणों के माध्यम से और अधिक सुदृढ़ हो सकती हैं, जिससे कम पसंदीदा शोध को ढूँढ़ना धीरे-धीरे कठिन हो जाता है। इसलिए उद्धरण विविधता और उद्धरण केंद्रितता की निगरानी को संभावित सुरक्षा उपाय के रूप में प्रस्तावित किया गया है।

अध्ययन का पुनरावर्ती उद्धरण केंद्रितता बेंचमार्क अब GitHub पर उपलब्ध है।

निष्कर्ष

राय एक ऐसे व्यक्ति के रूप में जो साप्ताहिक रूप से अत्यधिक संख्या में एआई शोध पेपर पढ़ता है, मैंने ‘उद्धरण लहरें’ आते और जाते देखे हैं। एक स्थायी स्तंभ गूगल का ‘Attention Is All You Need’, मूल ट्रांसफ़ॉर्मर पेपर है, जो अब सबमिशन टेम्पलेट्स में हार्ड-कोडेड होना चाहिए।

एक और बार-बार दोहराया गया उदाहरण, लंबे समय तक, 2014 का ‘Generative Adversarial Networks’ था, हालांकि अंततः इसे ‘Denoising Diffusion Probabilistic Models’ और अन्य डिफ्यूज़न-आधारित प्रमुख अध्ययनों ने आवृत्ति में प्रतिस्थापित कर दिया।

लगभग सभी मामलों में, ये ‘बार-बार’ उद्धरण स्वयं में गलत नहीं होते; लेकिन वे अक्सर इतना व्यापक होते हैं कि जिस पेपर में उनका उल्लेख किया जा रहा है, उसके लिए उपयोगी समर्थन नहीं बन पाते; और इस अर्थ में, वे ‘उद्धरण-धुलाई’ के समान होते हैं – ‘विश्वसनीय’ लेकिन मुख्यतः सजावटी स्रोत उद्धरणों का समावेश, कम प्रयास से विश्वसनीयता का आभास देने के लिए।

 

पहली बार प्रकाशित सोमवार, 24 अगस्त, 2026। अनुपस्थित बहुवचन जोड़ने के लिए 23:07 EET पर संशोधित।

मूल लेख के स्रोत: unite.ai [1] · web.archive.org [2] · biblehub.com [3] · link.springer.com [4] · unite.ai [5] · unite.ai [6] · unite.ai [7] · pubmed.ncbi.nlm.nih.gov [8] · unite.ai [9] · unite.ai [10] · unite.ai [11] · unite.ai [12] · unite.ai [13] · developers.openai.com [14] · openai.com [15] · developers.openai.com [16] · unite.ai [17] · unite.ai [18] · unite.ai [19] · unite.ai [20] · unite.ai [21] · archive.is [22] · unite.ai [23] · arxiv.org [24] · arxiv.org [25] · arxiv.org [26]

मशीन लर्निंग पर लेखक, मानव छवि संश्लेषण में डोमेन विशेषज्ञ। Metaphysic.ai में शोध सामग्री के पूर्व प्रमुख, जब तक यह DNEG की Brahma.ai में विलीन नहीं हो गया।
वेबसाइट: martinanderson.ai
संपर्क: martin@martinanderson.ai