Anderson का एंगल
विज्ञान पत्रों में AI स्लॉप से लड़ना

AI बड़े पैमाने पर सब कुछ करता है, DOS-आक्रमण-स्तर वेब स्क्रैपिंग से लेकर वैज्ञानिक अनुसंधान प्रस्तुतियों की ऐसी विशाल मात्रा उत्पन्न करने या सक्षम करने तक, जिससे परिणाम दोनों ही एक लॉजिस्टिक संकट और एक गुणवत्ता का संकट बन रहा है, क्योंकि सिग्नल‑टू‑नॉइज़ अनुपात लगातार नेविगेट करने योग्य नहीं हो रहा है।
पिछले सप्ताह, प्रीप्रिंट सर्वर arXiv ने घोषणा की कि वह सबमिट करने वालों के लिए एक नई दर‑सीमा नीति लागू करेगा, जिससे अब प्रत्येक को प्रति माह दो सबमिशन की सीमा होगी। यह उपाय, जैसा कि घोषणा में बताया गया है, एक छोटे समयावधि में सबमिशन दरों में चौंकाने वाली वृद्धि के सामने लिया गया है:

जनवरी 2024 से सितंबर 2026 तक arXiv की cs.AI श्रेणी में मासिक सबमिशन, जो अवधि के दौरान छह गुना से अधिक वृद्धि दर्शाते हैं. स्रोत
कट बॉबोरिस की ब्लॉग पोस्ट, जिसने पिछले गुरुवार Hacker News पर टिप्पणी आकर्षित की, ने बताया कि arXiv ने सितंबर 2026 में 40,363 सबमिशन प्राप्त किए – जो सितंबर 2024 में प्राप्त 20,569 से लगभग दोगुना है, और सितंबर 2016 में प्राप्त 9,869 से चार गुना से अधिक है।
बॉबोरिस ने देखा कि नवीनतम महीने के सबमिशन ने arXiv स्टाफ और मॉडरेटरों के लिए लगभग 9,000 समर्थन टिकट भी उत्पन्न किए:
‘हमारे मॉडरेटर संकीर्ण दायरे के पतले पेपरों में वृद्धि देख रहे हैं, साथ ही ‘सालामी’ पेपर, जहाँ एकल कार्य को तोड़कर छोटे पेपरों के सेट के रूप में सबमिट किया जाता है।’
‘घनी, AI-लिखित पेपरों में भी उल्लेखनीय वृद्धि देखी जा रही है। AI टूल्स लेखकों के लिए arXiv और अन्य रिपॉज़िटरीज़ को इन कम मूल्य वाले पेपरों से भरना आसान बना रहे हैं।’
इस वर्ष मई में, arXiv ने अनियंत्रित AI सामग्री के लिए एक वर्ष का प्रतिबंध लागू करने का कदम उठाया था; और पिछले वर्ष अक्टूबर में, सर्वे पेपर और पोजिशन पेपर (जो दोनों पूर्ण शैक्षणिक अध्ययन की तुलना में कम प्रयास से उत्पन्न किए जा सकते हैं) के सबमिट करने वालों को बताया था कि उन्हें arXiv पर प्रकाशित होने के लिए सहकर्मी समर्थन की आवश्यकता होगी।
अभी के लिए, arXiv डोमेन की अक्सर बाधक http अनुरोध सीमांकन बहुत स्पष्ट नहीं है, और केवल आशा की जा सकती है कि उसके अत्यंत उपयोगी RSS फ़ीड्स इस निरंतर कटौती से बचें। पिछले सप्ताह Reddit ने घोषणा की कि उसके RSS फ़ीड्स का दीर्घकालिक रूप से पूर्ण निराकरण किया जाएगा, जो अगले महीने के मध्य से लागू होगा। हालांकि, arXiv की गैर‑लाभकारी स्थिति का अर्थ है कि पाठकों को अनिवार्य साइट विज़िट या अनिवार्य लॉगिन में ले जाकर समान पूँजी प्राप्त करने की संभावना कम है – कम से कम अभी के लिए।
बढ़ते प्रवाह के खिलाफ
विज्ञान अनुसंधान में AI उपयोग के नकारात्मक प्रभाव के चारों ओर ऐसे गंभीर और बढ़ते समस्याओं के सामने – विशेष रूप से AI‑संबंधित अनुसंधान के बारे में, जिसने सभी अन्य श्रेणियों को पछाड़ दिया है, और अज्ञातता से उठकर एक राजनीतिक और आर्थिक संकेतक बन गया है, हाल ही में – एक अनुसंधान धारा उभरी है जो AI‑संबंधित पेपर सबमिशन की गुणवत्ता में गिरावट को रोकने के तरीकों की जांच करती है।
समस्या को संबोधित करने वाला नवीनतम प्रयास कोरिया के सियोल राष्ट्रीय विश्वविद्यालय और संयुक्त राज्य अमेरिका के यूनिवर्सिटी ऑफ मिनेसोटा के बीच सहयोग के रूप में आया है। पेपर, जिसका शीर्षक Science or Slop?: Benchmarking and Mitigating Scientific Slop in AI-Generated Papers है, पेपर के दावे, साक्ष्य, उद्धरण और संरचना के बीच कनेक्शनों में विफलताओं के माध्यम से ‘वैज्ञानिक स्लॉप’ को मापने का प्रस्ताव रखता है:

नए पेपर से, ‘वैज्ञानिक स्लॉप’ के प्रति कार्य की दृष्टिकोण का एक अवलोकन, जो दिखाता है कि संरचना, तर्क और सहायक कलाकृतियों में विफलताएँ कैसे उन कमजोरियों को उजागर कर सकती हैं जिन्हें पारंपरिक AI‑टेक्स्ट डिटेक्टर्स चूक जाते हैं। स्रोत
पिछली विधियों के विपरीत, नया सिस्टम स्वयं पाठ से परे देखता है ताकि यह आकलन किया जा सके कि पेपर के दावे उसके तर्क, साक्ष्य और उद्धरणों द्वारा सही ढंग से समर्थित हैं या नहीं। लेखकों का कहना है*:
‘एक पेपर का प्रत्येक भाग अलग‑अलग देखा जाए तो विश्वसनीय लग सकता है, इसलिए ऐसी टूटनें टोकन‑स्तर के डिटेक्टर्स के लिए अदृश्य रहती हैं और केवल पूरे पेपर के स्तर पर ही पहचानी या सुधारी जा सकती हैं। वैज्ञानिक स्लॉप को बेंचमार्क और कम करने के लिए, यह पेपर तीन चुनौतियों को संबोधित करता है।’
‘पहला, टोकन‑स्तर के मेट्रिक्स यह पकड़ने में विफल होते हैं कि वैज्ञानिक तर्क पेपर के पार कैसे जुड़ता है. सेक्शन, दावे, उद्धरण, साक्ष्य, और कलाकृतियाँ प्रत्येक विश्वसनीय लग सकती हैं जबकि उनके बीच के संबंध टूटते हैं। हम इस प्रकार की विफलताओं को अंत‑से‑अंत AI‑जनित पेपरों में बार‑बार देखते हैं, और ICLR समीक्षक इन्हें मानव‑लिखित प्रस्तुतियों में भी दंडित करते हैं।
‘दूसरा, इन पैटर्नों का पता लगाना अभी तक मापा नहीं गया है. मौजूदा टेस्ट सेट केवल पाठ को लेबल करते हैं, इसलिए यह पता लगाना कि डिटेक्टर्स, जिसमें पूरे पेपर को पढ़ने वाले LLM भी शामिल हैं, इन पैटर्नों को कितनी हद तक पहचानते हैं, कभी मापा नहीं गया।
‘तीसरा, इन पैटर्नों को विश्वसनीय रूप से कम करना कठिन है. जहाँ टोकन-स्तरीय संकेत पैराफ्रेज़िंग द्वारा हटाए जा सकते हैं, इन पैटर्नों की मरम्मत के लिए मूल विज्ञान को बदले बिना गायब संबंधों को पुनर्स्थापित करना आवश्यक है।’
लेखकों के नए बेंचमार्क, जिसका नाम SciSlopBench रखा गया है, को SciSlopHarness में सम्मिलित किया गया है, जो एक फ्रेमवर्क है जो पेपर के वैज्ञानिक तर्क में विफलताओं का पता लगाने और सुधारने के लिए बनाया गया है, जबकि मूल वैज्ञानिक साक्ष्य को संरक्षित रखता है:

उदाहरण जो SciSlopHarness द्वारा किए गए संशोधित अंशों की तुलना में त्रुटिपूर्ण अंशों को दर्शाते हैं। असमर्थित जोड़ को अस्वीकार किया जाता है, जबकि दावों को आवश्यकतानुसार पुनः क्रमित या पुनः लिखा जाता है ताकि पेपर में उपलब्ध साक्ष्य को बेहतर रूप से प्रतिबिंबित किया जा सके।
SciSlopBench बेंचमार्क स्वयं 390 AI-जनित पेपरों से निर्मित किया गया था, प्रत्येक को समान शोध समस्या और योगदान प्रकार वाले मानव-लिखित पेपर के साथ जोड़ा गया।
परीक्षणों में, SciSlopBench का उपयोग 390 पेपर जोड़ों के बीच अंतर करने के लिए किया गया, जहाँ प्रत्येक जोड़े में उपर्युक्त AI-जनित पेपर और समान शोध समस्या एवं योगदान प्रकार के लिए मिलाए गए मानव-लिखित पेपर शामिल थे। बेंचमार्क ने इन तुलना में 85.9% मामलों में AI-जनित पेपर को सही रूप से पहचाना, जो पारंपरिक AI-टेक्स्ट डिटेक्टर्स से काफी बेहतर था।
लेखकों का कहना है:
‘जबकि मानक संशोधन शेष स्लॉप छोड़ते हैं और सीधे स्लॉप-आधारित प्रॉम्प्टिंग रिवॉर्ड हैकिंग को ट्रिगर करता है, SciSlopHarness सबसे मजबूत संशोधन बेसलाइन की तुलना में शेष AI–मानव अंतर को 63% तक कम करता है, बिना मानव संदर्भ लक्ष्य की आवश्यकता के।
‘समग्र रूप से, हम दर्शाते हैं कि AI-जनित वैज्ञानिक पेपर अपने वैश्विक तर्क में मूलभूत निशान छोड़ते हैं, और जिम्मेदार शमन के लिए केवल प्रॉज़ सुधार के बजाय सख्त साक्ष्य-आधारित आधार की आवश्यकता होती है।’
पेपर द्वारा किए गए योगदानों के अतिरिक्त, लेखकों ने अपने नए कार्य के सिद्धांतों को लाइव डेमो के रूप में लागू किया है जहाँ उपयोगकर्ता वैज्ञानिक पेपर जमा करके उनमें मौजूद AI स्लॉप की मात्रा का विश्लेषण कर सकते हैं।
रोचक बात यह है कि नया पेपर, डेमो द्वारा विश्लेषित, एक ‘मध्यम’ स्लॉप स्कोर 40/100† पर आता है:

नया पेपर, अपने स्वयं के एल्गोरिदम द्वारा विश्लेषित, ‘स्लॉप’ क्षेत्रों को चिह्नित करता है जिन्हें लेखकों की नई प्रक्रिया ने पहचाना। स्रोत
विधि और डेटा दृष्टिकोण
2025 सहयोग Why Slop Matters ने ‘सतही दक्षता’ को AI स्लॉप की एक परिभाषित विशेषता के रूप में वर्णित किया, जहाँ दिखी हुई गुणवत्ता वास्तविक सामग्री की कमी को छुपाती है। नया कार्य इस विचार को अधिक विशिष्ट रूप से वैज्ञानिक पेपरों पर लागू करता है, ‘वैज्ञानिक स्लॉप’ को उन विफलताओं के रूप में परिभाषित करता है जो यह समझना कठिन बनाती हैं कि अध्ययन कैसे व्यवस्थित है; उसके दावे कैसे समर्थित हैं; और उसकी विधियों और साक्ष्य की जांच कैसे की जा सकती है, जिसमें विफलताओं को संरचना; तर्क; और कलाकृतियों में समूहित किया गया है:

बेंचमार्क में उपयोग किए गए छह प्रकार के वैज्ञानिक स्लॉप के मापन नियम। तालिका दर्शाती है कि प्रत्येक माप के लिए क्या जांचा जाता है, स्कोर कैसे गणना किया जाता है, और अधिकतम स्कोर 1 क्या दर्शाता है, जहाँ उच्च स्कोर अधिक व्यापक विफलताओं को संकेत करता है।
पेपर में परिभाषित वैज्ञानिक स्लॉप के छह माप हैं क्रॉस-सेक्शन रेफ़रेंसेज़ (क्या सेक्शन पेपर के अन्य भागों को सार्थक रूप से संदर्भित करते हैं); मैक्रो अतिरिक्तता (क्या बाद के सेक्शन पहले के सामग्री को दोहराते हैं); तर्क ग्राफ (क्या दावे पूर्व तर्क द्वारा उचित रूप से समर्थित हैं); साइटेशन अलगाव (क्या साइटेशन सतही रूप से उपयोग किए जाते हैं, बिना यह समझाए कि उद्धृत कार्य पेपर या एक-दूसरे से कैसे संबंधित हैं); चित्र व्याख्या (क्या विधि चित्र वास्तव में विधि को स्पष्ट करते हैं); और साक्ष्य अंतर (क्या रिपोर्ट किए गए परिणाम ठोस उदाहरणों द्वारा समर्थित हैं)।
बेंचमार्क को AI-जनित पेपरों को तुलनीय/समकक्ष मानव-लिखित पेपरों के साथ जोड़कर बनाया गया, जहाँ AI पेपर FARS और 2025 Agents4Science प्रतियोगिता से क्यूरेट किए गए थे।
प्रत्येक मशीन-जनित FARS पेपर के लिए, शोधकर्ताओं ने उसके उद्धरणों में उसी प्रकार के मानव‑लेखित पेपर की खोज की जो शीर्ष‑स्तरीय मंच पर स्वीकार किया गया हो, और फिर शोध विषय के आधार पर सबसे निकटतम मिलान चुना, जिससे 143 जोड़े बने। Agents4Science पेपरों को भी समान रूप से मानव‑लिखित समकक्षों के साथ जोड़ा गया, जिससे अतिरिक्त 247 जोड़े बने, और कुल मिलाकर बेंचमार्क 390 AI‑मानव जोड़ों तक पहुँच गया। ये पेपर जीवन विज्ञान, सामाजिक विज्ञान और प्राकृतिक विज्ञान को कवर करते हैं, हालांकि डेटासेट में कंप्यूटर विज्ञान का वजन अधिक है।
मेट्रिक्स के लिए, प्रदर्शन का मूल्यांकन PairAcc का उपयोग करके किया गया, जो मापता है कि मानव पेपर अपने AI समकक्ष से ऊपर कितनी बार रैंक किया जाता है; और AUROC, जो विभिन्न थ्रेशहोल्ड पर मानव और AI पेपरों के बीच कुल विभाजन को मापता है। लेखकों ने यह भी रिपोर्ट किया कि जब मानव पेपरों के लिए गलत‑सकारात्मक दर 5 % पर स्थिर रखी जाती है, तो पहचान प्रदर्शन कैसा होता है।
परीक्षण
प्रारंभिक परीक्षणों में SciSlop की तुलना AI‑टेक्स्ट डिटेक्टर्स Binoculars; DetectGPT; और NTS†† के साथ की गई, साथ ही स्वचालित समीक्षा प्रणालियों AI Scientist Reviewer और CycleReviewer के साथ।
बाद के संशोधन परीक्षणों के लिए चार बेसलाइन उपयोग किए गए: बेस प्रॉम्प्टिंग; Claude Code; समीक्षक‑आधारित परिष्करण; और स्लॉप‑सजग संशोधन. पहले तीन को केवल पेपर को सुधारने के सामान्य निर्देश मिले, जबकि स्लॉप‑सजग संशोधन को अतिरिक्त रूप से पहचाने गए स्लॉप की परिभाषाएँ और स्थान प्रदान किए गए। सभी की तुलना समान संशोधन परिस्थितियों में SciSlopHarness के साथ की गई।
कार्यान्वयन के लिए, टेक्स्ट डिटेक्टर्स को पेपर की प्रॉज़ प्राप्त हुई, जबकि अन्य विधियों को पेपर का स्रोत कोड और जहाँ आवश्यक हो, उसके कोड तक पहुँच दी गई। Binoculars ने Falcon-7B बेस और इंस्ट्रक्ट मॉडल का उपयोग किया; DetectGPT ने T5-3B का उपयोग करके 100 उत्परिवर्तन उत्पन्न किए; AI Scientist ने Qwen2.5-32B-Instruct का उपयोग किया; और CycleReviewer ने अपना जारी किया गया 8B चेकपॉइंट प्रयोग किया। Falcon की 2,048‑टोकन सीमा से अधिक पेपरों के लिए, गैर‑ओवरलैपिंग विंडो को अलग‑अलग स्कोर किया गया और उनका औसत निकाला गया।
प्रारंभिक पहचान परिणाम नीचे दो तालिकाओं में विस्तृत हैं: SciSlop ने 85.9 % PairAcc प्राप्त किया, जबकि Binoculars के लिए 68.7 % और सबसे मजबूत स्वचालित समीक्षक के लिए 68.5 % था, जिससे त्रुटि दर आधे से अधिक घट गई:

SciSlop की AI‑टेक्स्ट डिटेक्टर्स और स्वचालित समीक्षकों के साथ तुलना करने वाले पहचान परिणाम, साथ ही इसके छह व्यक्तिगत स्लॉप मापों के परिणाम। SciSlop कुल मिलाकर सबसे उच्च PairAcc प्राप्त करता है, जबकि क्रॉस‑सेक्शन रेफ़रेंसेज़ सबसे मजबूत व्यक्तिगत परिणाम प्रदान करती हैं।
क्रॉस‑सेक्शन रेफ़रेंसेज़ ने स्वयं में विशेष रूप से मजबूत प्रदर्शन किया, 90.5 % PairAcc तक पहुँचते हुए मॉडल की आवश्यकता नहीं रही, और 5 % गलत‑सकारात्मक दर पर AI‑जनित पेपरों में से 65 % की पहचान की, जबकि Binoculars के लिए यह 24 % था।
लेखक तर्क देते हैं कि ये परिणाम दर्शाते हैं कि पेपर के भीतर संबंध पारंपरिक टेक्स्ट‑स्तर की पहचान की तुलना में AI जनरेशन का अधिक मजबूत संकेत देते हैं, साथ ही विशिष्ट कमजोरियों की पहचान करते हैं जिन्हें बाद में संशोधन के लिए लक्षित किया जा सकता है।
अगले चरण में वैज्ञानिक स्लॉप और पेपर गुणवत्ता के मानव मूल्यांकन के बीच संबंध की जांच की गई। नीचे पहले कॉलम में दिखाए अनुसार, अधिक स्लॉप का संबंध कुल रेटिंग, साउंडनेस, प्रस्तुति और योगदान के लिए कम ICLR स्कोर से था:

SciSlop की AI‑टेक्स्ट डिटेक्टर्स और स्वचालित समीक्षकों के साथ ICLR समीक्षा परिणामों के विरुद्ध तुलना। बायाँ पैनल AI‑समानता को समीक्षा स्कोर के साथ दिखाता है; मध्य पैनल व्यक्तिगत समीक्षा आयामों की तुलना करता है; दायाँ पैनल नौ वर्षों में अस्वीकृत और स्वीकृत पेपरों को अलग करने के प्रदर्शन को दर्शाता है।
अस्वीकृत और स्वीकृत पेपरों को भी सभी नौ वर्षों में संयोग से अधिक अंतर किया गया, जबकि पारंपरिक डिटेक्टर्स अधिकांश तुलना में संयोग से नीचे रहे।
इसलिए वैज्ञानिक स्लॉप को उन कमजोरियों के प्रतिबिंब के रूप में पाया गया जिन्हें पहले ही मानव समीक्षकों द्वारा दंडित किया गया है, न कि केवल AI लेखन का संकेत।
अंतिम परीक्षणों ने जांचा कि क्या SciSlopHarness अधिक सामान्य संशोधन के बाद बची हुई स्लॉप को हटा सकता है। नीचे दिखाए अनुसार, हार्नेस ने सभी छह मापों में मानव औसत के सबसे निकट समाप्ति प्राप्त की, जबकि सामान्य संशोधन अक्सर पर्याप्त स्लॉप छोड़ देता है और सीधे स्लॉप‑सजग संशोधन कभी‑कभी अधिक सुधार करता है:

SciSlopHarness की चार बेसलाइन विधियों के साथ छह स्लॉप मापों में तुलना करने वाले संशोधन परिणाम। शून्य के करीब मान मानव‑पेपर औसत के करीब होते हैं, जहाँ SciSlopHarness आमतौर पर इस स्तर की ओर बढ़ता है जबकि स्लॉप‑सजग संशोधन अक्सर इसे पार कर जाता है।
प्रस्तावित प्रत्येक परिवर्तन को पेपर के वैज्ञानिक तर्क और सहायक साक्ष्यों के विरुद्ध जाँच किया गया, और असमर्थित संपादनों को अस्वीकार कर दिया गया। छह मापों में, मानव‑लेखित पेपरों से शेष अंतर को Claude Code की तुलना में 63 % तक घटाया गया, जो सबसे मजबूत संशोधन बेसलाइन है।
निष्कर्ष
यह रोचक था, इस लेख को लिखते समय, न केवल यह देखना कि यह पेपर अपने स्वयं के डेमो साइट पर कितना खराब स्कोर करता है, बल्कि कम से कम एक उदाहरण देखना कि एक ‘आलसी’ या ‘सजावटी’ उद्धरण†† मौजूद है, जो हाल ही में शोध पत्रों में एक छोटा लेकिन बढ़ता हुआ अभिशाप बन गया है।
ऐसे मामलों में, इस विशेष पेपर से परे, शोधकर्ता मौजूदा साहित्य के साथ सार्थक रूप से जुड़ने के बजाय अपने स्वयं के ज्ञान पर निर्भर होते दिखते हैं। फिर भी, परंपरा द्वारा ‘अपना काम दिखाने’ की बाध्यता के कारण, उद्धरण अक्सर अधीरता, यहाँ तक कि प्रक्रिया के प्रति तिरस्कार के रूप में प्रस्तुत होते हैं, और अक्सर यह प्रतीत होता है कि पाठक को संदर्भों की अधिकता को पर्याप्त ‘प्रामाणिकता की परत’ के रूप में स्वीकार करना पड़ता है, हालांकि यह कठोर जांच का सामना नहीं कर पाएगा।
Arxiv AI‑प्रेरित सबमिशन के औद्योगीकरण के खिलाफ प्रतिरोध कर रहा है; क्या शोध में AI की प्रत्यक्ष भागीदारी पर समान प्रतिबंध लगाए जाएंगे, जब तक कि पर्याप्त पैमाने की कोई संबंधित आपदा न हो, यह अभी स्पष्ट नहीं है।
* लेखकों के जोर, मेरे नहीं – लेकिन जहाँ आवश्यक हो, मैंने लेखकों के इनलाइन उद्धरणों को हाइपरलिंक में बदल दिया है।
† लेखक अपने पेपर में शून्य AI उपयोग का दावा नहीं करते, और ऐसी उपयोग की विस्तृत जानकारी देते हैं।
†† पाठक को यह जानकर रुचि हो सकती है कि मुझे NTS फ्रेमवर्क के लिए सही लिंक स्वयं खोजना पड़ा, क्योंकि लेखकों द्वारा दिया गया लिंक प्रासंगिक नहीं था – यह SciSlop द्वारा उपयोग किए जाने वाले मेट्रिक्स में से एक है!
पहली बार प्रकाशित रविवार, 4 अक्टूबर, 2026












