Anderson का एंगल

एआई-जनरेटेड लेखन कभी ‘थकता’ नहीं है, और इस प्रकार यह अपने आप को प्रकट करता है

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें
AI-generated image, by Z-Image Turbo (V1) via Krita AI Diffusion. Prompt: 'An American, hot high-school exam room in Texas,, with all the students seated exhausted in the heat, at lines of desks, trying to concentrate on winning their exams. In the center of the picture we focus on an industrial humanoid robot who is filling out the exam papers so quickly that the A$ sheets are flying around its desk in a flurry of activity. Some of the nearby, sweating and exhausted young students are looking at the tireless robot with annoyance and/or jealousy.'

चैटजीपीटी शैली का एआई अपने आप को बढ़ती निरंतरता के माध्यम से प्रकट करता है, जबकि मानव लेखन पूरे समय असंगत रहता है।

 

बड़े भाषा मॉडल (एलएलएम) की सीमित संदर्भ विंडो एक कारक है जो उन्हें उपयोगकर्ताओं की बातचीत के पहले भागों को भूलने या गलत तरीके से याद रखने का कारण बन सकती है – याद रखने की त्रुटियाँ जो धीरे-धीरे आउटपुट को पूरी तरह से अर्थहीन बना सकती हैं – या बदतर, धोखाधड़ी से सुसंगत दिखने वाला पाठ जो छोटी त्रुटियों को छुपाता है।

चूंकि ये परिस्थितियाँ हॉलुसिनेशन की ओर ले जाती हैं, और चूंकि हॉलुसिनेशन अभी भी एआई की कुल बाजार उन्नति के लिए सबसे बड़ा अवरोध है, एआई प्रणालियों को बनाने में बहुत शोध प्रयास किया गया है जो लंबे लेकिन अधिक सुसंगत पाठ के हिस्से बना सकते हैं।

वास्तव में, इतनी प्रगति हो रही है कि लंबे-रूप एआई सामग्री (अर्थात, सामग्री जो शुद्ध रूप से एआई द्वारा उत्पन्न की जाती है, संभवतः न्यूनतम या शून्य मानव देखभाल के साथ) को पहचानने को एक बढ़ती समस्या माना जाता है।

एआई फिलिबस्टर को तोड़ना

फिर भी, हाल के अनुभवजन्य अध्ययन दावा करते हैं कि एआई पाठ जनरेटर द्वारा एक बार में उत्पादित आउटपुट जितना अधिक होगा, यह निर्धारित करना उतना ही आसान होगा कि क्या वह पाठ मानव-लिखित था या नहीं; लेकिन इस पता लगाने के ‘लंगर’ के संबंध में स्वीकृत ज्ञान यह माना गया है कि एआई को इसलिए पहचाना जा सकता है क्योंकि जो कुछ भी यह मानवों से अलग कर रहा है, उसे लंबे ट्रैक में अधिक बार करने का मौका मिलता है

पाठ में इन ‘संकेतों’ के वितरण के बारे में कोई धारणा नहीं बनाई गई है।

इसे चुनौती देने और समस्या का विस्तार करने के लिए, चीन से एक दिलचस्प हालिया शोध अध्ययन लंबे-रूप एआई सामग्री जनरेटर को वास्तविक मानव लेखकों से अलग करने के लिए एक नई विधि प्रदान करता है। इस काम के पीछे शोधकर्ता दावा करते हैं कि एआई पाठ को टोकन-पर-टोकन तरीके से उत्पन्न करने की प्रकृति का अर्थ है कि यह लंबाई के साथ अधिक सुसंगत हो जाता है, जबकि लोगों की अपनी विचित्रता लंबाई के साथ कम नहीं होती है।

इस तरह, लेखक सुझाव देते हैं कि उनका अंतर्दृष्टि एआई-पाठ का पता लगाने वाली प्रणालियों के लिए एक संभावित नई मीट्रिक प्रदान करता है*:

‘एआई-उत्पन्न टोकन पाठ के बाद के भाग में छोटे और अधिक स्थिर संभावना उतार-चढ़ाव प्रदर्शित करते हैं क्योंकि मॉडल की भविष्यवाणियाँ संदर्भ के संचय के साथ बढ़ती हुई सुसंगत होती जाती हैं।

‘हम इस पैटर्न को लेट-स्टेज वोलेटिलिटी डिके कहते हैं। यह घटना स्व-सरंक्षक पीढ़ी के अंतर्निहित व्यवहार को दर्शाती है: जैसे ही अधिक संदर्भ उपलब्ध होता है, मॉडल का पूर्वानुमान वितरण तेज होता है, जिससे टोकन-स्तर के आंकड़ों में परिवर्तनशीलता कम हो जाती है।

‘मानव लेखन, इसके विपरीत, अप्रत्याशित शब्दिक विकल्पों को पेश करना जारी रखता है और पूरे समय उच्च अस्थिरता बनाए रखता है।’

एआई पाठ में जमा होने वाली इस अजीब ‘स्मूदनेस’ को पकड़ने के लिए, शोधकर्ता दो सरल विशेषताओं को परिभाषित करते हैं: पहला मापता है कि लेखन का सांख्यिकीय व्यवहार कितना ‘कूदता है’ टोकन के बीच; दूसरा जांचता है कि चीजें छोटे पाठ के हिस्सों में कितनी स्थिर रहती हैं।

दोनों की गणना केवल आउटपुट के दूसरे आधे हिस्से से की जाती है, जहां एआई अधिक नियमित हो जाता है और मानव लेखन नहीं होता है। लेखकों का उल्लेख है कि जबकि ये संकेत अपने आप में अच्छा काम करते हैं, वे पुराने पता लगाने वाले तरीकों के साथ भी अधिक प्रभावी हैं जो व्यापक पैटर्न के लिए स्कैन करते हैं। वे यह भी उल्लेख करते हैं कि यह दृष्टिकोण लंबे पाठ पर सबसे अच्छा प्रदर्शन करता है, जहां विपरीत अधिक स्पष्ट हो सकता है।

नई कागज़ एक एआई-नेस के परीक्षण के लिए एक विधि प्रदान करता है दूसरे आधे भाग के माध्यम से समय सुविधा विश्लेषण, किसी भी अतिरिक्त प्रशिक्षण या फ़ाइन-ट्यूनिंग, या विशेषाधिकार प्राप्त मॉडल पहुंच की आवश्यकता नहीं है।

नया काम जब एआई बस जाता है: लेट-स्टेज स्थिरता एआई-उत्पन्न पाठ का पता लगाने के लिए एक हस्ताक्षर के रूप में शीर्षक से है, और हांग्जो में वेस्टलेक विश्वविद्यालय के चार लेखकों से आता है।

विधि

एआई-उत्पन्न पाठ में बढ़ती स्मूदनेस को पकड़ने के लिए, शोधकर्ताओं ने दो मापों को डिज़ाइन किया जो केवल एक पारग्रह के दूसरे आधे हिस्से पर ध्यान केंद्रित करते हैं। वे लॉग-संभावना स्कोर पर निर्भर करते हैं एक मानक भाषा मॉडल से और किसी भी फ़ाइन-ट्यूनिंग, पुनः प्रशिक्षण, या अतिरिक्त नमूनों की आवश्यकता नहीं है:

नई कागज़ से - प्रत्येक पंक्ति EvoBench के माध्यम से टोकन अनुक्रम के व्यवहार को दिखाती है: कच्चा मान (बाएं), पूर्ण व्युत्पन्न (केंद्र), और स्थानीय मानक विचलन (दाएं)। मानव और एआई लाइनें नीले और लाल रंग में दिखाई देती हैं। अधिकांश विचलन पाठ के दूसरे भाग में, विशेष रूप से लॉग संभावना और नमूना विचलन के लिए दिखाई देता है, जो बढ़ती विभाजन और चिकनी एआई आउटपुट दिखाता है। एंट्रॉपी और टॉप-के सांद्रता समय के साथ बहुत कम परिवर्तन दिखाते हैं। स्रोत - https://arxiv.org/pdf/2601.04833

नई कागज़ से – प्रत्येक पंक्ति EvoBench के माध्यम से टोकन अनुक्रम के व्यवहार को दिखाती है: कच्चा मान (बाएं), पूर्ण व्युत्पन्न (केंद्र), और स्थानीय मानक विचलन (दाएं)। मानव और एआई लाइनें नीले और लाल रंग में दिखाई देती हैं। अधिकांश विचलन पाठ के दूसरे भाग में, विशेष रूप से लॉग संभावना और नमूना विचलन के लिए दिखाई देता है, जो बढ़ती विभाजन और चिकनी एआई आउटपुट दिखाता है। एंट्रॉपी और टॉप-के सांद्रता समय के साथ बहुत कम परिवर्तन दिखाते हैं। स्रोत – https://arxiv.org/pdf/2601.04833

पहला माप, जिसे व्युत्पन्न वितरण (डीडी) कहा जाता है, यह ट्रैक करता है कि मॉडल का विश्वास कितनी तेजी से एक शब्द से दूसरे शब्द में बदलता है। एआई पाठ में एक लय में बसने की प्रवृत्ति होती है, इसलिए ये परिवर्तन दूसरे आधे हिस्से में छोटे और अधिक अनुमानित हो जाते हैं। इसके विपरीत, मानव लेखन ‘असंगत’ रहता है।

दूसरा माप, स्थानीय अस्थिरता (एलवी), यह देखता है कि मॉडल का विश्वास कितना ‘कूदता है’ एक छोटे पाठ के हिस्से में। फिर से, एआई समय के साथ अधिक स्थिर हो जाता है, जबकि मानव विकल्प अधिक आश्चर्यजनक और कम सुसंगत रहते हैं:

<img class=" wp-image-249429" src="https://www.unite.ai/wp-content/uploads/2026/01/figure-1-2.jpg" alt="एआई पाठ चलते समय चिकना हो जाता है, जबकि मानव लेखन असंगत रहता है। ये ग्राफ पारग्रह के दौरान मॉडल के विश्वास के परिवर्तन को ट्रैक करते हैं, जो कि एक शब्द से दूसरे शब्द में परिवर्तन की तीव्रता और स्थानीय पाठ के हिस्सों में परिवर्तनशीलता को दर्शाता है। दोनों मामलों में, गिरावट मशीन-उत्पन्न आउटपुट में बहुत तेज है, जिसमें मिडपॉइंट के बाद एआई लेखन मानव लेखन की तुलना में 32% अधिक स्थिर है। पीले बक्से इस दूसरे आधे हिस्से में बढ़ती खाई को उजागर करते हैं, जहां एआई लेखन मानव लेखन की तुलना में 32% अधिक स्थिर है।

एक बार फिर, दोनों माप केवल आउटपुट के दूसरे आधे हिस्से से गणना की जाती है, जहां मानव और मशीन लेखन के बीच अंतर सबसे अधिक स्पष्ट है। इन्हें तब एक एकल मान में शामिल किया जाता है जिसे स्थानिक स्थिरता पता लगाने (टीएसडी) स्कोर कहा जाता है – जो पाठ के ‘स्मूदनेस’ के साथ बढ़ने की प्रवृत्ति रखता है (और इसलिए अधिक एआई-उत्पन्न होने की संभावना है)। एक सरल थ्रेशहोल्ड का उपयोग तब यह तय करने के लिए किया जाता है कि क्या एक दिए गए पारग्रह संभवतः एक मशीन द्वारा लिखा गया है।

क्योंकि ये सुविधाएँ जब एक पैटर्न उभरता है, इसके बजाय क्या देखती हैं, वे पुराने तरीकों द्वारा पूरक हैं जो पूरे पारग्रह में सांख्यिकीय विचित्रता की तलाश करते हैं। टीएसडी स्कोर को फास्ट-डिटेक्टजीपीटी के आउटपुट में जोड़ना (जो पश्चिमी झील विश्वविद्यालय के साथ संयुक्त रूप से भी है) लंबे-रूप सामग्री (विशेष रूप से जहां देर से स्मूदनेस प्रभाव सबसे मजबूत है) पर परिणामों में एक अतिरिक्त सुधार प्रदान करता है।

डेटा और परीक्षण

लेखकों ने दो संबंधित बेंचमार्क डेटासेट पर परीक्षण किए: EvoBench में 32,000 मानव/एआई पाठ जोड़े शामिल हैं जो सात मॉडल परिवारों में उत्पन्न किए गए हैं, जिनमें जीपीटी-4 शामिल हैं; जीपीटी-4ओ; क्लाउड; गूगल जेमिनी; एलएलएमए-3; और क्वेन, कुल 29 मॉडल संस्करणों के साथ।

दूसरा फ्रेमवर्क मेज था, जिसमें आठ मॉडल परिवारों में 30,000 परीक्षण जोड़े शामिल थे, जिनमें ओपनएआई की जीपीटी श्रृंखला और एलएलएमए, ओपीटी, और एफएलएन-टी5 परिवार शामिल थे।

प्रतिद्वंद्वी

नई विधि का परीक्षण शून्य-शॉट डिटेक्टरों की एक श्रृंखला के खिलाफ किया गया था जो एक ही सरोगेट मॉडल का उपयोग करते थे। संभावना, एंट्रॉपी, रैंक, और लॉग-रैंक (डिटेक्टजीपीटी) पूरे पारग्रह में टोकन-स्तर के आंकड़े मापते हैं; एलआरआर (डिटेक्टएलएम) मॉडल के पार सीधे तुलना की अनुमति देने के लिए सामानीकरण लागू करता है; और फास्ट-डिटेक्ट नमूना आधारित विकृतियों के माध्यम से स्थानीय वक्रता का अनुमान लगाता है।

लास्टडे संभावना संकेत में विभेदक उपक्रमों का विश्लेषण किया, जबकि फोरियरजीपीटी आवृत्ति डोमेन में संचालित होता है। डाइवे अनुक्रम में ‘अप्रत्याशितता’ विविधता में परिवर्तनों को पकड़ लेता है।

अंत में, यूसीई टोकन भविष्यवाणियों के अनिश्चितता प्रोफ़ाइल का मूल्यांकन करता है, जो अस्वाभाविक विश्वास पैटर्न की पहचान करने के लिए है।

कार्यान्वयन और परिणाम

सभी पता लगाने वाले तरीकों को लामा-3-8बी-इन्सट्रक्ट का उपयोग करके एक साझा सरोगेट मॉडल के रूप में चलाया गया था, जिसमें 512 टोकन तक सीमित इनपुट अनुक्रम थे। समय सुविधाओं को केवल प्रत्येक पारग्रह के दूसरे आधे हिस्से से निकाला गया था, जिसमें 20 टोकन की स्लाइडिंग विंडो का उपयोग अस्थिरता को मापने के लिए किया गया था। विधि का एक संयुक्त संस्करण, जिसे टीएसडी+ कहा जाता है, प्रस्तावित संकेत को फास्ट-डिटेक्टजीपीटी के साथ जोड़ता है।

रिसीवर ऑपरेटिंग चार्ट के नीचे क्षेत्र (एयूआरओसी) मूल्यांकन के लिए प्राथमिक मीट्रिक थी:

विभिन्न परीक्षण विधियों के बीच विविध प्रदर्शन एआई-उत्पन्न पाठ के खिलाफ। पता लगाने की सटीकता दो बेंचमार्क के साथ दिखाई जाती है: EvoBench, जो कई उच्च-प्रोफ़ाइल एलएलएम को कवर करता है, और MAGE, एक पूरक डेटासेट। मीट्रिक को विधि प्रकार द्वारा समूहीकृत किया जाता है: वैश्विक सांख्यिकी, समय सुविधाएँ, और प्रस्तावित वेरिएंट। अंतिम कॉलम में औसत एयूआरओसी स्कोर दिए गए हैं। लेखकों की विधि वेरिएंट के परिणाम लगातार पिछले बेसलाइन को पार करते हैं, जिसमें टीएसडी+ लगभग हर मॉडल सेटिंग में उच्चतम स्कोर प्राप्त करता है।

विभिन्न परीक्षण विधियों के बीच विविध प्रदर्शन एआई-उत्पन्न पाठ के खिलाफ। पता लगाने की सटीकता दो बेंचमार्क के साथ दिखाई जाती है: EvoBench, जो कई उच्च-प्रोफ़ाइल एलएलएम को कवर करता है, और MAGE, एक पूरक डेटासेट। मीट्रिक को विधि प्रकार द्वारा समूहीकृत किया जाता है: वैश्विक सांख्यिकी, समय सुविधाएँ, और प्रस्तावित वेरिएंट। अंतिम कॉलम में औसत एयूआरओसी स्कोर दिए गए हैं। लेखकों की विधि वेरिएंट के परिणाम लगातार पिछले बेसलाइन को पार करते हैं, जिसमें टीएसडी+ लगभग हर मॉडल सेटिंग में उच्चतम स्कोर प्राप्त करता है।

इन प्रारंभिक परिणामों में, लेखकों का उल्लेख है:

‘हमारी सरल समय सुविधाएँ स्टैंडअलोन तरीकों के बीच राज्य-оф़-द-आर्ट प्रदर्शन प्राप्त करती हैं, टीएसडी 83.36% पर EvoBench और 71.56% पर MAGE प्राप्त करता है, जो सभी बेसलाइन को पार करता है, जिसमें फास्ट-डिटेक्टजीपीटी भी शामिल है।

‘यह उल्लेखनीय है कि हमारी विधि की सादगी को देखते हुए: हम केवल दूसरे आधे हिस्से से दूसरे क्रम के आंकड़े गणना करते हैं, बिना किसी विकृति नमूनाकरण या आवृत्ति-डोमेन परिवर्तन के।’

नई विधि ने विशेष रूप से नए एआई मॉडल जैसे जीपीटी-4 और जीपीटी-4ओ पर अच्छा काम किया, जो एआई-लिखित पाठ की पहचान करने में निकटतम अग्रणी डिटेक्टर की तुलना में अधिक सटीक थी, जिसमें 9.66% तक का प्रदर्शन अंतर था। हालांकि नए उन्नत मॉडल कम स्पष्ट रूप से ‘सुसंगत’ पाठ उत्पन्न करते हैं, जो स्वचालन के कुछ संकेतों को छुपाता है, कुछ सूक्ष्म समय पैटर्न अभी भी अंत में स्पष्ट हैं।

व्यापक संरचनात्मक सुविधाओं पर ध्यान केंद्रित करने वाले प्रतिस्पर्धी दृष्टिकोण देर से चरण के पैटर्न को पकड़ने में विफल रहे। एक वैश्विक डिटेक्टर को एकीकृत करके, संकर प्रणाली कथित तौर पर छूटे हुए संकेतों को पुनर्प्राप्त करती है, और विशेष रूप से उन बेंचमार्क पर प्रदर्शन में सुधार करती है जहां छोटे एआई आउटपुट समय संकेतों को कमजोर कर सकते हैं।

निष्कर्ष

एक पहलू जिसे नए काम में सीधे तौर पर संबोधित नहीं किया गया है वह यह है कि मानव लेखकों की प्रवृत्ति है कि वे अपने काम को मसौदे के माध्यम से और विभिन्न स्तरों की देखभाल के माध्यम से पुनरावृत्ति करते हैं – कभी-कभी बाहरी देखभाल, जैसे संपादकों और प्रूफरीडर्स के इनपुट, और संभावित रूप से कानूनी विभागों से सुझावित परिवर्तन, संदर्भ के आधार पर।

एक ही दस्तावेज़, जैसे कि एक अच्छी तरह से दफनाए गए समाचार लेख में, शामिल हो सकते हैं जो मानव लेखकों की विचित्रता पर ध्यान केंद्रित करने वाली नई प्रस्तावित प्रणाली को प्रभावित कर सकते हैं, और इस प्रभाव को एक प्रकार का ‘विश्लेषणात्मक संस्करण’ एआई-सहायता प्राप्त मसौदे की प्रक्रिया के रूप में माना जा सकता है।

इसके अलावा, अध्ययन के तहत प्रणालियों ने ऐसे कार्यों पर प्रशिक्षित किया है, और – जैसा कि प्रशिक्षण समय में अधिकार के रूप में रैंक किया जाता है – सबसे ‘वजनदार’ या सम्मानित स्रोत सबसे ‘प्राकृतिक’ नहीं हो सकते हैं; कम से कम, किसी के सहयोगी को एक आकस्मिक ईमेल लिखने की तुलना में एक वार्षिक रिपोर्ट को एक एजीएम के लिए इकट्ठा करने के लिए।

एक और विपरीत विचार यह है कि एक से अधिक लोगों द्वारा योगदान दिए गए पाठ सामग्री भी सबसे खंडित, दोषपूर्ण और पुनरावृत्तिपूर्ण टुकड़े हो सकते हैं जो एक डेटासेट में प्रवेश करते हैं, क्योंकि वे अक्सर एक अंतिम एकत्रित आवाज का लाभ नहीं उठाते हैं, जिससे उनके विकास की टुकड़े-टुकड़े प्रकृति पाठ में स्पष्ट हो जाती है।

 

* लेखकों की मूल पाठ-शैली को पेपर से पुनरुत्पादित किया गया; मेरे जोर नहीं।

लेखक ‘प्राथमिक’ कहते हैं, जबकि अन्य मूल्यांकन मीट्रिक सूचीबद्ध नहीं हैं।

सोमवार, 26 जनवरी, 2026 को पहली बार प्रकाशित

मशीन लर्निंग पर लेखक, मानव इमेज सिंथेसिस में डोमेन विशेषज्ञ। मेटाफिजिक.ai में रिसर्च कंटेंट के पूर्व प्रमुख, जब तक कि इसका डीएनजीई के ब्रह्मा.ai में विलय नहीं हो गया।
पोर्टफोलियो साइट: martinanderson.ai
संपर्क: martin@martinanderson.ai