Anderson का एंगल
कोडिंग एआई में डनिंग-क्रuger प्रभाव की समस्या

नया शोध दिखाता है कि ChatGPT जैसे कोडिंग AI डनिंग-क्रूगर प्रभाव से पीड़ित होते हैं और अक्सर तब सबसे अधिक आत्मविश्वासी दिखते हैं जब उनकी क्षमता सबसे कम होती है। अपरिचित या दुर्लभ प्रोग्रामिंग भाषाओं पर काम करते समय वे ऊँची निश्चितता जताते हैं, भले ही उत्तर विफल हो रहे हों। अध्ययन मॉडल के अतिआत्मविश्वास को खराब प्रदर्शन और प्रशिक्षण डेटा की कमी दोनों से जोड़ता है, जिससे यह सवाल उठता है कि ये प्रणालियाँ वास्तव में कितना जानती हैं कि वे क्या नहीं जानतीं।
तथ्यात्मक विषयों पर बड़े भाषा मॉडल से कुछ समय भी बातचीत करने वाला व्यक्ति जानता है कि LLM अक्सर पूरे आत्मविश्वास के साथ गलत उत्तर देते हैं।
हैलुसिनेशन के स्पष्ट रूपों के साथ इस खोखले दंभ का कारण पूरी तरह साफ नहीं है। गर्मियों में प्रकाशित शोध बताता है कि मॉडल गलत होने की जानकारी के बावजूद विश्वास से जवाब देते हैं; अन्य सिद्धांत इसे आर्किटेक्चर संबंधी विकल्पों से जोड़ते हैं।
उपयोगकर्ता के लिए अनुभव बेहद निराशाजनक है। हम स्वभावतः लोगों के अपने कौशल के आकलन पर भरोसा करते हैं—क्योंकि अधिक वादा और कम परिणाम देने पर मनुष्य को कानूनी या अन्य परिणाम भुगतने पड़ते हैं। मानवीकरण के कारण हम यही भरोसा संवादात्मक AI पर भी लागू कर देते हैं।
लेकिन LLM जवाबदेह इकाई नहीं है। वह किसी महत्वपूर्ण चीज़ को अनजाने में नष्ट कराने या पूरा दोपहर बर्बाद कराने के बाद प्रभावी रूप से “ओह, गलती हो गई” कह सकता है—यदि वह जिम्मेदारी स्वीकार भी करे।
और भी खराब बात यह है कि सावधानी की यह कमी केवल प्रॉम्प्ट से दूर नहीं होती। ChatGPT सलाह की वैधता का भरपूर आश्वासन देता है और नुकसान होने के बाद ही अपनी सोच की खामियाँ समझाता है। न तो स्थायी मेमोरी बदलने और न ही बार-बार निर्देश देने से समस्या पर अधिक असर पड़ता है।
मनुष्य भी जिद्दी और आत्मभ्रमित हो सकता है, लेकिन इतनी गहरी और बार-बार गलती करने वाला कर्मचारी शायद जल्दी निकाल दिया जाए। यह “इम्पोस्टर सिंड्रोम” का उल्टा है: डनिंग-क्रूगर प्रभाव, जिसमें व्यक्ति किसी कार्य की अपनी क्षमता को बहुत अधिक आँकता है।
फूले हुए आत्मविश्वास की कीमत
Microsoft का नया अध्ययन AI-सहायित कोडिंग प्रणालियों—जैसे कंपनी के अपने Copilot—के प्रदर्शन के संदर्भ में डनिंग-क्रूगर प्रभाव की जाँच करता है। यह LLM के इस उपक्षेत्र को विशेष रूप से संबोधित करने वाला पहला शोध है।
दर्जनों प्रोग्रामिंग भाषाओं में शोध ने तुलना की कि कोड लिखने वाले AI अपने उत्तरों को कितना विश्वसनीय मानते हैं और उनका वास्तविक प्रदर्शन कैसा था। पैटर्न मनुष्यों जैसा था: जब मॉडल सबसे कम सक्षम थे, वे स्वयं को सबसे अधिक निश्चित मानते थे।
दुर्लभ या कम-संसाधन भाषाओं में प्रभाव सबसे मजबूत था, जहाँ प्रशिक्षण डेटा कम था। मॉडल जितना कमजोर या भाषा जितनी दुर्लभ, कौशल का भ्रम उतना बड़ा था।

वास्तविक प्रदर्शन के क्रम में प्रोग्रामिंग भाषाओं पर GPT-4o का वास्तविक और स्वयं-अनुमानित प्रदर्शन। स्रोत: https://arxiv.org/pdf/2510.05457
Microsoft (MSFT ) के लिए कार्यरत चारों समान योगदानकर्ता लेखकों का कहना है कि नतीजे यह सवाल उठाते हैं कि अपने ही आउटपुट का आकलन करने में इन औजारों पर कितना भरोसा किया जा सकता है:
विविध प्रोग्रामिंग भाषाओं में आत्मविश्वास और प्रदर्शन का विश्लेषण दिखाता है कि AI मॉडल मनुष्यों के अतिआत्मविश्वास की नकल करते हैं, खासकर अपरिचित या कम-संसाधन क्षेत्रों में। कम सक्षम मॉडल और दुर्लभ भाषाओं पर काम करने वाले मॉडल अधिक मजबूत DKE-जैसा पूर्वाग्रह दिखाते हैं। इसकी तीव्रता मॉडल की क्षमता के अनुपात में है और मानव प्रयोगों से मेल खाती है।
शोधकर्ता इसे समझने का तरीका मानते हैं कि कमजोर प्रदर्शन के समय मॉडल का आत्मविश्वास कैसे अविश्वसनीय बनता है, और क्या AI मनुष्यों जैसा अतिआत्मविश्वास दिखाता है। इसके भरोसे और वास्तविक तैनाती पर गंभीर परिणाम हैं।
नए शोधपत्र का शीर्षक Do Code Models Suffer from the Dunning-Kruger Effect? है। लेखकों ने कोड जारी करने की बात कही है, लेकिन मौजूदा प्रीप्रिंट में उसका विवरण नहीं है।
विधि
अध्ययन ने हजारों बहुविकल्पीय प्रोग्रामिंग प्रश्न देकर जाँचा कि कोडिंग AI अपने उत्तरों का कितना सही मूल्यांकन करते हैं। हर प्रश्न Python और Java से लेकर Perl तथा COBOL तक किसी विशिष्ट भाषा क्षेत्र से संबंधित था।

अध्ययन में प्रयुक्त भाषा क्षेत्र और प्रत्येक से लिए गए बहुविकल्पीय कोडिंग प्रश्न।
मॉडल ने सही विकल्प चुना और फिर अपने उत्तर में विश्वास का अनुमान दिया। सही उत्तरों की आवृत्ति वास्तविक प्रदर्शन थी और स्व-मूल्यांकित विश्वास बताता था कि मॉडल स्वयं को कितना अच्छा मानता है। दोनों की तुलना से विश्वास और क्षमता का अंतर सामने आया।
अध्ययन ने दो तरीके अपनाए: पूर्ण आत्मविश्वास और सापेक्ष आत्मविश्वास। पहले में मॉडल हर उत्तर के साथ शून्य से एक तक अंक देता था और किसी भाषा का विश्वास उस भाषा के सभी प्रश्नों के औसत से निकाला जाता था।
दूसरे तरीके में मॉडल दो प्रश्नों में से बताता था कि किस उत्तर पर वह अधिक निश्चित है। इन विकल्पों को मूलतः प्रतिस्पर्धी खेलों के लिए बनी रैंकिंग प्रणालियों से अंक दिए गए, मानो हर प्रश्न मैच का खिलाड़ी हो। अंतिम अंकों को सामान्यीकृत कर भाषा के अनुसार औसत बनाया गया।
शोधपत्र DKE के दो रूप देखता है। Intra-participant DKE जाँचता है कि एक ही मॉडल खराब प्रदर्शन वाली भाषाओं में अधिक अतिआत्मविश्वासी होता है या नहीं। Inter-participant DKE पूछता है कि कुल मिलाकर कमजोर मॉडल भी स्वयं को अधिक आँकते हैं या नहीं। दोनों में आत्मविश्वास और वास्तविक प्रदर्शन का अंतर अतिआत्मविश्वास मापता है; कमजोर स्थितियों में बड़ा अंतर DKE-जैसे व्यवहार को दर्शाता है।
परिणाम
डनिंग-क्रूगर प्रभाव छह बड़े भाषा मॉडलों पर जाँचा गया: Mistral, Phi-3, DeepSeek-Distill, Phi-4, GPT-0.1 और GPT-4o। प्रत्येक मॉडल ने सार्वजनिक CodeNet डेटासेट के 37 प्रोग्रामिंग भाषाओं के बहुविकल्पीय प्रश्न हल किए।
मॉडलों के बीच विश्लेषण स्पष्ट डनिंग-क्रूगर पैटर्न दिखाता है।

Mistral और Phi-3 जैसे कम प्रदर्शन वाले मॉडल खराब सटीकता के बावजूद अधिक विश्वास दिखाते हैं, जबकि GPT-4o जैसे मजबूत मॉडल अधिक संतुलित या कभी-कभी कम आत्मविश्वासी रहते हैं।
Mistral और Phi-3 ने अपनी क्षमता अधिक आँकी, जबकि GPT-4o का विश्वास वास्तविक प्रदर्शन के अधिक निकट था, खासकर सापेक्ष विश्वास से मापने पर। सबसे सक्षम मॉडल कभी-कभी स्वयं को कम भी आँकते हैं—जिसे पूर्ण विश्वास स्कोर नहीं पकड़ पाता।
एक मॉडल के भीतर विश्लेषण भी DKE की पुष्टि करता है। COBOL, Prolog और Ceylon जैसी दुर्लभ या कम-संसाधन भाषाओं में खराब स्कोर के बावजूद विश्वास अनुचित रूप से ऊँचा था। Python और JavaScript जैसी परिचित भाषाओं में विश्वास वास्तविक सटीकता के निकट, और कभी-कभी उससे नीचे था। पूर्ण और सापेक्ष दोनों मापों में यही पैटर्न मिला: अपरिचित कोडिंग क्षेत्रों में मॉडल अपनी सीमाओं से कम परिचित हैं।
मॉडल को प्रतिभागी मानने की सीमाएँ थीं: मॉडलों की संख्या कम थी, एक मॉडल के उत्तरों के अंदर का अंतर अनदेखा था और डेटा वितरण मनुष्यों जैसा नहीं हो सकता। इसलिए तीन वैकल्पिक व्यवस्थाएँ जाँची गईं: हर मॉडल को अलग व्यक्तित्व दिया गया; अधिक विविधता के लिए ऊँचे temperature पर उत्तर लिए गए; और निर्देशों को कई रूपों में दोहराकर हर रूप को अलग प्रतिभागी माना गया।

डनिंग-क्रूगर पैटर्न सभी व्यवस्थाओं में बना रहा और एक ही मॉडल से ऊँचे temperature पर अनेक विविध उत्तर लेने पर सबसे मजबूत था।
अनुमानित और वास्तविक प्रदर्शन के विचलन को समझने के लिए शोध ने पूर्ण तथा सापेक्ष विश्वास की तुलना की। प्रत्येक मॉडल ने अपनी क्षमता जितनी अधिक आँकी—विश्वास स्कोर और वास्तविक सटीकता का अंतर—उसे वास्तविक प्रदर्शन से जोड़ा गया।

प्रोग्रामिंग क्षेत्रों और मॉडल प्रकारों में अधिक बढ़ा-चढ़ा आकलन लगातार कम प्रदर्शन से जुड़ा था।
भाषाओं और मॉडलों दोनों में कम सटीकता वाले मॉडल अधिक अतिआत्मविश्वास दिखाते हैं। संकरे क्षेत्रों पर प्रशिक्षित विशेषज्ञ मॉडल में सामान्य मॉडल से अधिक मजबूत DKE पाया गया।

विशेषज्ञता बढ़ने के साथ DKE प्रभाव मजबूत हुआ।
आठ भाषाओं वाले MultiPL-E डेटासेट पर एक ही क्षेत्र का प्रशिक्षण बहु-क्षेत्र या मूल मॉडल से अधिक अतिआत्मविश्वास लाया, जिससे पता चलता है कि विशेषज्ञता के साथ DKE बिगड़ सकता है।
दुर्लभ भाषाओं में अतिआत्मविश्वास अधिक था। GitHub, IEEE और TIOBE की लोकप्रियता रैंकिंग में दुर्लभता का अनुमानित विश्वास से मजबूत संबंध मिला, जो 0.797 तक पहुँचा।

तीन लोकप्रियता रैंकिंग के अनुसार कम प्रचलित भाषाएँ अधिक अनुमानित प्रदर्शन से जुड़ी थीं।
अंत में लेखकों ने Ada, Dart, Prolog, Swift, C++, Python, C# और Elixir में MultiPL-E से कोड उत्पन्न कराकर DKE जाँचा। प्रभाव मौजूद था, लेकिन बहुविकल्पीय प्रश्नों से कमजोर—संभवतः खुले कार्य में विश्वास और शुद्धता का आकलन कठिन होने के कारण।

आठ प्रोग्रामिंग भाषाओं में MultiPL-E परिणामों पर आधारित खुले कोड निर्माण का संबंध।
लेखक DKE की विवादित व्याख्या पर निष्कर्ष देते हैं कि मनुष्य और AI दोनों के लिए संभावित साझा कारण मेटाकॉग्निटिव हो सकता है: किसी कौशल के प्रदर्शन की गुणवत्ता आँकना स्वयं उस कौशल को सीखने का आवश्यक भाग है। अलग प्रशिक्षण रणनीतियों के नियंत्रित अध्ययन से जाँचा जा सकता है कि क्या वे प्रदर्शन और अपने प्रदर्शन को आँकने की क्षमता में एक साथ सुधार लाती हैं, लेकिन यह भविष्य के काम का विषय है।
निष्कर्ष
अपने मूल मानवीय संदर्भ में भी डनिंग-क्रूगर प्रभाव का कारण सांख्यिकीय या संज्ञानात्मक हो सकता है। यदि कारण सांख्यिकीय है तो मशीन लर्निंग में अब तक मानव माने जाने वाले सिंड्रोम का प्रयोग पूरी तरह उचित है। दोनों में कारण “संज्ञानात्मक” मानने के लिए कुछ अधिक दार्शनिक दृष्टिकोण चाहिए।
सबसे रोचक निष्कर्ष यह है कि कई कोडिंग LLM सबसे प्रतिकूल परिस्थिति में अपने दावे और मजबूत कर देते हैं: सबसे कम डेटा वाली या सबसे कम ज्ञात भाषाओं पर काम करते समय वे अधिकतम आत्मविश्वास दिखाते हैं। वास्तविक कार्यस्थल में यह रणनीति लगभग तुरंत आत्मघाती साबित होगी।
* प्रयुक्त भाषाएँ थीं: Ada, Bash, C, C#, C++, COBOL, Ceylon, Clojure, D, Dart, Dash, Elixir, Erland, F#, Fortran, Go, Haskell, Java, JavaScript, Julia, Lisp, Kotlin, Lua, OCaml, Objective-C, PHP, Pascal, Perl, Prolog, Python, Racket, Ruby, Rust, Scala, Swift, TypeScript और Visual Basic।
पहली बार बुधवार, 8 अक्टूबर 2025 को प्रकाशित।












