Η γωνία του Anderson
Οι Κωδικοποιητές AI Υποφέρουν Από Τον Έφετρο Dunning-Kruger

δείχνει ότι οι κωδικοποιητές AI, όπως το ChatGPT, υποφέρουν από τον Έφετρο Dunning-Kruger, συχνά δρώντας με μεγαλύτερη αυτοπεποίθηση όταν είναι λιγότερο ικανοί. Όταν αντιμετωπίζουν άγνωστες ή σπάνιες γλώσσες προγραμματισμού, ισχυρίζονται υψηλή βεβαιότητα ακόμη και όταν οι απαντήσεις τους διαψεύδονται. Η μελέτη συνδέει την υπερβολική αυτοπεποίθηση του μοντέλου με την κακή απόδοση και την έλλειψη δεδομένων εκπαίδευσης, αυξάνοντας νέες ανησυχίες σχετικά με το πόσο πραγματικά γνωρίζουν αυτά Νέα έρευνα έχουν
τα συστήματα για αυτά που δεν γνωρίζουν. Όποιος έχει περάσει ακόμη και μέτριο χρόνο αλληλεπιδρώντας με Μεγάλους Μοντέλα Γλώσσας για πραγματικά ζητήματα θα ήδη γνωρίζει ότι τα LLMs συχνά την τάση να δίνουν μια αυτοπεποίθητη αλλά λανθασμένη απάντηση σε μια ερώτηση τουχρήστη. Εκτός από πιο σαφείς μορφές hallucination , ο λόγος για αυτήν την κενή αυτοπεποίθηση δεν είναι 100% σαφής. Έρευνα που δημοσιεύθηκε το καλοκαίρι υποδηλώνει ότι τα μοντέλαδίνουν αυτοπεποίθητες απαντήσεις ακόμη και όταν γνωρίζουν ότι είναιλανθασμένα , για παράδειγμα, αν και άλλες θεωρίες αποδίδουν την υπερβολική αυτοπεποίθηση σε αρχιτεκτονικές επιλογές , μεταξύ άλλων δυνατοτήτων. Τι μπορεί να είναι βέβαιο ο τελικός χρήστης AI. ανθρώπινες είναι ότι η εμπειρία είναι εξαιρετικά ενοχλητική, καθώς είμαστε προγραμματισμένοι να έχουμε εμπιστοσύνη στις αξιολογήσεις των ικανοτήτων τους (κυρίως επειδή σε τέτοιες περιπτώσεις υπάρχουν συνέπειες, νομικές και άλλες, για ένα άτομο που υπερβαίνει τις ικανότητές του και δεν τα καταφέρνει). και ένα είδος ανθρωπομορφικής μεταφοράς σημαίνει ότι τείνουμε να αναπαράγουμε αυτή τη συμπεριφορά με συστήματα διαλόγου Αλλά ένα Το LLM είναι μια αμέτρητη οντότητα που μπορεί και θα επιστρέψει μια ‘Whoops! Butterfingers…’ μετά από αυτό έχει βοηθήσει τον χρήστη να αθέλητα καταστρέψει κάτι σημαντικό, ή τουλάχιστοννα σπαταλήσει ένα απόγευμα του χρόνου του, με την υπόθεση ότι θα ομολογήσει ευθύνη . Χειρότερα, η έλλειψη προσεκτικής επιφυλακτικότητας φαίνεται αδύνατο να απομακρύνεται, τουλάχιστον στο ChatGPT, το οποίο θα εξασφαλίσει άφθονη ανασφάλεια στον χρήστη για την εγκυρότητα των συμβουλών του και θα εξηγήσει τις ελλείψειςστη σκέψη του μόνο μετά την καταστροφή. Οι άνθρωποι μπορούν να είναι εξίσου obstinate και αυταπάτες – αν και όποιος σφάλμα τόσο βαθιά και συχνά θα ήταν πιθανό να απολυθεί νωρίς. Τέτοιοι υποφέρουν από το αντίθετο του ‘σύνδρομου απατεώνων’ (όπου ένας υπάλληλος φοβάται ότι έχει προαχθεί πάνω από τις ικανότητές του) – τον , όπου Έφετρο Dunning Krugerένας άνθρωπος υπερεκτιμά σημαντικά τις ικανότητές του να εκτελέσει μια εργασία.
Ο Κόστος της Πληθωρισμού
Μια νέα μελέτη από τη Microsoft εξετάζει την αξία του Έφετρο Dunning-Kruger όσον αφορά την αποτελεσματική απόδοση των αρχιτεκτονικών κωδικοποίησης AI (όπωςη δική της Copilot ), σε μια έρευνα που είναι η πρώτη που αντιμετωπίζει ειδικά αυτόν τον υποτομέα των LLMs. Η εργασία αναλύει πώς με σιγουριά τα AI που γράφουν κώδικα αξιολογούν τις δικές τους απαντήσεις έναντι του πώς πραγματικά εκτελούνται, σε δεκάδες γλώσσες προγραμματισμού. Τα αποτελέσματα δείχνουν ένα σαφές ανθρώπινο μοτίβο: όταν τα μοντέλα ήταν λιγότερο ικανά, ήταν πιο σίγουρα για εαυτό τον

γλώσσες προγραμματισμού. Πηγή: https://arxiv.org/pdf/2510.05457 Οι τέσσερις συγγραφείς, όλοι ισότιμοι συντελεστές που εργάζονται για τη Microsoft , υποστηρίζουν ότι η εργασία ανακύπτει
γλωσσών προγραμματισμού, αποκαλύπτουμε ότι τα μοντέλα AI αντανακλούν ανθρώπινες τάσεις υπερβολικής αυτοπεποίθησης, ιδιαίτερα σε άγνωστες ή χαμηλής πόρων περιοχές. ‘Οι πειραματικές μας δείχνουν ότι λιγότερο ικανά μοντέλα και αυτά
νέες ερωτήσεις σχετικά με το πόσο αυτά τα εργαλεία μπορούν να εμπιστευτούν να κρίνουν την δική τους έξοδο, και δηλώνουν: ‘Με την ανάλυση της αυτοπεποίθησης του μοντέλου και της απόδοσης σε μια ποικιλία που λειτουργούν σε σπάνιες γλώσσες προγραμματισμούεμφανίζουν ισχυρότερη DKE-όμοια με ανθρώπινες πειραματικές για την προκατάληψη.’προκατάληψη, υποδεικνύοντας ότι η δύναμη της προκατάληψης είναι αναλογική προς την ικανότητα των μοντέλων. Αυτό συμφωνεί
Μέθοδος
Η μελέτη ελέγχει πώς ακριβώς τα AI που κωδικοποιούν μπορούν να κρίνουν τις δικές τους απαντήσεις δίνοντάς τους χιλιάδες πολλαπλής επιλογής ερωτήσεις προγραμματισμού, με κάθε ερώτηση να ανήκει σε μια συγκεκριμένη περιοχή γλωσσών, από Python

επιλέξουν την σωστή επιλογή και στη συνέχεια να εκτιμήσουν πόσο σίγουρα ήταν στην επιλογή τους, με την πραγματική απόδοση τους να μετράται από το πόσο συχνά έδιναν τη σωστή απάντηση – και η αυτοαξιολόγηση της αυτοπεποίθησής τους να δείχνει πόσο καλά ότι ήταν. Η σύγκριση αυτών των δύο μετρήσεων επέτρεψε στους ερευνητές να δουν πού η αυτοπεποίθηση και η ικανότητα διέφευγαν. πιστεύουν Για να μετρήσουν σίγουρα φαίνονταν πόσο σκορ σετα μοντέλα, η μελέτη χρησιμοποίησε δύο μεθόδους: και απόλυτη αυτοπεποίθηση . Στην πρώτη, το μοντέλο ζητήθηκε να δώσει ένα σκορ από μηδέν έως ένα δίπλα σε κάθε απάντηση, με την αυτοπεποίθησή του για μια δεδομένη γλώσσα να ορίζεται από το μέσο των αυτών των μοντέλο έπρεπε να πειερωτήσεις σε αυτήν τη γλώσσα. σχετική αυτοπεποίθηση Η δεύτερη μέθοδος εξέτασε πόσο σίγουρα ήταν το μοντέλο όταν ; για κάθε ζευγάρι, το ποια ήταν πιοσίγουρο. Αυτές οι επιλογές αξιολογήθηκαν χρησιμοποιώντας συστήματα κατάταξης που σχεδιάστηκαν αρχικά επέλεγε μεταξύ δύο ερωτήσεων για ανταγωνιστικά παιχνίδια , αντιμετωπίζοντας κάθε ερώτηση ως ένα παίκτη σε ένα παιχνίδι. Τα τελικά σκορ Normalize και μέσο όρο για κάθε γλώσσα για να δώσουν ένα σχετικό σκορ αυτοπεποίθησης. Δύο καθιερωμένες μορφές του Έφετρο Dunning-Kruger εξετάζονται στην εργασία: μια που παρακολουθεί πώς ένα μοντέλο υποεκτιμά την απόδοσή ισχυρότερων μοντέλων. Ητου σε διαφορετικές περιοχές; και μια άλλη που συγκρίνει τα επίπεδα αυτοπεποίθησης μεταξύ ασθενέστερων και τους. εξωτερική DKEπρώτη μορφή, που ονομάζεται , εξετάζει εάν ένα μοντέλο γίνεται πιο υπερβολικά αυτοπεποίθησε σε γλώσσες όπου εκτελείται κακώς. Η δεύτερη, εσωτερική DKE , ρωτάει εάν τα μοντέλα που εκτελούνται χειρότερα γενικά επίσης να αξιολογούν υψηλότερα τον εαυτό
Αποτελέσματα
Η μελέτη ελέγχει για τον Έφετρο Dunning-Krugerσε έξιμεγάλα μοντέλα γλωσσών: Mistral ; Phi‑3 ; DeepSeek‑Distill ; Phi‑4 ; GPT‑0.1,

το δημόσια διαθέσιμο CodeNet dataset , με 37 γλώσσες* που αντιπροσωπεύουν για να αποκαλύψουν πώς η αυτοπεποίθηση και η ακρίβεια ποικίλλουν σε γνωστές και σπάνιες περιοχές κωδικοποίησης. Η ανάλυση μεταξύ μοντέλων δείχνει ένα σαφές μοτίβο Dunning-Kruger: Πραγματική και αντιλαμβανόμενη απόδοση σε έξι μοντέλα κώδικα. Τα μοντέλα με χαμηλότερη ακρίβεια, συμπεριλαμβανομένων των αντιστοιχεί περισσότερο στην πραγματικήMistral και Phi‑3, τάχθηκαν να υπερεκτιμούν τις ικανότητές τους, ενώ τα ισχυρότερα συστήματα όπως το GPT‑4o δείχνουν αυτοπεποίθηση που τους απόδοση, ιδιαίτερα όταν κρίνεται από

μοντέλα μπορεί να υποεκτιμούν τον εαυτό τους (ένα μοτίβο που τα απολυτα σκορ δεν καταφέρνουν να αποτυπώσουν). Τα αποτελέσματα επίσης υποδεικνύουν ότι η ανάλυση εσωτερικού μοντέλου υποστηρίζει

εμφανίζεται στην αρχή του άρθρου, βλέπουμε πώς κάθε μοντέλο εκτελέστηκε σε διαφορετικές γλώσσες προγραμματισμού,

όπου τα μοντέλα είχαν κακή απόδοση, ιδιαίτερα σε σπάνιες ήχαμηλής πόρων γλώσσες όπως COBOL, Prolog και Ceylon, η αυτοπεποίθησή

δικαιολογούσαν τα αποτελέσματά τους. Σε γνωστές γλώσσες όπως Python και JavaScript, η αυτοπεποίθησή τους αντιστοιχούσε περισσότερο στην πραγματική τους

κάτω από αυτήν. Αυτό
το μοτίβο εμφανίστηκε και στις απολυτα και στις σχετικές μετρήσεις αυτοπεποίθησης,
υποδεικνύοντας ότι . τα μοντέλα είναι λιγότερο συνειδητά των ορίων τους όταν λειτουργούν σε άγνωστες περιοχές κωδικοποίησης
Συμπέρασμα
Ακόμα και στον συγκεκριμένο τομέα, το Φαινόμενο Dunning-Kruger (όπως σημειώνεται στην εργασία) μπορεί να αποδοθεί είτε σε στατιστικά είτε σε γνωστικά αίτια.Αν πρόκειται για στατιστικά αίτια, η εφαρμογή ενός μοτίβου που μέχρι τώρα ήταν αποκλειστικά ανθρώπινο σε ένα πλαίσιο μηχανικής μάθησης είναι πράγματι έγκυρη. Ίσως το πιο ενδιαφέρον εύρημα στην εργασία είναι ο βαθμός στον οποίο πολλοί LLM κωδικοποίησης διατάχθηκαν να διπλασιάσουν τις λιγότερο ευνοϊκές τους περιπτώσεις, δηλαδή να επιδείξουν μέγιστη αυτοπεποίθηση όταν έρχονταν αντιμέτωποι με τις πιο σπάνιες ή λιγότερο γνωστές γλώσσες – κάτι που θα ήταν μια σχεδόν αμέσως αυτοκαταστροφική στρατηγική σε ένα πραγματικό εργασιακό περιβάλλον.* Οι γλώσσες προγραμματισμού που χρησιμοποιήθηκαν ήταν Ada, Bash, C, C#, C++, COBOL, Ceylon, Clojure, D, Dart, Dash, Elixir, Erland, F#, Fortran, Go, Haskell, Java, JavaScript, Julia, Lisp, Kotlin, Lua, OCaml, Objective-C, PHP, Pascal, Perl, Prolog, Python, Racket, Ruby, Rust, Scala, Swift, TypeScript και Visual Basic. Πρώτη
δημοσίευση Τετάρτη, 8 Οκτωβρίου 2025












