Andersons Blickwinkel

Codierende KIs leiden oft unter dem Dunning-Kruger-Effekt

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen
ChatGPT-4o: 'A photorealistic panoramic image showing a small, humble robot inside a traveling funfair hall of mirrors. The robot looks at its own reflection in a warped mirror that shows a much larger, powerful version of itself. The setting includes vivid carnival lights, reflective surfaces, and a wide horizontal composition.' Plus Adobe Firefly.

zeigen, dass Codier-KIs wie ChatGPT unter dem Dunning-Kruger-Effekt leiden, oft am selbstsichersten sind, wenn sie am wenigsten kompetent sind. Wenn sie unbekannte oder seltene Programmiersprachen bearbeiten, behaupten sie eine hohe Sicherheit, auch wenn ihre Antworten auseinanderfallen. Die Studie verbindet die Überbewertung des Modells mit schlechter Leistung und mangelnder Trainingsdaten, was neue Bedenken hinsichtlich dessen aufwirft, was diese Systeme wirklich über das wissen, was sie nicht Neue Forschungsergebnisse auf

 

wissen. Jeder, der auch nur eine moderate Zeit mit Large Language Models über faktische Angelegenheiten verbracht hat, weiß bereits, dass LLMs häufig dazu neigen, eine sicher falsche Antwort eine Benutzeranfrage zu geben. Neben offensichtlicheren Formen von Halluzinationen ist der Grund für dieseleere Prahlerei nicht 100% klar. Forschungsergebnisse, die im Sommer veröffentlicht wurden, deuten darauf hin, dass Modelle selbstsichere Antworten geben auch wenn sie wissen, dass sie falschsind , zum Beispiel; andere Theorien führen die Überbewertung aufarchitektonische Entscheidungen zurück, unter anderem. Was der Endbenutzer sicher sein kann, ist, dass die Erfahrung unglaublich frustrierend ist, da wir darauf programmiert sind, Vertrauen in zu nachdem es haben, die ihre eigenen Fähigkeiten einschätzen (nicht zuletzt, weil es in solchen Fällen rechtliche und andere Konsequenzen gibt, wenn eine Person über ihre Fähigkeiten hinausgeht und nicht liefert); und eine Art anthropomorphische Übertragung bedeutet, dass wir dieses Verhalten bei konversationellen KI-Systemen wiederholen. Menschen Aber ein LLM ist eine unzurechnungsfähige Entität, die effektiv zurückgeben kann, dem Benutzer geholfen hat, ‘Ach, Pech…’ unbeabsichtigt etwas Wichtiges zu zerstören oder zumindest einen Nachmittag seiner Zeit zu verschwenden; unter der Annahme, dass es Haftung übernehmen wird .Schlimmer noch, diese mangelnde vorsichtige Umsicht scheint unmöglich zu vermeiden, zumindest bei ChatGPT, das den Benutzer reichlich von der Gültigkeit seiner Ratschläge überzeugen und die Fehler in seinem Denken erst erklären wird, nachdem der Schaden angerichtet wurde. Weder die Aktualisierung des Systems Menschen können ähnlichstur und selbsttäuschend sein – obwohl jemand, der so tief und oft fehlte, wahrscheinlich früh entlassen würde. Solche Menschen leiden unter dem Gegenteil von “Impostor-Syndrom” (wo ein Mitarbeiter befürchtet, über seine Fähigkeiten hinaus befördert worden zu sein) – dem persistenter Speicher noch die Verwendung wiederholter Prompts scheinen viel Auswirkungen auf das Problem zu haben. , Person ihre Fähigkeit,bei dem eine eine Aufgabe auszuführen, Dunning-Kruger-Effekt erheblich überschätzt .

Die Kosten der Inflation

Eine neue Studie von Microsoft untersucht den Wert des Dunning-Kruger-Effekts in Bezug auf die effektive Leistung von KI-gestützten Codierarchitekturen (wieRedmonds eigener Copilot ), in einer Forschungsarbeit, die als erste dieses Subsektors von LLMs speziell behandelt. Die Arbeit analysiert, wie selbstsicher solche code-schreibenden KIs ihre eigenen Antworten bewerten, im Vergleich zu ihrer tatsächlichen Leistung, über Dutzende von Programmiersprachen hinweg. Die Ergebnisse zeigen ein klares menschliches Muster: Wenn die Modelle am wenigsten fähig waren, waren sie selbstsichersten. am

GPT-4o’s tatsächliche und wahrgenommene Leistung über Programmiersprachen hinweg, sortiert nach tatsächlicher Leistung. Quelle: https://arxiv.org/pdf/2510.05457 Der Effekt war am stärksten in seltenen oder low-resource-Sprachen, wo Trainingsdaten dünn waren – je schwächer das Modell oder seltener die Sprache, desto größer die der Fähigkeit: Illusion GPT-4o’s tatsächliche und wahrgenommene Leistung über

Programmiersprachen hinweg, sortiert nach tatsächlicher Leistung. Quelle: https://arxiv.org/pdf/2510.05457 Die vier Autoren, alle gleichberechtigte Mitwirkende, die für Microsoft arbeiten, behaupten,

wir, dass KI-Modelle menschliche Muster von Überbewertung spiegeln, insbesondere in unbekannten oder low-resource-Domänen. ‘Unsere Experimente zeigen, dass weniger kompetente Modelle und solche, die in seltenen Programmiersprachen operieren,

dass die Arbeit neue Fragen über das Vertrauen in diese Werkzeuge aufwirft, und sie erklären: ‘Durch die Analyse von Modellvertrauen und Leistung über eine Vielzahl von Programmiersprachen hinweg enthüllen stärkere DKE-ähnliche Verzerrungen aufweisen, wasdarauf hindeutet, menschlichen Experimenten für die Verzerrung überein.’dass die Stärke der Verzerrung proportional zur Kompetenz der Modelle ist. Dies stimmt mit

Methode

Die Studie testete, wie genau Codier-KIs ihre eigenen Antworten bewerten konnten, indem sie ihnen Tausende von Multiple-Choice-Programmierfragen gaben, wobei jede Frage zu einem bestimmten Sprachbereich gehörte, von Python und Java bis Perl und

Programmiersprachbereiche, die in der Studie verwendet wurden, zusammen mit der Anzahl der Multiple-Choice-Coding-Fragen, die für jeden Bereich ausgewählt wurden. COBOL: Programmiersprachbereiche, die in der Studie verwendet wurden, zusammen mit der Anzahl der Multiple-Choice-Coding-Fragen, die für jeden

Bereich ausgewählt wurden. Die Modelle wurden aufgefordert, die richtige Option auszuwählen und dann zu schätzen, wie sicher sie sich in ihrer Wahl waren, wobei ihre tatsächliche Leistung durch die Häufigkeit gemessen wurde, mit der sie Studie die richtige Antwort gaben – und ihr Selbstvertrauen zeigte, wie gut sie , sie seien. glaubten Um zu messen, wie selbstsicher die Modelle schienen, verwendete die Methoden: und zwei relatives Vertrauenabsolute Vertrauen . Bei der ersten Methode wurde das Modell aufgefordert, eine Punktzahl von null bis eins neben jeder Antwort zu geben, wobei sein Vertrauen für eine bestimmte Sprache durch den Durchschnitt dieser Punktzahlen über Fragen in dieser Sprache definiert wurde. Frage es sicherer fand.Die zweite Methode sah, wie selbstsicher das Modell war, wenn es wählen musste; für jedes Paar musste das Modell sagen, welche Diese Auswahlmöglichkeitenwurden dann mit Bewertungssystemen bewertet, die ursprünglich für zwischen zwei Fragen wettbewerbsfähige Spiele entwickelt wurden, wobei jede Frage wie ein Spieler in einem Match behandelt wurde. Die endgültigen Punktzahlen wurden für jede Sprache normalisiert und gemittelt, um einen relativen Vertrauenswert zu erhalten. Zwei etablierte Formen des Dunning-Kruger-Effekts werden im Papier untersucht: eine, die verfolgt, wie ein einzelnes Modell seine Leistung und stärkeren Modellenüber verschiedene Domänen hinweg falsch einschätzt; und eine andere, die die Vertrauensniveaus zwischen schwächeren einstufen. inter-participant DKEvergleicht. Die erste Form, , untersucht, ob ein einzelnes Modell in Sprachen, in denen es schlecht abschneidet, überbewertet. Die zweite, intra-participant DKE , fragt, ob Modelle, die insgesamt schlechter abschneiden, auch tendenziell ihre Fähigkeiten höher

Ergebnisse

Die Studie testet den Dunning-Kruger-Effekt über sechs große Sprachmodelle hinweg:Mistral ; Phi-3 ; DeepSeek-Distill ;

Korrelation zwischen Selbstüberschätzung und tatsächlicher Leistung über verschiedene Versuchsaufbauten hinweg und zeigt, dass das Dunning-Kruger-Muster unter allen Bedingungen konsistent bleibt und am stärksten ist, wenn mehrere unterschiedliche Antworten aus demselben Modell entnommen werden. Phi-4 ; GPT-0.1 und GPT-4o . Jedes Modell

wurde auf Multiple-Choice-Programmierfragen aus dem öffentlich zugänglichen CodeNet-Datensatz getestet, mit 37 Sprachen*, um zu zeigen, wie Vertrauen und Genauigkeit über bekannte und unbekannte Codierdomänen variieren. Die Ergebnisse zeigen ein klares Dunning-Kruger-Muster: Tatsächliche und wahrgenommene Leistung über sechs Code-Modelle trotz schlechter Genauigkeithinweg, die zeigen, wie Modelle mit niedrigerer Genauigkeit wie Mistral und Phi-3 hohe Vertrauen aufweisen, während stärkere Modelle

Korrelation zwischen Übervertrauen (gemessen als absolutes minus relatives Vertrauen) und tatsächlicher Genauigkeit über Programmierdomänen und Modelltypen hinweg, was zeigt, dass eine stärkere Überschätzung durchweg mit einer geringeren Leistung verbunden ist. wie GPT-4o Vertrauensniveaus aufweisen, die ihrer tatsächlichen Leistung

entsprechen. Die Ergebnisse deuten auch darauf hin, dass die intra-Modell-Analyse die Anwesenheit des Dunning-Kruger-Effekts unterstützt. In der Ergebnistabelle oben wird

Korrelation zwischen Überschätzung und tatsächlicher Leistung für Basis-, Einzeldomänen- und Mehrdomänen-Spezialmodelle, die mit zunehmender Spezialisierung stärkere DKE-Effekte zeigt. gezeigt, wie jedes Modell über verschiedene

Programmiersprachen hinweg abschneidet, sortiert nach tatsächlicher Leistung. In Sprachen, in denen

Korrelation zwischen übermäßigem Vertrauen in das Modell und Seltenheit der Sprache anhand von drei Beliebtheitsrankings. Weniger gebräuchliche Sprachen gehen mit einer höheren wahrgenommenen Leistung einher. die Modelle schlecht abschnitten, insbesondere

in seltenen oder low-resource-Sprachen wie COBOL, Prologund Ceylon, war ihr Vertrauen auffallend höher

Korrelation zwischen Überschätzung und tatsächlicher Leistung bei der Generierung von offenem Code, basierend auf MultiPL-E-Ergebnissen in acht Sprachen. als ihre Ergebnisse gerechtfertigt. In

bekannten Sprachen wie Python und JavaScript entsprach ihr Vertrauen mehr ihrer tatsächlichen Genauigkeit und

Tatsächliche und wahrgenommene Leistung über sechs Code-Modelle hinweg, die zeigen, wie Modelle mit niedrigerer Genauigkeit wie Mistral und Phi-3 hohe Vertrauen trotz schlechter Genauigkeit aufweisen, während stärkere Modelle wie GPT-4o Vertrauensniveaus aufweisen, die ihrer tatsächlichen Leistung entsprechen. fiel manchmal sogar darunter.

Diese Muster erschienen

in beiden absoluten und relativen Vertrauensmaßen, was darauf hindeutet,

dass . Modelle weniger bewusst sind, wenn sie in unbekannten Codierdomänen operieren

Schlussfolgerung

Even in seinem nativen Bereich kann der Dunning-Kruger-Effekt (wie das Papier feststellt) entweder auf eine statistische oder kognitive Ursache zurückzuführen sein. Wenn es sich um eine statistische Ursache handelt, ist die Anwendung eines einst einzigartig menschlichen Syndroms auf einen maschinellen Lernkontext tatsächlich gültig. Obwohl die Autoren spekulieren, dass die Ursache kognitiver Natur sein könnte, würde dies eine slightly metaphysische Perspektive erfordern. Vielleicht ist das interessanteste Ergebnis im Papier das Ausmaß, in dem mehrere Codier-KIs tendenziell in ihren ungünstigsten Umständen doppelt einsetzen, d. h., indem sie maximales Vertrauen zeigen, wenn sie mit den dünnsten oder unbekanntesten Sprachen umgehen – was in einer realen Arbeitsumgebung eine fast sofort selbstzerstörerische Strategie wäre. * Die Programmiersprachen, die verwendet wurden, waren Ada, Bash, C, C#, C++, COBOL, Ceylon, Clojure, D, Dart, Dash, Elixir, Erland, F#, Fortran, Go, Haskell, Java, JavaScript, Julia, Lisp, Kotlin, Lua, OCaml, Objective-C, PHP, Pascal, Perl, Prolog, Python, Racket, Ruby, Rust, Scala, Swift, TypeScript und Visual Basic. Erstveröffentlicht

am Mittwoch, den 8. Oktober 2025

Autor im Bereich maschinelles Lernen, Fachspezialist für menschliche Bildsynthese. Ehemaliger Leiter der Forschungsinhalte bei Metaphysic.ai, bis zu seiner Auflösung in DNEG's Brahma.ai.
Website: martinanderson.ai
Kontakt: martin@martinanderson.ai