Andersons vinkel
Kodnings-AI lider ofte under Dunning-Kruger-effekten

Nyt forskning viser, at kodnings-AI, såsom ChatGPT, lider under Dunning-Kruger-effekten, hvor de ofte opfører sig mest selvbevidst, når de er mindst kompetente. Når de beskæftiger sig med ukendte eller sjældne programmeringssprog, påstår de høj sikkerhed, selvom deres svar falder fra hinanden. Studiet forbinder modeloverbevisning med både dårlig præstation og mangel på træningsdata, hvilket rejser nye bekymringer om, hvor meget disse systemer virkelig ved om, hvad de ikke ved.
Enhver, der har brugt blot en moderat mængde tid på at interagere med Large Language Models om faktuelle emner, vil allerede vide, at LLM’er ofte er tilbøjelige til at give en selvbevidst forkert respons til en brugerforespørgsel.
Sammen med mere åbenlyse former for hallucination, er årsagen til denne tomme selvbevidsthed ikke 100% klar. Forskning offentliggjort over sommeren antyder, at modeller giver selvbevidste svar selvom de ved, de er forkerte, for eksempel; selvom andre teorier tilskriver overbevisning til arkitektoniske valg, blandt andet muligheder.
Hvad slutbrugeren kan være sikker på, er, at oplevelsen er utrolig frustrerende, da vi er hårdkodet til at have tillid til menneskers skøn over deres egne evner (ikke mindst fordi der er konsekvenser, juridiske og andre, til en persons over-lofter og under-udfylder); og en slags antropomorfisk overføring betyder, at vi tenderer til at gentage dette adfærd med konversational AI-systemer.
Men en LLM er en uansvarlig enhed, der kan og vil effektivt returnere en ‘Whoops! Butterfingers…’ efter at have hjulpet brugeren med at ufrivilligt ødelægge noget vigtigt, eller i det mindste spilde en eftermiddag af deres tid; antager det vil anerkende ansvar overhovedet.
Værre, denne mangel på forsigtig omhu synes umulig at prompte væk, i det mindste i ChatGPT, som vil overflodigt berolige brugeren om gyldigheden af sin rådgivning, og forklare fejlene i sin tænkning kun efter, at skaden er sket. Enten opdatering af systemets varige hukommelse, eller brugen af gentagne prompts synes ikke at have megen indvirkning på problemet.
Mennesker kan ligeledes være obstinat og selvbedragende – selvom enhver, der fejlede så dybt og ofte, sandsynligvis ville blive fyret tidligt. Sådanne lider under det modsatte af ‘impostersyndrom’ (hvor en medarbejder frygter, han er blevet forfremmet over sine evner) – Dunning Kruger-effekten, hvor en person betydeligt overvurderer sin evne til at udføre en opgave.
Omkostningerne ved inflation
En ny studie fra Microsoft undersøger værdien af Dunning-Kruger-effekten i forhold til den effektive præstation af AI-baserede kodningsarkitekturer (såsom Redmonds egen Copilot), i et forskningsprojekt, der er det første til specifikt at behandle denne undersektor af LLM’er.
Arbejdet analyserer, hvor selvbevidst sådanne kode-skrivende AI’er vurderer deres egne svar mod, hvor godt de faktisk opfører sig, på tværs af dusinvis af programmeringssprog. Resultaterne viser en tydelig menneske-lignende mønster: når modellerne var mindst kompetente, var de mest selvbevidste.
Effekten var stærkest i sjældne eller lav-resurs-sprog, hvor træningsdata var tynd – jo svagere modellen eller sjældnere sproget, jo større illusion af færdighed:

GPT-4o’s faktiske og opfattede præstation på tværs af programmeringssprog, sorteret efter faktisk præstation. Kilde: https://arxiv.org/pdf/2510.05457
De fire forfattere, alle ligeværdige bidragsydere, der arbejder for Microsoft, påstår, at arbejdet rejser nye spørgsmål om, hvor meget disse værktøjer kan tillides til at dømme deres egen output, og de påstår:
‘Ved at analysere model-selvbevisning og præstation på tværs af en divers samling af programmeringssprog, afslører vi, at AI-modeller spejler menneskelige mønstre af overbevisning, især i ukendte eller lav-resurs-domæner.
‘Vore eksperimenter demonstrerer, at mindre kompetente modeller og de, der opererer i sjældne programmeringssprog, viser stærkere DKE-lignende bias, hvilket antyder, at styrken af bias er proportionalt med modellernes kompetence. Dette stemmer overens med menneskelige eksperimenter for bias.’
Forskerne kontekstualiserer denne linje af studie som en måde at forstå, hvordan model-selvbevisning bliver utroværdig, når præstationen er svag, og at teste, om AI-systemer viser den samme slags overbevisning, der ses hos mennesker – med downstream-konsekvenser for tillid og praktisk udrulning.
Selvom den nye artikel modsiger Betteridges lov om overskrifter, er den alligevel titlen Do Code Models Suffer from the Dunning-Kruger Effect?. Selvom forfatterne påstår, at koden er udgivet for arbejdet, indeholder den aktuelle preprint ikke nogen detaljer om dette.
Metode
Studiet testede, hvor nøjagtigt kodnings-AI kunne dømme deres egne svar ved at give dem tusinder af multiple-choice programmerings-spørgsmål, med hvert spørgsmål tilhørende et bestemt sprogdomæne, fra Python og Java til Perl og COBOL:

Programmeringssprogdomæner brugt i studiet, sammen med antallet af multiple-choice-kodningsspørgsmål, der er sampet for hvert domæne.
Modellerne blev bedt om at vælge det korrekte valg og derefter estimere, hvor selvbevidst de var i deres valg, med deres faktiske præstation målt af, hvor ofte de fik svaret rigtigt – og deres selv-vurderede selvbevisning, der angav, hvor god de troede de var. En sammenligning af disse to målinger tillod forskerne at se, hvor selvbevisning og kompetence afveg.
For at måle, hvor selvbevidst modellerne syntes at være, brugte studiet to metoder: absolut selvbevisning og relativ selvbevisning. I den første blev modellen bedt om at give en score fra nul til en ved siden af hvert svar, med dens selvbevisning for et bestemt sprog defineret af gennemsnittet af disse score på tværs af spørgsmål i det sprog.
Den anden metode så på, hvor selvbevidst modellen var, når valg mellem to spørgsmål; for hvert par havde modellen at sige, hvilket de følte sig mere sikre på. Disse valg blev derefter vurderet ved hjælp af rangeringssystemer, der oprindeligt var designet til konkurrencedygtige spil, hvor hvert spørgsmål blev behandlet som en spiller i en kamp. De endelige score blev normaliseret og gennemsnitligt for hvert sprog for at give en relativ selvbevisningsscore.
To etablerede former for Dunning-Kruger-effekten undersøges i artiklen: en, der sporer, hvordan en enkelt model misvurderer sin egen præstation på tværs af forskellige domæner; og en anden, der sammenligner selvbevisningsniveauer mellem svagere og stærkere modeller.
Den første form, kaldet intra-participant DKE, ser på, om en enkelt model bliver mere overbevidst i sprog, hvor den opfører sig dårligt. Den anden, inter-participant DKE, spørger, om modeller, der opfører sig dårligere overall, også tenderer til at vurderer sig selv højere.
I begge tilfælde bruges afstanden mellem selvbevisning og faktisk præstation til at måle overbevisning, med større afstand i lav-præstations-indstillinger, der peger på DKE-lignende adfærd.
Resultater
Studiet tester for Dunning-Kruger-effekten på tværs af seks store sprogmodeller: Mistral; Phi-3; DeepSeek-Distill; Phi-4; GPT-0.1 og GPT-4o.
Hver model blev testet på multiple-choice programmerings-spørgsmål fra det offentligt tilgængelige CodeNet-datasæt, med 37 sprog repræsenteret for at afsløre, hvordan selvbevisning og nøjagtighed varierede på tværs af kendte og ukendte kodningsdomæner.
Den inter-model-analyse viser en tydelig Dunning-Kruger-mønster:

Faktisk versus opfattet præstation på tværs af seks kod-modeller, der viser, hvordan lavere-præsterende modeller som Mistral og Phi-3 viser høj selvbevisning, trods dårlig nøjagtighed, mens stærkere modeller som GPT-4o viser mere kalibreret eller endda underbevidst adfærd.
Modeller med lavere nøjagtighed, herunder Mistral og Phi-3, tenderede til at overvurdere deres egne evner, mens højere-præsterende systemer som GPT-4o viste selvbevisningsniveauer, der mere nøje matchede deres faktiske præstation, især når vurderet af relativ selvbevisning.
Resultaterne viser også, at de mest kompetente modeller kan vises at underestimere sig selv (et mønster, som absolut selvbevisningsscore ikke kan fange).
Resultaterne viser også, at den intra-model-analyse også støtter tilstedeværelsen af Dunning-Kruger-effekten. I resultattabellen ovenfor kan vi se, hvordan hver model opfører sig på tværs af forskellige programmeringssprog, arrangeret efter faktisk præstation.
I sprog, hvor modellerne opfører sig dårligt, især i sjældne eller lav-resurs-sprog som COBOL, Prolog og Ceylon, var deres selvbevisning mærkbart højere, end deres resultater berettigede. I kendte sprog som Python og JavaScript var deres selvbevisning mere i overensstemmelse med deres faktiske nøjagtighed, og nogle gange endda lavere.
Dette mønster optrådte i både absolut og relativ selvbevisning, hvilket antyder, at modeller er mindre bevidste om deres egne begrænsninger, når de opererer i ukendte kodningsdomæner.
At behandle modeller som deltagere introducerede nogle begrænsninger, da det lille antal modeller i spillet påvirker diversiteten; forskelle inden for en enkelt models output bliver ignoreret; og datafordelingen kan ikke reflektere den fra rigtige menneskelige deltagere.
For at kompensere for dette testede studiet tre alternative opsætninger: først blev hver model givet en distinkt persona; anden blev svarene sampet ved en højere temperatur for at skabe mere variation; tredje blev prompterne paraphraseret flere gange, med hver version behandlet som en separat deltagende:

Korrelation mellem overbevisning og faktisk præstation på tværs af forskellige eksperimentelle opsætninger, der viser, at Dunning-Kruger-mønsteret forbliver konsekvent under alle betingelser og er stærkest, når multiple diverse svar sampes fra samme model.
Resultattabellen ovenfor viser, hvor stærkt Dunning-Kruger-effekten manifesterer sig under disse betingelser, og forbliver til stede under alle tilfælde; og at DKE var mest udtalt, når multiple svar sampes fra samme model ved høj temperatur.
For bedre at forstå, hvordan opfattet præstation afviger fra faktisk præstation, sammenlignede studiet absolut og relativ selvbevisning ved at beregne, hvor meget hver model overvurderede sin egen evne (specifikt, forskellen mellem dens selvbevisningsscore og dens faktiske nøjagtighed), og derefter måle, hvordan denne overvurdering relaterede til modellens faktiske præstation:

Korrelation mellem overbevisning (målt som absolut minus relativ selvbevisning) og faktisk nøjagtighed på tværs af programmeringssprog og modeltyper, der viser, at større overvurdering konsekvent er forbundet med lavere præstation.
Resultattabellen ovenfor illustrerer, hvordan overvurdering relaterer til faktisk præstation, både på tværs af programmeringssprog og på tværs af modeller. I begge tilfælde kan vi se, at modeller med lavere nøjagtighed tenderer til at vise større overbevisning.
Yderligere viser resultaterne, at specialiserede modeller, der er trænet på smallere domæner, viser stærkere DKE-effekter end generalister:

Korrelation mellem overvurdering og faktisk præstation for basis-, enkelt-domæne- og multi-domæne-specialiserede modeller, der viser, at stærkere DKE-effekter optræder, når specialiseringen øges.
Ved at bruge MultiPL-E-datasættet på tværs af otte programmeringssprog fandt forfatterne, at enkelt-domæne-træning ledte til større overbevisning end multi-domæne- eller basis-opsætninger, hvilket antyder, at DKE forværres med øget specialisering.
Tests viste også, at modeller tenderer til at være mere overbevidste i sjældne programmeringssprog. På tværs af GitHub, IEEE og TIOBE-ranglister korrelerer sjældenhed stærkt med højere opfattet selvbevisning, med en toppunkt på 0,797:

Korrelation mellem model-overbevisning og sprog-sjældenhed, ved hjælp af tre popularitets-ranglister. Mindre almindelige sprog er forbundet med højere opfattet præstation.
Til sidst testede forfatterne, om Dunning-Kruger-effekten optræder i kode-generering, ved at evaluere modeller på MultiPL-E-datasættet på tværs af Ada, Dart, Prolog, Swift, C++, Python, C# og Elixir-sprogene.
Selvom effekten stadig var til stede, var den bemærkelsesværdigt svagere end i multiple-choice-spørgsmål-indstillinger, sandsynligvis på grund af den større sværhed ved at vurderer selvbevisning og korrekthed i åbne opgaver:

Korrelation mellem overvurdering og faktisk præstation i åben kode-generering, baseret på MultiPL-E-resultater på tværs af otte programmeringssprog.
I overvejelse af den stadig omdiskuterede forklaring på Dunning-Kruger-effekten, konkluderer forfatterne:
‘En mulig forklaring, der kan være fælles for både mennesker og AI-modeller, er den meta-kognitive forklaring, der fastslår, at vurdering af kvaliteten af en præstation af en færdighed er en afgørende del af at erhverve en færdighed.
‘Denne forklaring kan potentielt være testet eksperimentelt i AI-modeller med en kontrolleret studie af forskellige træningsstrategier og om de alle fører til samtidige forbedringer i præstation og i evnen til at vurderer kvaliteten af en præstation. Men denne studie er betydeligt ud over dette papers omfang, og vi overlader det til fremtidigt arbejde.’
Konklusion
Selv i dets native domæne kan Dunning-Kruger-effekten (som artiklen bemærker) være tilskrevet enten en statistisk eller kognitiv årsag. Hvis det skyldes en statistisk årsag, er anvendelsen af en hidtil unikt menneskelig syndrom til en maskinel læringssammenhæng faktisk ret berettiget.
Selvom forfatterne spekulerer over, at årsagen kunne være ‘kognitiv’ i begge tilfælde, ville det kræve en lidt mere metafysisk synsvinkel.
Måske det mest interessante fund i artiklen er omfanget, hvori flere kodnings-LLM’er tenderer til at dobbelt-gå i deres mindst favorable omstændigheder, dvs. ved at vise maksimal selvbevisning, når de beskæftiger sig med de sparsomme eller mindst kendte sprog – hvilket ville være en næsten umiddelbart selvdestruktiv strategi i en virkelig arbejdsmiljø.
* De programmeringssprog, der blev brugt, var Ada, Bash, C, C#, C++, COBOL, Ceylon, Clojure, D, Dart, Dash, Elixir, Erland, F#, Fortran, Go, Haskell, Java, JavaScript, Julia, Lisp, Kotlin, Lua, OCaml, Objective-C, PHP, Pascal, Perl, Prolog, Python, Racket, Ruby, Rust, Scala, Swift, TypeScript og Visual Basic.
Først offentliggjort onsdag, 8. oktober 2025












