Andersonin kulma

Koodaus-AI:lla on Dunning-Kruger-ilmiö

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa
ChatGPT-4o: 'A photorealistic panoramic image showing a small, humble robot inside a traveling funfair hall of mirrors. The robot looks at its own reflection in a warped mirror that shows a much larger, powerful version of itself. The setting includes vivid carnival lights, reflective surfaces, and a wide horizontal composition.' Plus Adobe Firefly.

Uusi tutkimus osoittaa, että koodaus-AI:lla, kuten ChatGPT:llä, on Dunning-Kruger-ilmiö, jossa ne toimivat usein luottavaisimmin, kun ne ovat vähiten päteviä. Kun ne kohtaavat tutkimattomia tai harvinaisia ohjelmointikieliä, ne väittävät korkeaa varmuutta, vaikka vastauksensa hajoavat. Tutkimus liittää mallien yli-itsevarmuuden sekä heikkoon suorituskykyyn että puutteellisiin koulutusdataan, herättäen uusia huolenaiheita siitä, mitä nämä järjestelmät todella tietävät siitä, mitä he eivät tiedä.

 

Kuka tahansa, joka on viettänyt edes kohtuullisen ajan Large Language Modelien kanssa faktapohjaisissa asioissa, tietää jo, että LLM:t antavat usein luottavaisen väärän vastauksen käyttäjän kysymykseen.

Yhdessä hallusinaatioiden kanssa, joiden syystä tämä tyhjä kerskuvaisuus ei ole 100 % selvä. Kesäisin julkaistu tutkimus osoittaa, että mallit antavat luottavaisia vastauksia jopa silloin, kun ne tietävät olevansa väärässä, esimerkiksi; toisaalta teoriat liittävät yli-itsevarmuuden arkkitehtuuriin ja muihin mahdollisuuksiin.

Mitä loppukäyttäjä voi olla varma, on se, että kokemus on erittäin turhauttavaa, koska me olemme koodattu uskomaan ihmisten arvioihin omista kyvyistään (ainakin siksi, että näissä tapauksissa on seurauksia, laillisia ja muuta; ja antropomorfisen transferenssin kaltainen ilmiö tekee meidät toistamaan tämän käyttäytymisen keskustelukonejärjestelmien kanssa.

Mutta LLM on vastuuton entiteetti, joka voi ja antaa ‘Whoops! Butterfingers…’ vastauksen, kun se on auttanut käyttäjää vahingossa tuhoamaan jotain tärkeää, tai ainakin haaskata iltapäivän ajan; olettaen, että se tunnustaa vastuunsa.

Pahemmaksi, tämä puutteellinen varovaisuus näyttää olevan mahdotonta ohjata pois, ainakin ChatGPT:llä, joka antaa runsaasti takuuja käyttäjälle sen ohjeiden pätevyydestä ja selittää virheitään vasta vahingon tapahtumisen jälkeen. Järjestelmän pysyvän muistin päivittäminen eikä toistuvien ohjeiden käyttö vaikuta asiaan.

Ihmisten voidaan olla yhtä itsepäisiä ja itsepetoksellisia – vaikka kukaan, joka erehtyisi yhtä syvästi ja usein, todennäköisesti olisi irtisanottu aikaisin. Tällaiset kärsivät “impostorin oireyhtymän” vastakohtana (jossa työntekijä pelkää olevansa ylennetty ylittäen kykynsä) – Dunning Kruger -ilmiö, jossa henkilö yliarvioi merkittävästi kykyään suorittaa tehtävä.

Inflaation kustannukset

Microsoftin uusi tutkimus tarkastelee Dunning-Kruger-ilmiön arvoa AI-väitetyn koodausarkkitehtuurin (kuten Redmondin oman Copilotin) tehokkaan suorituskyvyn kannalta, tutkimuksessa, joka on ensimmäinen, joka kohdistuu tähän LLM-alasektoriin.

Tutkimus analysoi, miten varmasti tällaiset koodin kirjoittavat AI:t arvioivat omia vastauksiaan verrattuna siihen, miten hyvin he todella suoriutuvat, kymmenissä ohjelmointikielissä. Tulokset osoittavat selkeän, ihmismäisen kaltaisen mallin: kun mallit olivat vähiten kykeneviä, he olivat eniten varmoja itsestään.

Ilmiö oli vahvin harvoissa tai vähäresurssisissa kielissä, joissa koulutusdata oli ohutta – mitä heikompi malli tai harvinaisempi kieli, sitä suurempi harhaluulo taidosta:

GPT-4o:n todellinen ja havaittu suorituskyky ohjelmointikielien mukaan, lajiteltu todellisen suorituskyvyn mukaan. Lähde: https://arxiv.org/pdf/2510.05457

GPT-4o:n todellinen ja havaittu suorituskyky ohjelmointikielien mukaan, lajiteltu todellisen suorituskyvyn mukaan. Lähde: https://arxiv.org/pdf/2510.05457

Tutkijat toteavat, että työ herättää uusia kysymyksiä siitä, kuinka paljon näitä työkaluja voidaan luottaa arvioimaan omaa tuotostaan, ja he sanovat:

‘Mallien luottamus ja suorituskyky eri ohjelmointikielissä osoittavat, että AI-mallit heijastelevat ihmisten yli-itsevarmuuden kaltaisia malleja, erityisesti tutkimattomissa tai vähäresurssisissa alueissa.

‘Kokeemme osoittavat, että vähemmän kykenevät mallit ja ne, jotka toimivat harvoissa ohjelmointikielissä, näyttävät vahvempaa DKE-kaltaista harhaa, mikä viittaa siihen, että harhan voimakkuus on suhteessa mallien kykyyn. Tämä vastaa ihmiskokeita harhasta.’

Tutkijat toteavat, että tämä tutkimuslinja on keino ymmärtää, miten mallien luottamus muuttuu epäluotettavaksi, kun suorituskyky on heikko, ja testata, näyttävätkö AI-järjestelmät samanlaisia yli-itsevarmuuden kaltaisia kuin ihmiset – jolla on vaikutuksia luottamukseen ja käytännön käyttöön.

Vaikka uusi tutkimus vastustaa Betteridgen otsikoiden lakia, se on kuitenkin otsikoitu Kärsivätkö koodimallit Dunning-Kruger-ilmiöstä?. Vaikka tutkijat toteavat, että koodi on julkaistu työstä, nykyinen preprint ei sisällä tietoja siitä.

Menetelmä

Tutkimus testasi, miten tarkasti koodaus-AI pystyy arvioimaan omia vastauksiaan antamalla niille tuhansia monivalintaisia ohjelmointikysymyksiä, joista jokainen kuului tiettyyn kieliin.

Ohjelmointikielten alueet, jotka käytettiin tutkimuksessa, sekä monivalintaisia koodauskysymyksiä, jotka otettiin näytteeksi kustakin alueesta.

Ohjelmointikielten alueet, jotka käytettiin tutkimuksessa, sekä monivalintaisia koodauskysymyksiä, jotka otettiin näytteeksi kustakin alueesta.

Mallit pyydettiin valitsemaan oikea vaihtoehto ja arvioimaan, miten varmat he olivat valinnastaan, ja heidän todellinen suorituskykynsä mitattiin siitä, miten usein he vastasivat oikein – ja heidän itsearvioitu luottamus osoitti, miten hyviä he uskoivat olevan. Vertaamalla näitä kahta mittaria tutkijat pystyivät näkemään, missä luottamus ja suorituskyky erosivat.

Tutkimuksessa käytettiin kahta menetelmää mitatakseen, miten varmat mallit näyttäytyivät:
Mallien itsearvioitu luottamus mitattiin kahdella tavalla: absoluuttinen luottamus ja suhteellinen luottamus. Ensimmäisessä malli pyydettiin antamaan pisteet nollasta yhteen jokaisen vastauksen kanssa, ja sen luottamus kussakin kielessä määriteltiin näiden pisteiden keskiarvona. Toisessa menetelmässä malli pyydettiin valitsemaan, kumpi kahdesta kysymyksestä se oli varmempi, ja nämä valinnat pisteytettiin kilpailupelien sijoitusjärjestelmiin perustuen. Lopulliset pisteet normalisoitiin ja keskiarvoitiin kussakin kielessä antamaan suhteellisen luottamusarvon.

Kaksi vakiintunutta Dunning-Kruger-ilmiön muotoa tarkastellaan tutkimuksessa: yksi, joka seuraa yksittäisen mallin virhettä eri alueilla, ja toinen, joka vertaa luottamustasoja heikkoompia ja vahvempia malleja.

Ensimmäinen muoto, intra-participant DKE, tarkastelee, muuttuuko yksittäinen malli yli-itsevarmaksi kieliin, joissa se suoriutuu huonosti. Toinen, inter-participant DKE, kysyy, ovatko mallit, jotka suoriutuvat huonommin, myös yli-itsevarmempia.

Molemmissa tapauksissa luottamuksen ja todellisen suorituskyvyn välinen ero mitattiin yli-itsevarmuuden määrän määrittämiseksi, ja suuremmat erot heikkosuorituskyvyn asetuksissa osoittivat DKE-kaltaista käyttäytymistä.

Tulokset

Tutkimus testasi Dunning-Kruger-ilmiön kuudessa suuressa kielen mallissa: Mistral; Phi-3; DeepSeek-Distill; Phi-4; GPT-0.1, ja GPT-4o.

Kunkin mallin testattiin monivalintaisilla ohjelmointikysymyksillä CodeNet-aineistosta, jossa edustettiin 37 kieltä, paljastaakseen, miten luottamus ja tarkkuus vaihtelevat tuttuja ja epätuttuja ohjelmointikieliä.

Inter-mallianalyysi osoittaa selkeän Dunning-Kruger-kuvion:

Todellinen ja havaittu suorituskyky kuudessa koodimallissa, osoittaen, miten heikommin suoriutuvat mallit, kuten Mistral ja Phi-3, näyttävät korkeaa luottamusta huolimatta heikosta tarkkuudesta, kun taas vahvemmat mallit, kuten GPT-4o, näyttävät luottamustasoja, jotka ovat lähempänä todellista suorituskykyä, erityisesti suhteellisen luottamuksen osalta.

Todellinen ja havaittu suorituskyky kuudessa koodimallissa, osoittaen, miten heikommin suoriutuvat mallit, kuten Mistral ja Phi-3, näyttävät korkeaa luottamusta huolimatta heikosta tarkkuudesta, kun taas vahvemmat mallit, kuten GPT-4o, näyttävät luottamustasoja, jotka ovat lähempänä todellista suorituskykyä, erityisesti suhteellisen luottamuksen osalta.

Mallit, joilla oli alempi tarkkuus, kuten Mistral ja Phi-3, olivat taipuvaisia yliarvioimaan omia kykyjään, kun taas paremmin suoriutuvat järjestelmät, kuten GPT-4o, näyttivät luottamustasoja, jotka vastasivat paremmin todellista suorituskykyä, erityisesti suhteellisen luottamuksen osalta.

Tulokset osoittavat myös, että kyvykkäimmät mallit voivat joskus aliarvioida itseään (kuva, jota absoluuttiset luottamusarvot eivät voi havaita).

Tulokset osoittavat myös, että intra-mallianalyysi tukee Dunning-Kruger-ilmiön olemassaoloa. Tuloksissa, joita esitetään artikkelin alussa, nähdään, miten kunkin mallin suorituskyky vaihtelee eri ohjelmointikielissä, lajiteltuna todellisen suorituskyvyn mukaan.

Kielissä, joissa mallit suoriutuivat huonosti, erityisesti harvoissa tai vähäresurssisissa, kuten COBOL, Prolog ja Ceylon, heidän luottamuksensa oli huomattavasti korkeampi kuin heidän tuloksensa oikeuttivat. Tunnetuimmissa kielissä, kuten Python ja JavaScript, heidän luottamuksensa vastasi paremmin heidän todellista tarkkuuttaan, ja joskus jopa alitti sen.

Tämä kuvaus näkyy sekä absoluuttisissa että suhteellisissa luottamusarvoissa, osoittaen, että malleilla on vähemmän tietoa omista rajoituksistaan, kun ne toimivat tutkimattomissa ohjelmointikielissä.

Mallien käsittely osallistujina toi joitakin rajoituksia, koska mallien määrä vaikuttaa monimuotoisuuteen; eroja yhden mallin tuloksissa on jätetty huomiotta; ja datan jakautuminen saattaa ei heijasta ihmisten osallistujien jakautumista.

Sen sijaan tutkimus testasi kolmea vaihtoehtoista asetelmaa: ensinnäkin, kullekin mallille annettiin erillinen persoona; toiseksi, vastauksia otettiin näytteeksi korkeammassa lämpötilassa luomaan enemmän vaihtelua; kolmanneksi, ohjeita muunnettiin useita kertoja, ja kunkin version käsittely erillisenä osallistujana:

Yhteys yli-itsevarmuuden ja todellisen suorituskyvyn välillä eri kokeellisissa asetelmissa, osoittaen, että Dunning-Kruger-ilmiö säilyy kaikissa olosuhteissa ja on vahvin, kun useita erilaisia vastauksia otetaan näytteeksi samasta mallista korkeassa lämpötilassa.

Yhteys yli-itsevarmuuden ja todellisen suorituskyvyn välillä eri kokeellisissa asetelmissa, osoittaen, että Dunning-Kruger-ilmiö säilyy kaikissa olosuhteissa ja on vahvin, kun useita erilaisia vastauksia otetaan näytteeksi samasta mallista korkeassa lämpötilassa.

Tulokset osoittavat, miten vahvasti Dunning-Kruger-ilmiö ilmenee näissä olosuhteissa, ja se säilyy jokaisessa tapauksessa; ja DKE on vahvin, kun useita erilaisia vastauksia otetaan näytteeksi samasta mallista korkeassa lämpötilassa.

Ymmärtääkseen paremmin, miten havaittu suorituskyky poikkeaa todellisesta suorituskyvystä, tutkimus vertasi absoluuttisia ja suhteellisia luottamusarvoja laskemalla, kuinka paljon kunkin mallin yliarvioi omaa kykyään (erityisesti eroa sen luottamusarvosta ja todellisesta tarkkuudesta), ja miten tämä yliarviointi liittyi mallin todelliseen suorituskykyyn:

Yhteys yli-itsevarmuuden (mittaamalla absoluuttinen - suhteellinen luottamus) ja todellisen tarkkuuden välillä ohjelmointikielissä ja mallityypeissä, osoittaen, että suurempi yliarviointi on johdonmukaisesti liitetty heikkoon suorituskykyyn.

Yhteys yli-itsevarmuuden (mittaamalla absoluuttinen – suhteellinen luottamus) ja todellisen tarkkuuden välillä ohjelmointikielissä ja mallityypeissä, osoittaen, että suurempi yliarviointi on johdonmukaisesti liitetty heikkoon suorituskykyyn.

Tulokset osoittavat, että mallit, joilla on alempi tarkkuus, näyttävät suurempaa yli-itsevarmuutta.

Lisäksi erikoistuneet mallit, jotka on koulutettu kapeammassa alueessa, näyttävät vahvempaa DKE-vaikutusta kuin yleiskäyttöiset:

Yhteys yliarvioinnin ja todellisen suorituskyvyn välillä perus-, yksittäisen alan ja monialaisen erikoistuneiden mallien osalta, osoittaen vahvempaa DKE-vaikutusta, mitä enemmän erikoistumista on.

Yhteys yliarvioinnin ja todellisen suorituskyvyn välillä perus-, yksittäisen alan ja monialaisen erikoistuneiden mallien osalta, osoittaen vahvempaa DKE-vaikutusta, mitä enemmän erikoistumista on.

Käyttäen MultiPL-E-aineistoa kahdeksassa ohjelmointikielessä, tutkijat löysivät, että yksittäisen alan koulutus johti suurempaan yli-itsevarmuuteen kuin monialainen tai perusasettelu, osoittaen, että DKE pahenee erikoistumisen lisääntyessä.

Testit osoittivat myös, että mallit ovat yleensä yli-itsevarmempia harvoissa ohjelmointikielissä. GitHubin, IEEE:n ja TIOBE:n listoilla harvinaisuus korreloi vahvasti korkeamman havaitun suorituskyvyn kanssa, huipussa 0,797:

Yhteys mallien yli-itsevarmuuden ja kielen harvinaisuuden välillä, käyttäen kolmea suosiollisuusluokitusta. Vähemmän yleiset kielet liittyvät korkeampaan havaittuun suorituskykyyn.

Yhteys mallien yli-itsevarmuuden ja kielen harvinaisuuden välillä, käyttäen kolmea suosiollisuusluokitusta. Vähemmän yleiset kielet liittyvät korkeampaan havaittuun suorituskykyyn.

Lopulta tutkijat testasivat, näkyykö Dunning-Kruger-ilmiö koodin generoimisessa, arvioimalla malleja MultiPL-E-aineistossa kahdeksassa ohjelmointikielessä.

Vaikka ilmiö oli edelleen läsnä, se oli huomattavasti heikompi kuin monivalintaisissa kysymyksissä, mikä liittyy todennäköisesti siihen, että on vaikeampaa arvioida luottamusta ja oikein tekemistä avoimissa tehtävissä:

Yhteys yliarvioinnin ja todellisen suorituskyvyn välillä avoimessa koodin generoimisessa, perustuen MultiPL-E-tuloksiin kahdeksassa kielessä.

Yhteys yliarvioinnin ja todellisen suorituskyvyn välillä avoimessa koodin generoimisessa, perustuen MultiPL-E-tuloksiin kahdeksassa kielessä.

Tutkijat päättävät:

‘Yksi mahdollinen selitys, joka voi olla yhteinen sekä ihmisille että AI-malleille, on meta-kognitiivinen selitys, joka toteaa, että arvioida suorituksen laatua on tärkeä osa taitojen hankkimista.

‘Tätä selitystä voidaan potentiaalisesti testata kokeellisesti AI-malleissa, joissa tutkitaan eri koulutusstrategioita ja miten ne vaikuttavat suorituskykyyn ja kykyyn arvioida suorituksen laatua. Tämä tutkimus on kuitenkin merkittävästi laajempi kuin tämä tutkimus, ja jätämme sen tulevia tutkimuksia varten.’

Johtopäätös

Vaikka Dunning-Kruger-ilmiö (kuten tutkimus toteaa) voi olla joko tilastollinen tai kognitiivinen syy, sen soveltaminen ainoastaan ihmisten kontekstista koneoppimiseen on validi.

Tutkijat spekuloi, että syy voi olla ‘kognitiivinen’ molemmissa tapauksissa, mikä vaatisi hieman metafyysisempää näkökulmaa.

Ehkä mielenkiintoisin löytö tutkimuksessa on se, miten useat koodaus-LLM:t taipuvat kaksinkertaistamaan heikoimmissa olosuhteissaan, eli osoittamalla maksimaalista luottamusta, kun he kohtaavat harvinaisia tai vähäresurssisia kieliä – mikä olisi lähes välittömästi itsestään tuhoava strategia todellisessa työmaailmassa.

 

* Ohjelmointikielet, joita käytettiin, olivat Ada, Bash, C, C#, C++, COBOL, Ceylon, Clojure, D, Dart, Dash, Elixir, Erland, F#, Fortran, Go, Haskell, Java, JavaScript, Julia, Lisp, Kotlin, Lua, OCaml, Objective-C, PHP, Pascal, Perl, Prolog, Python, Racket, Ruby, Rust, Scala, Swift, TypeScript ja Visual Basic.

Julkaistu ensimmäisen kerran keskiviikkona, 8. lokakuuta 2025

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai