AI-mallit ja alustat

Kun AI-benchmarkit opettavat malleja valehtelemaan

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

AI-hallusinaatio — jolloin järjestelmä tuottaa vastauksia, jotka kuulostavat oikeilta, mutta ovat todella väärin — on yksi haasteellisimmista ongelmista tekoälyssä. Jopa tänä päivänä kehittyneimmät mallit, kuten DeepSeek-V3, Llama ja OpenAI:n uusimmat julkaisut, tuottavat edelleen epätarkkaa tietoa suurella varmuudella. Alueilla, kuten terveydenhuollossa tai oikeudessa, tällaiset virheet voivat johtaa vakaviin seurauksiin.

Perinteisesti hallusinaatiot on nähty suurten kielen mallien koulutuksen sivutuotteena: ne oppivat ennustamaan seuraavan todennäköisimmän sanan ilman varmistamista, onko tieto tosi. Mutta uusi tutkimus osoittaa, että ongelma ei rajoitu koulutukseen. AI-suorituskyvyn testaamiseen ja vertailuun käytettävät benchmarkit voivat itse asiassa vahvistaa harhaanjohtavaa käyttäytymistä, palkitsemalla vastauksia, jotka kuulostavat vakuuttavilta, eivätkä niinkään oikeilta.

Tämä näkökulman muutos muuttaa ongelman luonnetta. Jos mallit on koulutettu miellyttämään testiä eikä kertomaan totuutta, hallusinaatiot eivät ole tahattomia virheitä, vaan opittuja strategioita. Jotta voimme ymmärtää, miksi tämä tapahtuu, meidän on tarkasteltava, miksi AI-mallit valitsevat arvauksen sijaan tunnustamisen, etteivät ne tiedä?

Miksi AI-mallit arvaavat

Jotta voimme ymmärtää, miksi AI-mallit usein arvaavat sen sijaan, että tunnustavat etteivät ne tiedä, tarkastellaan opiskelijaa, joka kohtaa haasteellisen kokeen kysymyksen. Opiskelijalla on kaksi vaihtoehtoa: jättää vastaus tyhjäksi ja saada nolla pistettä, tai tehdä koulutettu arvaus, joka saattaa ansaita joitain pisteitä. Järkeen tässä tapauksessa arvaaminen näyttää paremmalta valinnalta, koska siinä on ainakin mahdollisuus olla oikein.

AI-mallit kohtaavat saman tilanteen arvioinnin aikana. Useimmat benchmarkit käyttävät binääristä pisteytysjärjestelmää: oikeat vastaukset ansaitsevat pisteitä, kun taas väärät tai epävarmat vastaukset eivät ansaitse mitään. Jos malli kysyy “Mikä on tutkijan syntymäpäivä?” ja se todella ei tiedä, vastaus “En tiedä” merkitsee epäonnistumista. Keksimällä päivämäärä, on kuitenkin mahdollisuus olla oikein — ja vaikka se on väärin, järjestelmä ei rangaista luotettavaa arvausta enempää kuin hiljaisuuttakaan.

Tämä dynamiikka selittää, miksi hallusinaatiot säilyvät jatkuvasti, vaikka niiden poistamiseksi on tehty laaja tutkimus. Mallit eivät käyttäydy väärin; ne seuraavat arviointiin sisäänrakennettuja kannustimia. Ne oppivat, että luotettavan kuuloiset lausumat ovat paras tapa maksimoida heidän pisteensä, vaikka vastaus on väärä. Tämän seurauksena mallit pyrkivät antamaan auktoritaarisia lausuntoja — oikein tai väärin.

AI-vääränäkökulman matemaattinen perusta

Tutkimus osoittaa, että hallusinaatiot johtuvat kielen mallien oppimisen matemaattisista perusteista. Jopa jos malli olisi koulutettu ainoastaan täysin tarkoilla tiedoilla, sen tilastolliset tavoitteet johtaisivat silti virheisiin. Tämä johtuu siitä, että oikean vastauksen tuottaminen on perustavanlaatuisesti vaikeampaa kuin tunnistaa, onko vastaus kelvollinen.

Tämä selittää, miksi mallit usein epäonnistuvat tosiasiassa, joilla ei ole selkeää mallia, kuten syntymäpäivät tai muut yksilölliset yksityiskohdat. Matemaattinen analyysi osoittaa, että hallusinaatioiden määrä näissä tapauksissa on vähintään yhtä suuri kuin se osa tosiasioita, jotka esiintyvät vain kerran koulutusaineistossa. Toisin sanoen, mitä harvinaisempi tieto on, sitä todennäköisemmin malli kamppailee sen kanssa.

Ongelma ei rajoitu harviin tosiasioihin. Rakenteelliset rajoitukset, kuten mallin kapasiteetin rajoitukset tai arkkitehtuuri, tuottavat systemaattisia virheitä. Esimerkiksi aiemmat mallit, joilla oli hyvin lyhyt kontekstien ikkuna, epäonnistuivat jatkuvasti tehtävissä, jotka vaativat pitkän aikavälin päättelyä. Nämä virheet eivät olleet satunnaisia viiveitä, vaan ennustettavissa olevia tuloksia mallin matemaattisesta kehyksestä.

Miksi jälkikoulutus ei ratkaise ongelmaa

Kun AI-malli on koulutettu massiivisilla tekstiaineistoilla, se menee yleensä hienosäätöön, jotta sen tulokset olisivat hyödyllisempiä ja vähemmän haitallisia. Mutta tämä prosessi kohtaa saman perusongelman, joka aiheuttaa hallusinaatiot ensinnäkin; miten mallit arvioidaan.

Yleisimmät hienosäätömenetelmät, kuten vahvistusoppiminen ihmisten palautteen perusteella, perustuvat edelleen binäärisiin benchmarkkeihin. Nämä benchmarkit palkitsevat malleja luotettavista vastauksista, eivätkä tarjoa mitään hyväksyntää, kun malli tunnustaa, ettei se tiedä. Tämän seurauksena järjestelmä, joka aina vastaa varmuudella, vaikka se on väärä, voi suorittaa paremmin kuin sellainen, joka rehellisesti tunnustaa epävarmuutensa.

Tutkijat kutsuvat tätä epävarmuuden rangaistusongelmaksi. Jopa edistyneet menetelmät hallusinaatioiden havaitsemiseksi tai vähentämiseksi kamppailevat, kun taustalla olevat benchmarkit jatkavat luotettavuuden suosimista. Toisin sanoen, riippumatta siitä, kuinka kehittyneitä korjauksia on, niin kauan kuin arviointijärjestelmät palkitsevat luotettavia arvauksia, mallit suosivat väärää mutta varmaa vastausta eikä rehellistä tunnustamista epävarmuudesta.

Edistymisen illusio

Johtajan luettelot, joita jaetaan laajasti AI-yhteisössä, lisäävät tätä ongelmaa. Benchmarkit, kuten MMLU, GPQA ja SWE-bench, hallitsevat tutkimusartikkeleita ja tuotejulkaisuja. Yritykset korostavat heidän pisteitään osoittaakseen nopeaa edistystä. Kuitenkin, kuten raportti toteaa, nämä benchmarkit itse asiassa kannustavat hallusinaatioita.

Malli, joka rehellisesti sanoo “En tiedä”, voi olla turvallisempi todellisissa tilanteissa, mutta se sijoittuu alemmalle tasolle johtajan luettelossa. Sen sijaan malli, joka keksii vakuuttavia mutta väärää tietoa, saa paremman pisteytyksen. Kun omaksuminen, rahoitus ja maine riippuvat johtajan luetteloiden sijoituksesta, edistymisen suunta muuttuu. Julkisuus näkee jatkuvan parantumisen kertomuksen, mutta alla, mallit koulutetaan pettämään.

Miksi rehellinen epävarmuus on tärkeää tekoälyssä

Hallusinaatiot eivät ole vain tutkimuksen haaste; ne johtavat todellisiin seuraamuksiin. Terveydenhuollossa malli, joka keksii lääkkeen vuorovaikutuksen, voi johtaa lääkäreiden harhaanjohtamiseen. Koulutuksessa malli, joka keksii historiallisia tosiasioita, voi harhaanjohtaa opiskelijoita. Journalismissa chatbotti, joka tuottaa vääriä mutta vakuuttavia sitaatteja, voi levittää disinformaatiota. Nämä riskit ovat jo näkyvissä. Stanfordin AI-indeksi 2025 raportoi, että benchmarkit, jotka on suunniteltu mittaamaan hallusinaatioita, “eivät ole saavuttaneet jalansijaa”, vaikka tekoälyn omaksuminen kiihtyy. Samaan aikaan benchmarkit, jotka hallitsevat johtajan luetteloita ja palkitsevat luotettavia mutta epäluotettavia vastauksia, jatkavat edistymisen suunnan määräämistä.

Nämä löydökset korostavat sekä haasteen että mahdollisuuden. Tutkimalla hallusinaatioiden matemaattisia juuria tutkijat ovat tunnistaneet selkeät suunnat luotettavampien tekoälyjärjestelmien kehittämiseksi. Avain on lopettaa epävarmuuden käsittely virheenä ja tunnustaa se olennaiseksi kyvyksi, jota tulisi mitata ja palkita.

Tämä näkökulman muutos on vaikutuksia laajemmin kuin pelkästään hallusinaatioiden vähentäminen. Tekoälyjärjestelmät, jotka voivat tarkasti arvioida ja viestittää oman tietämyksensä rajoitukset, olisivat sovellettavampia korkean panoksen sovelluksiin, joissa yli-itsevarmuus kantaa vakavia riskejä. Lääketieteellinen diagnosointi, oikeudellinen analyysi ja tieteellinen tutkimus vaativat kykyä erottaa varman tiedon ja perustellun spekulaation välillä.

Uudelleenarviointi rehelliselle tekoälylle

Nämä löydökset korostavat, että luotettavamman tekoälynbuiden rakentaminen edellyttää uudelleenarvioimista, miten mitataan tekoälyn kykyä. Sen sijaan, että riippuisimme yksinkertaisista oikein/väärin -pisteistä, arviointikehykset tulisi palkita malleja siitä, että ne ilmaisevat epävarmuutta asianmukaisesti. Tämä tarkoittaa selkeiden luottamusrajien ja vastaavien pisteytyskaavojen määrittelyä benchmark-ohjeissa.

Yksi lupaava lähestymistapa on luoda eksplisiittisiä luottamuskohteita, jotka määrittävät, milloin malleja tulisi vastata ja milloin ne tulisi pidättäytyä vastaamasta. Esimerkiksi ohjeet voivat määrätä, että vastauksia tulisi antaa vain, kun luottamus ylittää tietyn kynnyksen, ja pisteytys on sovitettu vastaavasti. Tässä asetelmassa epävarmuus ei ole heikkous, vaan arvokas osa vastuullista käyttäytymistä.

Avain on tehdä luottamusvaatimukset selkeäksi eikä implisiittisiä. Nykyiset benchmarkit luovat piileviä rangaistuksia epävarmuudelle, joita mallit oppivat välttämään. Eksplisiittiset luottamuskohteet mahdollistaisivat mallien optimoinnin tosiasiallisesti halutulle käyttäytymiselle: tarkat vastaukset, kun luottamus on korkea, ja rehelliset tunnustukset epävarmuudesta, kun tietoa puuttuu.

Pohjimmiltaan

Tekoälyhallusinaatiot eivät ole satunnaisia virheitä — ne vahvistetaan itse benchmarkien avulla, joita käytetään edistymisen mittaamiseen. Palkitsemalla luotettavia arvauksia eikä rehellistä epävarmuutta, nykyiset arviointijärjestelmät ajavat malleja pettämään eikä luotettavuutta. Jos haluamme tekoälyä, jota voidaan luottaa korkean panoksen aloilla, kuten terveydenhuollossa, oikeudessa ja tieteessä, meidän on uudelleenarvioitava, miten testaamme ja palkitsemme niitä. Edistys askel on mitattava ei vain tarkkuuden, vaan myös kyvyn tunnustaa ja myöntää, mitä malli ei tiedä.

Tohtori Tehseen Zia on COMSATS University Islamabadin apulaisprofessori, joka on suorittanut AI-tutkinnon Wienin Teknillisen yliopiston, Itävallassa. Erityisalanaan ovat Tekoäly, Konenäkö, Data Science ja Machine Learning, ja hän on tehnyt merkittäviä töitä julkaisemalla artikkeleita arvostetuissa tieteellisissä lehdissä. Tohtori Tehseen on myös johtanut useita teollisuusprojekteja pää tutkijana ja toiminut AI-konsulttina.