Andersonin kulma
‘Zen’ -menetelmä estämään kielen mallien hallucinoituminen

Kun ChatGPT:lle annetaan tehtäväksi faktantarkistaa satunnainen vastaus ennen varsinaisen ongelman ratkaisemista, se ajattelee kovemmin ja saa useammin oikean vastauksen – vaikka aiempi “satunnainen” vastaus ei liity millään tavoin todelliseen kysymykseen.
Kiinasta on julkaistu mielenkiintoinen uusi tutkimus, jossa on kehitetty erittäin edullinen menetelmä estämään kielen malleja, kuten ChatGPT:tä, hallucinoitumasta ja parantamaan vastausten laatua: malli pyydetään tarkistamaan vastaus täysin sivulliseen kysymykseen:

Esimerkki sivullisesta kysymyksestä, joka voi ‘vapauttaa’ LLM:n mielen ja auttaa sitä keskittymään (oikeaan) myöhempään kysymykseen. Lähde
Tämä zen-isku on erittäin halpa tapa parantaa suorituskykyä verrattuna muihin, monimutkaisempiin menetelmiin, kuten hienosäätöön, ohjelmointiin ja rinnakkaislaskentaan, ja se toimii sekä avoimissa että suljetuissa malleissa, mikä osoittaa, että kyseessä on perustavanlaatuinen piirre useissa LLM-arkkitehtuureissa (eikä haavoittuvaa ominaisuutta, joka liittyy tiettyyn koulutusmateriaaliin tai -menetelmään).
Tutkijat kuvaavat mahdollisia kustannussäästöjä, joita voidaan saavuttaa parantamalla tulosta tällä spartaalaisella tavalla*:
‘Toteuttaaksesi minimoiden aiemman tiedon, VF:n tarvitsee vain antaa satunnainen/triviaali vastaus ohjelmointikyselyssä. Varmistusprosessi osoittautuu tuottavan vähemmän tulostekstejä kuin tavallinen CoT-polku, [joskus] jopa ilman eksplisiittistä verifioitumisprosessia, joten [vaaditaan] erittäin [vähän] lisää testiaikaa laskentaa.’
Kokeissa tämä lähestymistapa – jota kutsutaan Verification-First (VF) -menetelmäksi – pystyi parantamaan vastauksia monissa tehtävissä, mukaan lukien matemaattinen päättely, sekä avoimilla että kaupallisilla alustoilla.
Osa siitä, miksi tämä tekniikka toimii, voi olla perusteltu siinä, miten kielen mallit omaksuvat ja soveltavat ihmisen psykologian trendejä, joten suora kysymys saa mallin “puolustautumaan” ja “hermostumaan”, kun taas pyynnössä tarkistaa toisen työn tulosta ei käynnistä näitä “selviytymisen vaistoja”.
Perusidea on, että vastauksen tarkistaminen vaatii vähemmän vaivaa kuin vastauksen luominen alusta alkaen, ja se voi laukaista erilaisen päättelypolun, joka täydentää standardia chain-of-thought-menetelmää.
Ohjelmointi mallille antaa kritiikkiä annetusta vastauksesta (ts. vastaus, johon malli ei ole osallistunut luomisessa) voi myös aktivoida kriittisen ajattelun, joka auttaa välttämään ylipeittävän luottamusta mallin omiin ensimmäisiin vaikutelmiin.
Työ kuvaa prosessia käänteisen päättelyn polkuna:

Aloittaminen ehdotetusta vastauksesta ja päättely taaksepäin kohti kysymystä voi paljastaa lyhytkäytäviä tai oivalluksia, jotka ovat vaikeampia löytää, kun päättely suoritetaan eteenpäin ongelmasta.
Tutkijat ovat myös konkretisoineet keskeisen käsitteen Iter-VF:ksi, joka on aikajärjestyksessä toistuva menetelmä, joka parantaa vastauksia iteraatiolla, välttäen virheiden kertymisen ongelman, joka on yleinen itsekorjaavissa strategioissa, joita usein käytetään LLM-arkkitehtuureissa.
Uusi tutkimus on nimeltään Asking LLMs to Verify First is Almost Free Lunch, ja se on tehty kahden tutkijan toimesta Tsinghuan yliopiston sähkötekniikan osastolla Pekingissä.
Menetelmä
Tutkimuksen keskeinen idea on kääntää yleinen päättelyvirta kielen malleissa. Sen sijaan, että malli pyydetään ratkaisemaan ongelmaa alusta alkaen, sille annetaan ehdotettu vastaus (usein väärä tai satunnainen) ja pyydetään tarkistamaan, onko se järkevää.
Tämä ohjelmoi mallin päättämään vastakkaiseen suuntaan, työskentelemään taaksepäin ehdotetusta vastauksesta kohti kysymystä. Kun tarkistus on valmis, malli jatkaa ratkaisemalla alkuperäisen ongelman normaalisti.
Tämä käännös, tutkimus väittää, vähentää huolimattomia virheitä ja rohkaisee enemmän reflektiivistä päättelyä, joka auttaa LLM:ää paljastamaan piilossa olevan rakenteen ja välttämään harhaanjohtavia oletuksia.
Kuten esimerkeissä näkyy, ohjelmointi mallille tarkistamaan selvästi väärä arvaus, kuten ’10’, voi auttaa sitä toipumaan virheellisestä logiikasta ja suoriutumaan paremmin kuin standardi chain-of-thought-ohjelmointi:

Ohjelmointi mallille tarkistamaan arvattu vastaus ensin auttaa sitä havaitsemaan ristiriitaisuuksia ja osallistumaan ongelmaan tarkemmin.
Monissa todellisissa ongelmissa ei ole helppoa antaa mallille arvaus, jota se voi tarkistaa, erityisesti kun tehtävä on avoin, kuten koodin kirjoittaminen tai API-kutsu. Siksi menetelmä antaa mallille ensin parhaan vastauksensa normaalisti ja sitten syöttää sen takaisin Verification-First-muotoon. Tällä tavoin malli tarkistaa ja parantaa omaa tulostaan:

Kun malli pyydetään tarkistamaan omaa aiempaa tulostaan, se havaitsee virheen logiikassaan ja kirjoittaa uudelleen ratkaisun oikein.
Tämä lähestymistapa muodostaa mainitun Iter-VF:n. Malli toistaa tämän syklin, parantaen vastaustaan kerran, ilman uudelleenkoulutusta tai erityistä työkalua. Toisin kuin muut itsekorjaavat strategiat, jotka voivat kertyä aiempaan ajatteluun ja vaarantaa mallin sekavuuden, Iter-VF käsittelee aina vain viimeisintä vastausta kerran, mikä auttaa pitämään sen päättelyn selkeänä.
Data ja testit
Tutkijat arvioivat menetelmää neljässä alueessa: yleisissä päättelytehtävissä, joissa VF:lle annetaan satunnainen arvaus; aikakriittisissä tehtävissä, joissa Iter-VF verrataan muihin skaalautumismenetelmiin; avoinna ongelmilla, kuten koodauksessa ja API-kutsuissa, joissa VF käyttää mallin omaa aiempaa vastausta; ja kaupallisissa, suljetuissa LLM-malleissa, joissa sisäiset päättelyvaiheet eivät ole saatavilla.
Tutkimuksessa käytettiin kolmea päättelybenchmarkia: GSM8K ja MATH500 matemaattisille ongelmille; ja GPQA-Diamond graduate-tason tieteellisille kysymyksille.
Jokaisessa tapauksessa mallille annettiin joko satunnainen arvaus, kuten ‘1’ numeerisille vastauksille; tai satunnaisesti sekoitettu monivalintavaihtoehto, aloituspisteenä tarkistamiselle. Ei ollut erityistä säätöä tai aiempaa tietoa, ja vertailukohtana oli standardi zero-shot chain-of-thought-ohjelmointi.
Kokeet suoritettiin Qwen2.5 ja Llama3 -ohjelmointimalleilla, 1B:stä 72B:een (parametreja) kokoisilla malleilla. Qwen-malleja käytettiin Qwen2.5-1.5B-Instruct, Qwen2.5-3B-Instruct, Qwen2.5-14B-Instruct ja Qwen2.5-72B-Instruct. Llama3-variantteja olivat Llama3.2-1B-Instruct, Llama3.2-3B-Instruct, Llama3.1-8B-Instruct ja Llama3.3-70B-Instruct.
Kuten alla näkyy, Verification-First-ohjelmoinnin parannus säilyi vakaana kaiken mallikoon yli, selvät voitot näkyvät jo 1B parametrissa ja jatkuvat 72B:een saakka:

Kaiken Qwen2.5- ja Llama3-malliperheen yli Verification-First-ohjelmointi ylitti standardin chain-of-thought-ohjelmoinnin GSM8K-, MATH500- ja GPQA-Diamond-benchmarkissa.
Ilmiön voimakkuus oli vahvin laskennallisten matemaattisten benchmarkien, kuten GSM8K ja MATH500, kohdalla, joissa tarkistaminen väärää vastausta johti parempaan päättelyyn kuin yrittäminen ratkaista ongelma alusta alkaen. GPQA-Diamondissa, joka riippuu enemmän tallennetusta tietämisestä kuin deduktiivisesta rakenteesta, etu oli pienempi mutta johdonmukainen.
Verification-Firstin laskennallinen kustannus oli kohtuullinen: alla olevassa taulukossa voidaan nähdä, että verifioimisvaiheen lisääminen lisäsi noin 20-50 % enemmän tulostekstejä verrattuna standardiin chain-of-thought-ohjelmointiin:

Keskimääräinen tulostekstien määrä kunkin ohjelmointimenetelmän yhteydessä GSM8K-, MATH500- ja GPQA-benchmarkissa.
Vaikka tämä kustannus oli kohtuullinen, se säilyi kuitenkin selvästi alempina kuin strategioiden, jotka vaativat useita näytteitä tai rekursiivista suunnittelua.
Alle olevassa kaaviossa voidaan nähdä, miten herkkä menetelmä on arvattujen vastausten laadulle. Yllättäen, jopa kun arvaus on triviaali (‘1’), epätodennäköinen (‘2025’) tai satunnainen monivalintavaihtoehto, Verification-First ylittää standardin ohjelmoinnin:

Tarkkuuden parannukset Verification-First-ohjelmoinnista, kun malli saa tarkistettavaksi trivialeja, epätodennäköisiä tai oikein arvattuja vastauksia GSM8K-, MATH500- ja GPQA-benchmarkissa.
Kuten odotettiin, tarkkuus hyppää jopa korkeammaksi, kun arvaus osuu oikein; mutta menetelmä toimi hyvin riippumatta siitä, oliko arvaus oikein vai ei, mikä viittaa siihen, että parannukset eivät johtuneet itse arvauksen tiedosta, vaan yksinkertaisesti verifioimisaktista itsessään.
Iter-VF verrattiin myös neljään testiaikaisiin skaalautumisstrategiaan, jotka toimivat ilman uudelleenkoulutusta tai tehtävän mukaan sopeutumista. Self-Correction -strategiassa malli pyydettiin korjaamaan vastauksiaan heijastamalla aiempia päättelyvaiheita; PHP:ssä aiemmat vastaukset liitettiin syötteeseen kontekstihintoina, vaikka ei annettu ohjeita siitä, miten niitä käytetään.
Lisäksi Self-Consistency -strategiassa useita päättelypolkuja otettiin näyte ja lopullinen vastaus valittiin enemmistöäänestyksellä; ja lopulta Best-of-N -strategiassa useita tulosteita generoitiin itsenäisesti ja arvioitiin verifioimisohjelmoinnilla, ja korkeimman arvion saanut vastaus valittiin.
Kaksi Iter-VF:n varianttia toteutettiin: yksi, joka käynnistettiin trivialella arvauksella (‘1’), ja toinen, joka käynnistettiin standardin CoT-tuloksella:

Tarkkuus ja tokenin tehokkuus MATH500-benchmarkissa kasvavan tulostusbudjetin alaisena, osoittaa, että molemmat Iter-VF:n variantit ylittävät kaikki vertailukohteet mallikoon yli.
Iter-VF antoi paremmat tulokset kuin kaikki muut menetelmät, kun saatavilla oleva laskentakapasiteetti oli alhainen, minkä tutkijat pitivät johtuvan siitä, miten se tarkistaa vastauksia, eikä siitä, miten hyviä alkuvastaukset olivat (kummassakin VF- ja CoT-variantissa saavutettiin nopeasti sama tarkkuus).
PHP suoriutui heikommin, vaikka se uusi aiempia vastauksia vihjeinä, luultavasti siksi, että LLM:t eivät hyödyntäneet näitä vihjeitä hyvin.
Toisin kuin PHP ja Self-Correction, jotka kerryttävät kontekstia iteraatioiden aikana, Iter-VF käsittelee aina vain viimeisimmän vastauksen kerran, mikä auttaa välttämään pidentyneiden päättelyketjujen sekavuuden – heikkous, joka on erityisen haitallinen Self-Correctionille.
Rinnakkaiset menetelmät, kuten Self-Consistency ja Best-of-N, välttivät tämän ongelman, vaikka niiden parannukset olivat hitaampia ja kohtuullisempia.
(Huom. Tuloksien osuus on perusteellinen, mutta vaikea ja pitkä luku, ja meidän on leikattava suurin osa jäljellä olevasta kattavuudesta ja viitattava lukijaa alkuperäiseen tutkimukseen lisätietojen saamiseksi).
Kun Iter-VF testattiin GPT-5 Nano – ja GPT-5 Mini -malleilla, kaupallisilla malleilla, jotka piilottavat koko päättelyjäljen ja palauttavat vain lopputuloksen, Iter-VF paransi suorituskykyä ilman, että riippui välimaisten tulosteiden tarpeesta. Alla olevassa taulukossa voidaan nähdä parannukset sekä MATH500- että GPQA-benchmarkissa, mikä vahvistaa, että verify-then-generate-lähestymistapa on edelleen käyttökelpoinen, vaikka vain syöte ja lopputulos ovat saatavilla:

Tarkkuus MATH500- ja GPQA-benchmarkissa, kun Iter-VF sovelletaan GPT-5-malleihin, joissa on piilotettu päättelyjälki.
Johtopäätös
Vaikka uusi tutkimus kääntyy epäselvöksi tuloksien osuudessa eteenpäin, ilmiön havaitseminen, joka näyttää olevan yleinen useissa LLM-malleissa, on silti mielenkiintoinen kehitys. Kuka tahansa, joka käyttää säännöllisesti LLM:ää, on luonnollisesti kehittänyt joukon temppuja työskennelläkseen mallien heikkouksien ympärillä, ja kaikki toivovat löytävänsä yhtä sovellettavissa olevan ja yleistettävissä olevan “temppun” kuin tämä.
Yksi suurimmista ongelmista kontekstiuksen toteuttamisessa ja päivittämisessä LLM:ssä on löytäminen tasapainoa istunnon edistymisen säilyttämisen ja kyvyn lähteä uusille poluille tarpeen mukaan ilman, että joutuu harhaanjohtaviin hallucinaatioihin tai aiheen ulkopuolisiin tuloksiin. Tutkimuksessa esitetty tapaus esittää esimerkin hienovaraisesta, mutta sitkeästä “herätyskutsusta”, joka näyttää palauttavan ja nollaavan LLM:n ilman kontekstin menettämistä. On mielenkiintoista nähdä, miten myöhemmät projektit sopeuttavat ja kehittävät tätä menetelmää.
Tutkijat korostavat uuden menetelmänsä suurta taloudellisuutta – huomio, jolla olisi ollut vähemmän painoa vain 12 kuukautta sitten. Nykyään hyperskaalan AI:n vaikutukset tekevät selväksi, että resurssisäästöt, jotka aikaisemmin pidettiin pikkumaisina “puhdas” tutkimuksen aikakaudella, ovat nyt tärkeitä ja olennaisia.
* Huom. Minun on rajoitettava määrä lainauksia tutkimuksesta, koska joissakin sen osissa käytetty englannin kieli voi hämätä lukijaa. Siksi olen ottanut vapauden tiivistää avainnäkemyksiä sen sijaan, ja viitan lukijaa alkuperäiseen tutkimukseen vahvistusta varten.
Julkaistu torstaina, 4. joulukuuta 2025












