Andersonin kulma
‘Zen’ -menetelmÃĪ estÃĪmÃĪÃĪn kielen mallien hallucinoituminen

Kun ChatGPT:lle annetaan tehtÃĪvÃĪksi faktantarkistaa satunnainen vastaus ennen varsinaisen ongelman ratkaisemista, se ajattelee kovemmin ja saa useammin oikean vastauksen â vaikka aiempi âsatunnainenâ vastaus ei liity millÃĪÃĪn tavoin todelliseen kysymykseen.
Â
Kiinasta on julkaistu mielenkiintoinen uusi tutkimus, jossa on kehitetty erittÃĪin edullinen menetelmÃĪ estÃĪmÃĪÃĪn kielen malleja, kuten ChatGPT:tÃĪ, hallucinoitumasta ja parantamaan vastausten laatua: malli pyydetÃĪÃĪn tarkistamaan vastaus tÃĪysin sivulliseen kysymykseen:

Esimerkki sivullisesta kysymyksestÃĪ, joka voi âvapauttaaâ LLM:n mielen ja auttaa sitÃĪ keskittymÃĪÃĪn (oikeaan) myÃķhempÃĪÃĪn kysymykseen. LÃĪhde
TÃĪmÃĪ zen-isku on erittÃĪin halpa tapa parantaa suorituskykyÃĪ verrattuna muihin, monimutkaisempiin menetelmiin, kuten hienosÃĪÃĪtÃķÃķn, ohjelmointiin ja rinnakkaislaskentaan, ja se toimii sekÃĪ avoimissa ettÃĪ suljetuissa malleissa, mikÃĪ osoittaa, ettÃĪ kyseessÃĪ on perustavanlaatuinen piirre useissa LLM-arkkitehtuureissa (eikÃĪ haavoittuvaa ominaisuutta, joka liittyy tiettyyn koulutusmateriaaliin tai -menetelmÃĪÃĪn).
Tutkijat kuvaavat mahdollisia kustannussÃĪÃĪstÃķjÃĪ, joita voidaan saavuttaa parantamalla tulosta tÃĪllÃĪ spartaalaisella tavalla*:
âToteuttaaksesi minimoiden aiemman tiedon, VF:n tarvitsee vain antaa satunnainen/triviaali vastaus ohjelmointikyselyssÃĪ. Varmistusprosessi osoittautuu tuottavan vÃĪhemmÃĪn tulostekstejÃĪ kuin tavallinen CoT-polku, [joskus] jopa ilman eksplisiittistÃĪ verifioitumisprosessia, joten [vaaditaan] erittÃĪin [vÃĪhÃĪn] lisÃĪÃĪ testiaikaa laskentaa.â
Kokeissa tÃĪmÃĪ lÃĪhestymistapa â jota kutsutaan Verification-First (VF) -menetelmÃĪksi â pystyi parantamaan vastauksia monissa tehtÃĪvissÃĪ, mukaan lukien matemaattinen pÃĪÃĪttely, sekÃĪ avoimilla ettÃĪ kaupallisilla alustoilla.
Osa siitÃĪ, miksi tÃĪmÃĪ tekniikka toimii, voi olla perusteltu siinÃĪ, miten kielen mallit omaksuvat ja soveltavat ihmisen psykologian trendejÃĪ, joten suora kysymys saa mallin âpuolustautumaanâ ja âhermostumaanâ, kun taas pyynnÃķssÃĪ tarkistaa toisen tyÃķn tulosta ei kÃĪynnistÃĪ nÃĪitÃĪ âselviytymisen vaistojaâ.
Perusidea on, ettÃĪ vastauksen tarkistaminen vaatii vÃĪhemmÃĪn vaivaa kuin vastauksen luominen alusta alkaen, ja se voi laukaista erilaisen pÃĪÃĪttelypolun, joka tÃĪydentÃĪÃĪ standardia chain-of-thought-menetelmÃĪÃĪ.
Ohjelmointi mallille antaa kritiikkiÃĪ annetusta vastauksesta (ts. vastaus, johon malli ei ole osallistunut luomisessa) voi myÃķs aktivoida kriittisen ajattelun, joka auttaa vÃĪlttÃĪmÃĪÃĪn ylipeittÃĪvÃĪn luottamusta mallin omiin ensimmÃĪisiin vaikutelmiin.
TyÃķ kuvaa prosessia kÃĪÃĪnteisen pÃĪÃĪttelyn polkuna:

Aloittaminen ehdotetusta vastauksesta ja pÃĪÃĪttely taaksepÃĪin kohti kysymystÃĪ voi paljastaa lyhytkÃĪytÃĪviÃĪ tai oivalluksia, jotka ovat vaikeampia lÃķytÃĪÃĪ, kun pÃĪÃĪttely suoritetaan eteenpÃĪin ongelmasta.
Tutkijat ovat myÃķs konkretisoineet keskeisen kÃĪsitteen Iter-VF:ksi, joka on aikajÃĪrjestyksessÃĪ toistuva menetelmÃĪ, joka parantaa vastauksia iteraatiolla, vÃĪlttÃĪen virheiden kertymisen ongelman, joka on yleinen itsekorjaavissa strategioissa, joita usein kÃĪytetÃĪÃĪn LLM-arkkitehtuureissa.
Uusi tutkimus on nimeltÃĪÃĪn Asking LLMs to Verify First is Almost Free Lunch, ja se on tehty kahden tutkijan toimesta Tsinghuan yliopiston sÃĪhkÃķtekniikan osastolla PekingissÃĪ.
MenetelmÃĪ
Tutkimuksen keskeinen idea on kÃĪÃĪntÃĪÃĪ yleinen pÃĪÃĪttelyvirta kielen malleissa. Sen sijaan, ettÃĪ malli pyydetÃĪÃĪn ratkaisemaan ongelmaa alusta alkaen, sille annetaan ehdotettu vastaus (usein vÃĪÃĪrÃĪ tai satunnainen) ja pyydetÃĪÃĪn tarkistamaan, onko se jÃĪrkevÃĪÃĪ.
TÃĪmÃĪ ohjelmoi mallin pÃĪÃĪttÃĪmÃĪÃĪn vastakkaiseen suuntaan, tyÃķskentelemÃĪÃĪn taaksepÃĪin ehdotetusta vastauksesta kohti kysymystÃĪ. Kun tarkistus on valmis, malli jatkaa ratkaisemalla alkuperÃĪisen ongelman normaalisti.
TÃĪmÃĪ kÃĪÃĪnnÃķs, tutkimus vÃĪittÃĪÃĪ, vÃĪhentÃĪÃĪ huolimattomia virheitÃĪ ja rohkaisee enemmÃĪn reflektiivistÃĪ pÃĪÃĪttelyÃĪ, joka auttaa LLM:ÃĪÃĪ paljastamaan piilossa olevan rakenteen ja vÃĪlttÃĪmÃĪÃĪn harhaanjohtavia oletuksia.
Kuten esimerkeissÃĪ nÃĪkyy, ohjelmointi mallille tarkistamaan selvÃĪsti vÃĪÃĪrÃĪ arvaus, kuten â10â, voi auttaa sitÃĪ toipumaan virheellisestÃĪ logiikasta ja suoriutumaan paremmin kuin standardi chain-of-thought-ohjelmointi:

Ohjelmointi mallille tarkistamaan arvattu vastaus ensin auttaa sitÃĪ havaitsemaan ristiriitaisuuksia ja osallistumaan ongelmaan tarkemmin.
Monissa todellisissa ongelmissa ei ole helppoa antaa mallille arvaus, jota se voi tarkistaa, erityisesti kun tehtÃĪvÃĪ on avoin, kuten koodin kirjoittaminen tai API-kutsu. Siksi menetelmÃĪ antaa mallille ensin parhaan vastauksensa normaalisti ja sitten syÃķttÃĪÃĪ sen takaisin Verification-First-muotoon. TÃĪllÃĪ tavoin malli tarkistaa ja parantaa omaa tulostaan:

Kun malli pyydetÃĪÃĪn tarkistamaan omaa aiempaa tulostaan, se havaitsee virheen logiikassaan ja kirjoittaa uudelleen ratkaisun oikein.
TÃĪmÃĪ lÃĪhestymistapa muodostaa mainitun Iter-VF:n. Malli toistaa tÃĪmÃĪn syklin, parantaen vastaustaan kerran, ilman uudelleenkoulutusta tai erityistÃĪ tyÃķkalua. Toisin kuin muut itsekorjaavat strategiat, jotka voivat kertyÃĪ aiempaan ajatteluun ja vaarantaa mallin sekavuuden, Iter-VF kÃĪsittelee aina vain viimeisintÃĪ vastausta kerran, mikÃĪ auttaa pitÃĪmÃĪÃĪn sen pÃĪÃĪttelyn selkeÃĪnÃĪ.
Data ja testit
Tutkijat arvioivat menetelmÃĪÃĪ neljÃĪssÃĪ alueessa: yleisissÃĪ pÃĪÃĪttelytehtÃĪvissÃĪ, joissa VF:lle annetaan satunnainen arvaus; aikakriittisissÃĪ tehtÃĪvissÃĪ, joissa Iter-VF verrataan muihin skaalautumismenetelmiin; avoinna ongelmilla, kuten koodauksessa ja API-kutsuissa, joissa VF kÃĪyttÃĪÃĪ mallin omaa aiempaa vastausta; ja kaupallisissa, suljetuissa LLM-malleissa, joissa sisÃĪiset pÃĪÃĪttelyvaiheet eivÃĪt ole saatavilla.
Tutkimuksessa kÃĪytettiin kolmea pÃĪÃĪttelybenchmarkia: GSM8K ja MATH500 matemaattisille ongelmille; ja GPQA-Diamond graduate-tason tieteellisille kysymyksille.
Jokaisessa tapauksessa mallille annettiin joko satunnainen arvaus, kuten â1â numeerisille vastauksille; tai satunnaisesti sekoitettu monivalintavaihtoehto, aloituspisteenÃĪ tarkistamiselle. Ei ollut erityistÃĪ sÃĪÃĪtÃķÃĪ tai aiempaa tietoa, ja vertailukohtana oli standardi zero-shot chain-of-thought-ohjelmointi.
Kokeet suoritettiin Qwen2.5 ja Llama3 -ohjelmointimalleilla, 1B:stÃĪ 72B:een (parametreja) kokoisilla malleilla. Qwen-malleja kÃĪytettiin Qwen2.5-1.5B-Instruct, Qwen2.5-3B-Instruct, Qwen2.5-14B-Instruct ja Qwen2.5-72B-Instruct. Llama3-variantteja olivat Llama3.2-1B-Instruct, Llama3.2-3B-Instruct, Llama3.1-8B-Instruct ja Llama3.3-70B-Instruct.
Kuten alla nÃĪkyy, Verification-First-ohjelmoinnin parannus sÃĪilyi vakaana kaiken mallikoon yli, selvÃĪt voitot nÃĪkyvÃĪt jo 1B parametrissa ja jatkuvat 72B:een saakka:

Kaiken Qwen2.5- ja Llama3-malliperheen yli Verification-First-ohjelmointi ylitti standardin chain-of-thought-ohjelmoinnin GSM8K-, MATH500- ja GPQA-Diamond-benchmarkissa.
IlmiÃķn voimakkuus oli vahvin laskennallisten matemaattisten benchmarkien, kuten GSM8K ja MATH500, kohdalla, joissa tarkistaminen vÃĪÃĪrÃĪÃĪ vastausta johti parempaan pÃĪÃĪttelyyn kuin yrittÃĪminen ratkaista ongelma alusta alkaen. GPQA-Diamondissa, joka riippuu enemmÃĪn tallennetusta tietÃĪmisestÃĪ kuin deduktiivisesta rakenteesta, etu oli pienempi mutta johdonmukainen.
Verification-Firstin laskennallinen kustannus oli kohtuullinen: alla olevassa taulukossa voidaan nÃĪhdÃĪ, ettÃĪ verifioimisvaiheen lisÃĪÃĪminen lisÃĪsi noin 20-50 % enemmÃĪn tulostekstejÃĪ verrattuna standardiin chain-of-thought-ohjelmointiin:

KeskimÃĪÃĪrÃĪinen tulostekstien mÃĪÃĪrÃĪ kunkin ohjelmointimenetelmÃĪn yhteydessÃĪ GSM8K-, MATH500- ja GPQA-benchmarkissa.
Vaikka tÃĪmÃĪ kustannus oli kohtuullinen, se sÃĪilyi kuitenkin selvÃĪsti alempina kuin strategioiden, jotka vaativat useita nÃĪytteitÃĪ tai rekursiivista suunnittelua.
Alle olevassa kaaviossa voidaan nÃĪhdÃĪ, miten herkkÃĪ menetelmÃĪ on arvattujen vastausten laadulle. YllÃĪttÃĪen, jopa kun arvaus on triviaali (â1â), epÃĪtodennÃĪkÃķinen (â2025â) tai satunnainen monivalintavaihtoehto, Verification-First ylittÃĪÃĪ standardin ohjelmoinnin:

Tarkkuuden parannukset Verification-First-ohjelmoinnista, kun malli saa tarkistettavaksi trivialeja, epÃĪtodennÃĪkÃķisiÃĪ tai oikein arvattuja vastauksia GSM8K-, MATH500- ja GPQA-benchmarkissa.
Kuten odotettiin, tarkkuus hyppÃĪÃĪ jopa korkeammaksi, kun arvaus osuu oikein; mutta menetelmÃĪ toimi hyvin riippumatta siitÃĪ, oliko arvaus oikein vai ei, mikÃĪ viittaa siihen, ettÃĪ parannukset eivÃĪt johtuneet itse arvauksen tiedosta, vaan yksinkertaisesti verifioimisaktista itsessÃĪÃĪn.
Iter-VF verrattiin myÃķs neljÃĪÃĪn testiaikaisiin skaalautumisstrategiaan, jotka toimivat ilman uudelleenkoulutusta tai tehtÃĪvÃĪn mukaan sopeutumista. Self-Correction -strategiassa malli pyydettiin korjaamaan vastauksiaan heijastamalla aiempia pÃĪÃĪttelyvaiheita; PHP:ssÃĪ aiemmat vastaukset liitettiin syÃķtteeseen kontekstihintoina, vaikka ei annettu ohjeita siitÃĪ, miten niitÃĪ kÃĪytetÃĪÃĪn.
LisÃĪksi Self-Consistency -strategiassa useita pÃĪÃĪttelypolkuja otettiin nÃĪyte ja lopullinen vastaus valittiin enemmistÃķÃĪÃĪnestyksellÃĪ; ja lopulta Best-of-N -strategiassa useita tulosteita generoitiin itsenÃĪisesti ja arvioitiin verifioimisohjelmoinnilla, ja korkeimman arvion saanut vastaus valittiin.
Kaksi Iter-VF:n varianttia toteutettiin: yksi, joka kÃĪynnistettiin trivialella arvauksella (â1â), ja toinen, joka kÃĪynnistettiin standardin CoT-tuloksella:

Tarkkuus ja tokenin tehokkuus MATH500-benchmarkissa kasvavan tulostusbudjetin alaisena, osoittaa, ettÃĪ molemmat Iter-VF:n variantit ylittÃĪvÃĪt kaikki vertailukohteet mallikoon yli.
Iter-VF antoi paremmat tulokset kuin kaikki muut menetelmÃĪt, kun saatavilla oleva laskentakapasiteetti oli alhainen, minkÃĪ tutkijat pitivÃĪt johtuvan siitÃĪ, miten se tarkistaa vastauksia, eikÃĪ siitÃĪ, miten hyviÃĪ alkuvastaukset olivat (kummassakin VF- ja CoT-variantissa saavutettiin nopeasti sama tarkkuus).
PHP suoriutui heikommin, vaikka se uusi aiempia vastauksia vihjeinÃĪ, luultavasti siksi, ettÃĪ LLM:t eivÃĪt hyÃķdyntÃĪneet nÃĪitÃĪ vihjeitÃĪ hyvin.
Toisin kuin PHP ja Self-Correction, jotka kerryttÃĪvÃĪt kontekstia iteraatioiden aikana, Iter-VF kÃĪsittelee aina vain viimeisimmÃĪn vastauksen kerran, mikÃĪ auttaa vÃĪlttÃĪmÃĪÃĪn pidentyneiden pÃĪÃĪttelyketjujen sekavuuden â heikkous, joka on erityisen haitallinen Self-Correctionille.
Rinnakkaiset menetelmÃĪt, kuten Self-Consistency ja Best-of-N, vÃĪlttivÃĪt tÃĪmÃĪn ongelman, vaikka niiden parannukset olivat hitaampia ja kohtuullisempia.
(Huom. Tuloksien osuus on perusteellinen, mutta vaikea ja pitkÃĪ luku, ja meidÃĪn on leikattava suurin osa jÃĪljellÃĪ olevasta kattavuudesta ja viitattava lukijaa alkuperÃĪiseen tutkimukseen lisÃĪtietojen saamiseksi).
Kun Iter-VF testattiin GPT-5 Nano â ja GPT-5 Mini -malleilla, kaupallisilla malleilla, jotka piilottavat koko pÃĪÃĪttelyjÃĪljen ja palauttavat vain lopputuloksen, Iter-VF paransi suorituskykyÃĪ ilman, ettÃĪ riippui vÃĪlimaisten tulosteiden tarpeesta. Alla olevassa taulukossa voidaan nÃĪhdÃĪ parannukset sekÃĪ MATH500- ettÃĪ GPQA-benchmarkissa, mikÃĪ vahvistaa, ettÃĪ verify-then-generate-lÃĪhestymistapa on edelleen kÃĪyttÃķkelpoinen, vaikka vain syÃķte ja lopputulos ovat saatavilla:

Tarkkuus MATH500- ja GPQA-benchmarkissa, kun Iter-VF sovelletaan GPT-5-malleihin, joissa on piilotettu pÃĪÃĪttelyjÃĪlki.
JohtopÃĪÃĪtÃķs
Vaikka uusi tutkimus kÃĪÃĪntyy epÃĪselvÃķksi tuloksien osuudessa eteenpÃĪin, ilmiÃķn havaitseminen, joka nÃĪyttÃĪÃĪ olevan yleinen useissa LLM-malleissa, on silti mielenkiintoinen kehitys. Kuka tahansa, joka kÃĪyttÃĪÃĪ sÃĪÃĪnnÃķllisesti LLM:ÃĪÃĪ, on luonnollisesti kehittÃĪnyt joukon temppuja tyÃķskennellÃĪkseen mallien heikkouksien ympÃĪrillÃĪ, ja kaikki toivovat lÃķytÃĪvÃĪnsÃĪ yhtÃĪ sovellettavissa olevan ja yleistettÃĪvissÃĪ olevan âtemppunâ kuin tÃĪmÃĪ.
Yksi suurimmista ongelmista kontekstiuksen toteuttamisessa ja pÃĪivittÃĪmisessÃĪ LLM:ssÃĪ on lÃķytÃĪminen tasapainoa istunnon edistymisen sÃĪilyttÃĪmisen ja kyvyn lÃĪhteÃĪ uusille poluille tarpeen mukaan ilman, ettÃĪ joutuu harhaanjohtaviin hallucinaatioihin tai aiheen ulkopuolisiin tuloksiin. Tutkimuksessa esitetty tapaus esittÃĪÃĪ esimerkin hienovaraisesta, mutta sitkeÃĪstÃĪ âherÃĪtyskutsustaâ, joka nÃĪyttÃĪÃĪ palauttavan ja nollaavan LLM:n ilman kontekstin menettÃĪmistÃĪ. On mielenkiintoista nÃĪhdÃĪ, miten myÃķhemmÃĪt projektit sopeuttavat ja kehittÃĪvÃĪt tÃĪtÃĪ menetelmÃĪÃĪ.
Tutkijat korostavat uuden menetelmÃĪnsÃĪ suurta taloudellisuutta â huomio, jolla olisi ollut vÃĪhemmÃĪn painoa vain 12 kuukautta sitten. NykyÃĪÃĪn hyperskaalan AI:n vaikutukset tekevÃĪt selvÃĪksi, ettÃĪ resurssisÃĪÃĪstÃķt, jotka aikaisemmin pidettiin pikkumaisina âpuhdasâ tutkimuksen aikakaudella, ovat nyt tÃĪrkeitÃĪ ja olennaisia.
Â
* Huom. Minun on rajoitettava mÃĪÃĪrÃĪ lainauksia tutkimuksesta, koska joissakin sen osissa kÃĪytetty englannin kieli voi hÃĪmÃĪtÃĪ lukijaa. Siksi olen ottanut vapauden tiivistÃĪÃĪ avainnÃĪkemyksiÃĪ sen sijaan, ja viitan lukijaa alkuperÃĪiseen tutkimukseen vahvistusta varten.
Julkaistu torstaina, 4. joulukuuta 2025












