Andersonin kulma

Salaiset päivämäärät järjestelmäkehotteissa heikentävät kielimallien arviointia

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa
Harold Lloyd hangs from a clock face in Safety Last! (1923). The film is in the US public domain.. Source: https://www.youtube.com/watch?v=tzh4htLXp6Q

Ilman mahdollisuutta benchmark suuria kielimalleja (LLM), kuluttajille ja yrityksille on vaikea ymmärtää, millaista edistystä malli on saavuttanut viimeisissä versioissa, ja miten se pärjää kilpailijoihinsa nähden:

Vaikuttava LLM-vertailutaulukko arena.ai-sivustolla. Lähde: https://arena.ai/leaderboard/chat/text

Vaikuttava LLM-vertailutaulukko arena.ai. Lähde

Koska LLM:t ovat epädeterministisiä (toisin sanoen ne ei aina tuota yhdenmukaisia tuloksia samoilla syötteillä), niiden arviointi on hankalaa. Vaikka tutkijat käyttäisivät identtisiä kehotteita, malliasetuksia ja vertailuaineistoja, näennäisesti vähäiset erot suoritusalustassa voivat tuottaa erilaisia vastauksia ja merkittävästi muuttaa suorituskykypisteitä.

Tekijöitä, kuten laitteistokonfiguraatio, numeerinen tarkkuus, inferenzin eräkokoon, ja jopa monivalintavastausten järjestys, voivat vaikuttaa tuloksiin. Tämä voi tehdä vaikeaksi nähdä, heijastaako raportoitu parannus todellista edistystä vai onko se vain puoliksi satunnainen vaihtelu olosuhteissa, joissa mallia testattiin.

Tietyssä määrin näihin muuttujiiin voidaan ottaa huomioon, tai ainakin määrittää, millaista virhemarginaalia ne aiheuttavat, jotta vertailuarviointi olisi merkityksellistä. On tärkeää yrittää, koska suuri määrä rahaa ja paljon mainetta riippuvat siitä, että pystytään arvioimaan tällaisten AI-järjestelmien suorituskykyä tietyn tarkkuuden tasolla.

Uuden tutkimuksen mukaan yksi erityinen muuttuja voi kuitenkin olla paitsi haitallinen vertailuille, myös erittäin vaikea poistaa kehotteista, jotka ne määrittelevät – tämän päivän päivämäärä.

Aikakaudet muuttuvat

uusi tutkimus*, akateeminen yhteistyö Saksan, Meksikon ja Yhdysvaltojen välillä, väittää, että se, että nykyinen päivämäärä sisällytetään automaattisesti ja salaa kaikkiin huipputason ja moniin käyttöönottoihin avoinpainoisille malleille, tekee toistettavuudesta lähes mahdotonta:

‘Havaitsemme kriittisen, usein huomiotta jäävän epädeterministisuuden lähteen LLM-arvioinnissa: nykyisen päivämäärän piilotetun injektoinnin järjestelmäkehotteisiin.

‘Yhdeksän mallin, kuuden aineiston ja neljän tehtävän aikana tämä dynaaminen metadata muuttaa mallin suorituskykyä ja sekoittaa vertailutaulukon sijoituksia, ylittäen muiden järjestelmätason tekijöiden, kuten eräkoon tai numeerisen tarkkuuden, aiheuttaman vaihtelun.’

Tutkijat huomauttavat myös, että havaittu vaikutus on suurempi tehtävissä, jotka vaativat tuotettuja vastauksia, suorituskyky vaihtelee jopa 6 % monivalintakysymyksissä, 14 % matemaattisessa päättelyssä ja 7 % koodin generoinnissa – ja konekäännöspisteetkin vaihtelevat merkittävästi.

Esimerkkivastausten tarjoaminen ja askel askeleelta -päättelyn kannustaminen ei ratkaissut ongelmaa – itse asiassa jälkimmäinen teki sen pahemmaksi:

Tarkkuusvaihtelut eri päivämäärinä vuonna 2024 Llama 3.1 (8B) -mallille MMLU-vertailussa. Askel askeleelta -päättely (punainen) aiheuttaa huomattavasti suurempaa vaihtelua kuin suorat vastaukset (sininen), mikä osoittaa, miten ketjupohjainen kehotus vahvistaa herkkyyttä päivämäärään.. Lähde - https://arxiv.org/pdf/2609.36931

Tarkkuusvaihtelut eri päivämäärinä vuonna 2024 Llama 3.1 (8B) -mallille MMLU-vertailussa. Askel askeleelta -päättely (punainen) aiheuttaa huomattavasti suurempaa vaihtelua kuin suorat vastaukset (sininen), mikä osoittaa, miten ketjupohjainen kehotus vahvistaa herkkyyttä päivämäärään. Lähde

Vaikutus havaittiin myös omistetuissa malleissa, joissa GPT-5.1 osoitti tarkkuusvaihteluita jopa 4 % kolmen monivalintavertailun aikana viikon testausjakson aikana joulukuussa 2025. Tutkijat käyttivät tyhjää järjestelmäkehotetta, poistivat päättelyn käytöstä ja asettivat satunnaisuuden nollaksi – mutta päivämäärä lisättiin silti automaattisesti palveluntarjoajan toimesta:

GPT-5.1:n tarkkuus vaihteli seitsemän peräkkäisen päivän aikana joulukuussa 2025, vaikka käyttäjäkehotteet ja malliasetukset olivat identtiset. Suurin vaihtelu tapahtui GPQA:ssa (oranssi), saavuttaen neljä prosenttiyksikköä parhaan ja huonon päivän välillä. Katkoviiva edustaa kunkin vertailun keskimääräistä tarkkuutta viikon aikana.

GPT-5.1:n tarkkuus vaihteli seitsemän peräkkäisen päivän aikana joulukuussa 2025, vaikka käyttäjäkehotteet ja malliasetukset olivat identtiset. Suurin vaihtelu tapahtui GPQA:ssa (oranssi), saavuttaen neljä prosenttiyksikköä parhaan ja huonon päivän välillä. Katkoviiva edustaa kunkin vertailun keskimääräistä tarkkuutta viikon aikana.

Tutkijat suosittelevat poistamaan päivämäärän järjestelmäkehotteista mahdollisuuksien mukaan tai korjaamaan ja dokumentoimaan sen, jotta varmistetaan reilut vertailut. He kuitenkin huomauttavat, että päivämäärään keskittyvä vaikutus saattaa olla syvemmin juurtunut:

‘Yksi mahdollinen syy päivämäärän herkkyydelle on, että järjestelmäkehotteet saattavat olla kiinteitä valvotun hienosäädön (SFT) ja ihmispalautteesta oppimisen (RLHF) aikana, mikä tekee mallista hauraan pienillekin muutoksille.’

Tutkiakseen ongelmaa tutkijat kokeilivat kuutta erilaista sanamuotoa järjestelmäkehotteelle ja havaitsivat, että nämä muutokset vaikuttivat tarkkuuteen yhtä paljon kuin päivämäärän muuttaminen (0,78 %). Siksi päivämäärällä näyttää olevan yhtä suuri vaikutus kuin harkitulla prompt engineering – paitsi että se muuttuu automaattisesti, ilman että käyttäjä edes tietää sen.

Muita lähestymistapoja kokeiltiin ‘nykyinen päivämäärä’ -ongelman lieventämiseksi, mukaan lukien few-shot learning ( jossa malli sai viisi esimerkkivastausta ennen vastaamista). Tämä auttoi hieman, vähentäen keskimääräistä vaihtelua 2,52 %:sta 2,27 %:iin, mutta ei ratkaissut ongelmaa.

Myös GPU-laitteiston, eräkoon, numeerisen tarkkuuden, vastausjärjestyksen ja järjestelmäkehotteen sanamuodon muutoksia testattiin. Suurimmat vaikutukset havaittiin vastausjärjestyksessä ja kehotteen sanamuodossa, jotka lähestyivät eniten päivämäärän muuttamisen vaikutusta.

Viimeiset päivät

On kohtuullista odottaa, että LLM/VLM ymmärtää päivämäärän keskustelun alusta alkaen; kuitenkin ei näytä olevan selvää syytä sisällyttää se järjestelmäkehotteeseen (näkyvä arviointikriteeri, joka asettaa guardrails ja ehtoo LLM:n käyttäytymistä käyttäjälle näkymättömillä tavoilla), kun LLM voisi rutiininomaisesti tehdä alikilobittisen RAG-kutsun uusimman päivämäärän hakemiseksi pienenä ylläpitotoimenpiteenä ennen käyttäjän kanssa vuorovaikutusta.

Ei ole epäilystäkään, että muita mahdollisuuksia ongelman ratkaisemiseksi on olemassa; kuitenkin koska nykyisen päivämäärän pakottamista järjestelmäkehotteeseen ei tähän mennessä ole nähty ongelmaksi, siitä on ilmeisesti tehty vähän tai ei lainkaan tutkimusta.

Verkko-deittailu

Testeissä käytettiin identtisiä kehotteita kaikille malleille, ja ainoa muutos oli järjestelmäkehotteessa oleva päivämäärä. Vuoden 2024 jokainen päivä testattiin 1. tammikuuta 31. joulukuuta asti, kaikki muut asetukset pysyen samana.

Käytettiin kuutta vertailuarviointia: MMLU; GPQA; ja ARC-Challenge monivalintakysymyksiin (arvioitu vastaus-tokenin todennäköisyyden perusteella). GSM8K vaiheittaisiin matemaattisiin tehtäviin (lopullinen vastaus tarkistettu); HumanEval Python-koodin generointiin (yksikkötestattu); ja WMT englanti-saksa; englanti-suomi; ja englanti-tšekki -käännöksiin (koko tulos arvioitu). Aikaan sidotut kysymykset jätettiin pois.

Yhdeksän mallia testattiin: Llama 3.1 Instruct (8B ja 70B); Gemma 3 Instruct (4B ja 27B); Qwen3 (4B); Qwen3-Next (80B); Phi-4 (14B); ja GPT-OSS (20B ja 120B).

Tarkkuutta (prosenttiosuus oikein vastatuista kysymyksistä) käytettiin monivalinta- ja matematiikkatestien pisteytykseen, kun taas Expected Calibration Error (ECE) mittasi, kuinka hyvin mallien luottamus vastasi niiden todellista suorituskykyä.

Koodi tarkastettiin käyttäen pass@1-mittaria (prosenttiosuus tuotetuista koodiratkaisuista, jotka läpäisevät kaikki testit ensimmäisellä yrityksellä); käännökset pisteytettiin käyttäen BLEU– ja chrF-mittareita.

Tulokset vahvistivat tutkijoiden hypoteesin: pelkkä päivämäärän muuttaminen järjestelmäkehotteessa muutti mallien tarkkuutta vastatessa samoihin kysymyksiin.

Testitulokset, jotka osoittavat, miten viisi johtavaa mallia suoriutui MMLU:ssa järjestelmäkehotteen päivämäärän muuttuessa vuoden 2024 aikana. Tarkkuus on esitetty ylhäällä, ja odotettu kalibrointivirhe (ECE) alla. Kaikki viisi mallia osoittivat vaihtelua molemmissa mittareissa, vaikka testiehdot eivät muuttuneet muulloin. Alhaisemmat ECE-pisteet osoittavat paremman yhteensopivuuden luottamuksen ja tarkkuuden välillä.

Testitulokset, jotka osoittavat, miten viisi johtavaa mallia suoriutui MMLU:ssa järjestelmäkehotteen päivämäärän muuttuessa vuoden 2024 aikana. Tarkkuus on esitetty ylhäällä, ja odotettu kalibrointivirhe (ECE) alla. Kaikki viisi mallia osoittivat vaihtelua molemmissa mittareissa, vaikka testiehdot eivät muuttuneet muulloin. Alhaisemmat ECE-pisteet osoittavat paremman yhteensopivuuden luottamuksen ja tarkkuuden välillä.

Yhdessä artikkelin aiemmin esitettyjen tulosten kanssa tämä on mahdollisesti huono uutinen LLM-vertailuille, koska malli voi saada paremman tai heikomman pistemäärän riippuen siitä, millä päivällä se testattiin, mikä saattaa muuttaa sen sijoituksen tulostaululla ilman todellista parannusta tai heikkenemistä sen kyvyissä.

Johtopäätös

Tämä ongelma korostaa eroa determinististen laskentajärjestelmien välillä, joihin olimme tottuneet ennen vuotta 2023, ja täysin erilaisen luonteensa diffusion-pohjaisten ja vastaavien tekoälyjärjestelmien välillä, jotka ovat kehittyneet ja kehittyvät edelleen sen jälkeen.

Päivämäärän tarkkuus ratkaistiin periaatteessa 1. tammikuuta 1970, mutta on ilmeisesti palannut kummittelemaan tietojenkäsittelyn maailmaa cut-off dates-muodossa, muiden temporal concerns joukossa.

 

* Nimetty ‘Mallin päivittäminen: Piilotetut päivämäärät järjestelmäkehotteissa vaikuttavat LLM-arviointiin’

Ensimmäisen kerran julkaistu perjantaina 9. lokakuuta 2026

Kirjoittaja koneoppimisen parissa, ihmiskuvan synteesin asiantuntija. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se sulautui DNEG:n Brahma.ai:ksi.
Verkkosivu: martinanderson.ai
Yhteystiedot: martin@martinanderson.ai