Andersons vinkel
Hemmelige datoer i systemprompt undergraver evaluering av språkmodeller

Uten muligheten til å benchmarke store språkmodeller (LLM-er), er det vanskelig for forbrukere og bedrifter å forstå hvilken fremgang en modell har gjort i de siste versjonene, og hvordan den står i forhold til konkurrentene:

Den innflytelsesrike LLM-ledertavlen på arena.ai. Kilde
Siden LLM-er er ikke-deterministiske (dvs. de vil ikke alltid generere konsistente resultater gitt samme innganger), er det vanskelig å evaluere dem. Selv når forskere bruker identiske prompt, modellinnstillinger og benchmark-datasett, kan tilsynelatende små forskjeller i kjøremiljøet gi forskjellige svar og endre ytelsesresultatene betydelig.
Faktorer som maskinvarekonfigurasjon, numerisk presisjon, batchstørrelse for inferens, og til og med rekkefølgen av flervalgssvar kan påvirke resultatene. Dette kan gjøre det vanskelig å se om en rapportert forbedring reflekterer reell fremgang, eller bare en semi-tilfeldig variasjon i betingelsene modellen ble testet under.
I noen grad kan man ta høyde for noen av disse variablene, eller i det minste fastslå hvilken feilmargin de genererer, slik at sammenlignende evaluering blir meningsfull. Det er viktig å prøve, siden store mengder penger og mye omdømme avhenger av å kunne benchmarke AI-systemer av denne typen med en viss grad av nøyaktighet.
Imidlertid viser ny forskning at en spesiell variabel ikke bare kan være ødeleggende for benchmarker, men også er svært vanskelig å fjerne fra promptene som definerer dem – dagens dato.
Tider endrer seg
Den ny artikkel*, et akademisk samarbeid mellom Tyskland, Mexico og USA, påstår at det faktum at den nåværende datoen automatisk og hemmelig inkluderes i systemprompten til alle fremste og mange distribusjoner av open-weight-modeller betyr at reproduserbarhet kan være nesten umulig:
‘Vi identifiserer en kritisk, ofte oversett kilde til ikke-determinisme i LLM-evaluering: den skjulte innsettingen av den nåværende datoen i systempromptene.
‘På tvers av 9 modeller, 6 datasett og fire oppgaver endrer denne dynamiske metadataen modellens ytelse og omorganiserer rangeringen på lederlisten, og overstiger variasjonen introdusert av andre systemnivåfaktorer som batchstørrelse eller numerisk presisjon.’
Forskerne bemerker også at den identifiserte effekten er større for oppgaver som krever genererte svar, med ytelse som varierer med opptil 6 % på flervalgsspørsmål, 14 % på matematisk resonnering og 7 % på kodegenerering – og også maskinoversettelsesresultater varierer betydelig.
Å gi eksempelsvar og oppmuntre til trinnvis resonnering løste ikke problemet – faktisk gjorde den sistnevnte det verre:

Nøyaktighetsfluktuasjoner over ulike datoer i 2024 for Llama 3.1 (8B) på MMLU-benchmarken. Trinnvis resonnering (rød) gir betydelig større variasjon enn direkte svar (blå), og viser hvordan kjede‑tenkning‑prompting forsterker følsomheten for datoen. Kilde
Effekten ble også identifisert i proprietære modeller, med GPT-5.1 som viser nøyaktighetsfluktuasjoner på opptil 4 % over tre flervalgstest på en testuke i desember 2025. Forskerne brukte en tom systemprompt, deaktiverte resonnering og satte tilfeldighet til null – men datoen ble fortsatt automatisk satt inn av leverandøren:

GPT-5.1s nøyaktighet fluktuerte over syv påfølgende dager i desember 2025, til tross for identiske brukerprompt og modellinnstillinger. Den største variasjonen oppstod på GPQA (oransje), med fire prosentpoeng mellom beste og dårligste dag. Den stiplede linjen representerer hver benchmarks gjennomsnittlige nøyaktighet over uken.
Forskerne anbefaler å fjerne datoen fra systempromptene der det er mulig, eller å rette den og dokumentere den, for å sikre rettferdige sammenligninger. De påpeker imidlertid at datodrevet påvirkning kan være mer dypt forankret:
‘En mulig årsak til datofølsomheten er at systemprompten kan være fast under overvåket finjustering (SFT) og forsterkende læring fra menneskelig tilbakemelding (RLHF), noe som gjør modellen skjør for enhver liten endring.’
For å undersøke problemet prøvde forskerne seks ulike formuleringer av systemprompten, og fant at disse endringene påvirket nøyaktigheten like mye som å endre datoen (0,78 %). Derfor ser det ut til at datoen har like stor innflytelse som bevisst prompt engineering – bortsett fra at den endres automatisk, uten at brukeren engang vet det.
Andre tilnærminger ble forsøkt for å dempe problemet med «nåværende dato», inkludert few-shot learning (der modellen fikk fem eksempelsvar før den svarte). Dette hjalp litt, og senket den gjennomsnittlige variasjonen fra 2,52 % til 2,27 %, men løste ikke problemet.
Endringer i GPU‑maskinvare, batch‑størrelse, numerisk presisjon, svarrekkefølge og formulering av systemprompten ble også testet. De største effektene ble observert for svarrekkefølge og prompt‑formulering, som kom nærmest påvirkningen av å endre datoen.
Siste dager
Det er rimelig å forvente at en LLM/VLM forstår datoen fra starten av en samtale; likevel ser det ikke ut til å finnes noen eksplisitt grunn til å bygge den inn i systemprompten (den usette rubrikken som pålegger guardrails og påvirker LLM‑ens atferd på måter som er utilgjengelige for brukeren) når LLM-en rutinemessig kunne gjort et under‑Kb RAG‑kall for å hente inn den nyeste datoen, som en mindre vedlikeholdsrutine før engasjement med brukeren.
Det er uten tvil andre muligheter for å løse saken; men siden innleggingen av den nåværende datoen i systemprompten hittil ikke har blitt sett på som et problem, har det antakeligvis vært lite eller ingen undersøkelser i denne forbindelse.
Nettdating
For testene ble identiske prompts brukt for hver modell, med kun datoen i systemprompten endret. Hver dag i 2024 ble testet, fra 1. januar til 31. desember, mens alle andre innstillinger ble holdt uendret.
Seks referansesett ble brukt: MMLU; GPQA; og ARC-Challenge for flervalgsspørsmål (vurdert etter sannsynlighet for svar‑token). GSM8K for trinnvis matematikk (siste svar kontrollert); HumanEval for Python‑kodegenerering (enhetstestet); og WMT for engelsk‑til‑tysk; engelsk‑til‑finsk; og engelsk‑til‑tsjekkisk oversettelse (fullt resultat evaluert). Tidsavhengige spørsmål ble ekskludert.
Ni modeller ble testet: Llama 3.1 Instruct (8B og 70B); Gemma 3 Instruct (4B og 27B); Qwen3 (4B); Qwen3-Next (80B); Phi-4 (14B); og GPT-OSS (20B og 120B).
Nøyaktighet (prosentandelen av spørsmål besvart korrekt) ble brukt til å vurdere flervalg- og mattetestene, mens Expected Calibration Error (ECE) målte hvor godt modellens selvtillit samsvarte med den faktiske ytelsen.
Kode ble kontrollert med pass@1 (prosentandelen av genererte kode‑løsninger som besto alle tester på første forsøk); oversettelser ble vurdert med BLEU og chrF.
Resultatene bekreftet forskernes hypotese: bare det å endre datoen i systemprompten endret hvor nøyaktig modellene svarte på de samme spørsmålene.

Testresultater som viser hvordan fem ledende modeller presterte på MMLU etter hvert som systemprompt‑datoen ble endret gjennom 2024. Nøyaktighet vises øverst, med forventet kalibreringsfeil (ECE) nedenfor. Alle fem modellene viste svingninger i begge målene, til tross for at ingen andre testforhold ble endret. Lavere ECE‑score indikerer bedre samsvar mellom selvtillit og nøyaktighet.
Sammen med andre resultater som ble vist tidligere i artikkelen, er dette potensielt dårlige nyheter for LLM‑benchmarking, fordi en modell kan få en høyere eller lavere score avhengig av hvilken dag den ble testet, noe som kan endre plasseringen på en rangliste, uten noen reell forbedring eller forverring av dens evner.
Konklusjon
Dette problemet fremhever skillet mellom de deterministiske datasystemene vi var vant til før omtrent 2023, og den helt andre naturen til diffusions‑baserte og lignende KI‑systemer som har utviklet seg, og fortsetter å utvikle seg, siden da.
Datoløsning ble i hovedsak løst 1. januar 1970, men har tilsynelatende vendt tilbake for å hjemsøke dataverdenen i form av avslutningsdatoer, blant andre temporale bekymringer.
* Datere modellen: Skjulte datoer i systemprompt påvirker LLM-evaluering
Først publisert fredag 9. oktober 2026

![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN-400x240.jpg)
![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN-80x80.jpg)









