Andersons vinkel
Hemmelige datoer i systemprompt undergraver evaluering af sprogmodeller

Uden muligheden for at benchmarke store sprogmodeller (LLM’er) er det svært for forbrugere og virksomheder at forstå, hvilken fremgang en model har gjort i de seneste versioner, og hvordan den klarer sig i forhold til sine konkurrenter:

Den indflydelsesrige LLM-ledertavle på arena.ai. Kilde
Da LLM’er er ikke-deterministiske (dvs. de vil ikke altid producere konsistente output givet de samme input), er det vanskeligt at evaluere dem. Selv når forskere bruger identiske prompts, modelindstillinger og benchmark-datasæt, kan tilsyneladende små forskelle i eksekveringsmiljøet producere forskellige svar og markant ændre præstationsresultaterne.
Faktorer såsom hardwarekonfiguration, numerisk præcision, inference batch-størrelse, og endda rækkefølgen af multiple-choice-svar kan påvirke resultaterne. Dette kan gøre det svært at se, om en rapporteret forbedring afspejler reel fremgang, eller blot en semi-tilfældig variation i de betingelser, hvori modellen blev testet.
I en vis grad kan man tage højde for nogle af disse variable, eller i det mindste fastslå, hvilken fejlmargin de genererer, så sammenlignende evaluering bliver meningsfuld. Det er vigtigt at forsøge, da store summer og stort omdømme afhænger af at kunne benchmarke AI-systemer af denne type med en vis grad af nøjagtighed.
Ifølge ny forskning kan en bestemt variabel ikke kun være ødelæggende for benchmarks, men også være meget vanskelig at fjerne fra de prompts, der definerer dem – dagens dato.
Tider ændrer sig
Den ny artikel*, et akademisk samarbejde mellem Tyskland, Mexico og USA, påstår, at det faktum, at den aktuelle dato automatisk og hemmeligt inkluderes i systemprompten for alle frontlinje- og mange implementeringer af open-weight-modeller, betyder, at reproducerbarhed næsten kan være umulig:
‘Vi identificerer en kritisk, ofte overset kilde til ikke-determinisme i LLM-evaluering: den skjulte indsprøjtning af den aktuelle dato i systemprompten.’
‘På tværs af 9 modeller, 6 datasæt og fire opgaver ændrer denne dynamiske metadata modelens præstation og omarrangerer ranglisten, hvilket overstiger variansen introduceret af andre systemniveau-faktorer såsom batch-størrelse eller numerisk præcision.’
Forskerne bemærker også, at den identificerede effekt er større for opgaver, der kræver genererede svar, med præstation, der varierer op til 6 % på multiple-choice‑spørgsmål, 14 % på matematisk ræsonnement og 7 % på kodegenerering – og at maskinoversættelsesresultater også varierer betydeligt.
At give eksempelsvar og opmuntre til trin-for-trin‑ræsonnement løste ikke problemet – faktisk gjorde sidstnævnte det værre:

Nøjagtighedsfluktuationer på tværs af forskellige datoer i 2024 for Llama 3.1 (8B) på MMLU‑benchmarken. Trin-for-trin‑ræsonnement (rød) giver væsentligt større variation end direkte svar (blå), hvilket demonstrerer, hvordan kæde‑af‑tanke‑prompting forstærker følsomheden over for datoen. Kilde
Effekten blev også identificeret i proprietære modeller, hvor GPT-5.1 viste nøjagtighedsfluktuationer på op til 4 % på tværs af tre multiple-choice‑benchmarker i løbet af en uges testning i december 2025. Forskerne brugte en tom systemprompt, deaktiverede ræsonnement og satte tilfældighed til nul – men datoen blev stadig automatisk indsat af udbyderen:

GPT-5.1’s nøjagtighed fluktuerede over syv på hinanden følgende dage i december 2025, på trods af identiske bruger‑prompts og modelindstillinger. Den største variation forekom på GPQA (orange) og nåede fire procentpoint mellem de bedste og dårligste dage. Den stiplet linje repræsenterer hver benchmarks gennemsnitlige nøjagtighed over ugen.
Forskerne anbefaler at fjerne datoen fra systemprompten, hvor det er muligt, eller at rette og dokumentere den, for at sikre retfærdige sammenligninger. De bemærker dog, at den dato‑centrerede påvirkning kan være mere dybt indlejret:
‘En mulig årsag til dato‑følsomheden er, at systemprompten kan være fastlagt under superviseret finjustering (SFT) og forstærkningslæring fra menneskelig feedback (RLHF), hvilket gør modellen skrøbelig over for enhver lille ændring.’
For at undersøge problemet prøvede forskerne seks forskellige formuleringer af systemprompten og fandt, at disse ændringer påvirkede nøjagtigheden lige så meget som at ændre datoen (0,78 %). Derfor ser datoen ud til at have lige så stor indflydelse som bevidst prompt engineering – bortset fra at den ændrer sig automatisk, uden at brugeren overhovedet ved det.
Andre tilgange blev prøvet for at afbøde problemet med den ‘aktuelle dato’, herunder few-shot learning (hvor modellen fik fem eksempelsvar inden den svarede). Dette hjalp lidt og sænkede den gennemsnitlige variation fra 2,52 % til 2,27 %, men løste ikke problemet.
Ændringer i GPU‑hardware, batch‑størrelse, numerisk præcision, svarrækkefølge og formulering af systemprompten blev også testet. De største effekter blev observeret for svarrækkefølge og promptformulering, som kom tættest på virkningen af at ændre datoen.
Sidste Dage
Det er rimeligt at forvente, at en LLM/VLM forstår datoen fra starten af en samtale; dog synes der ikke at være nogen eksplicit grund til at indbygge den i systemprompten (den usete rubrik, der pålægger guardrails og betinger LLM’ens adfærd på måder, der er utilgængelige for brugeren), når LLM’en rutinemæssigt kunne foretage et sub‑Kb RAG‑kald for at indlæse den seneste dato som en mindre vedligeholdelsesrutine inden interaktionen med brugeren.
Der er ingen tvivl om, at andre muligheder eksisterer for at løse problemet; men da indførelsen af den aktuelle dato i systemprompten indtil nu ikke er blevet betragtet som et problem, er der formodentlig foretaget lidt eller ingen undersøgelse i denne henseende.
Online Dating
Til testene blev identiske prompts brugt for hver model, hvor kun datoen i systemprompten blev ændret. Hver dag i 2024 blev testet, fra 1. januar til 31. december, mens alle øvrige indstillinger forblev uændrede.
Seks benchmarks blev brugt: MMLU; GPQA; og ARC-Challenge til multiple‑choice‑spørgsmål (vurderet ud fra svar‑token‑sandsynlighed). GSM8K til trin‑for‑trin‑matematik (det endelige svar kontrolleret); HumanEval til Python‑kodegenerering (unit‑testet); og WMT til engelsk‑til‑tysk; engelsk‑til‑finsk; og engelsk‑til‑tjekkisk oversættelse (fuldt output evalueret). Tidsafhængige spørgsmål blev udeladt.
Ni modeller blev testet: Llama 3.1 Instruct (8B og 70B); Gemma 3 Instruct (4B og 27B); Qwen3 (4B); Qwen3-Next (80B); Phi-4 (14B); og GPT‑OSS (20B og 120B).
Nøjagtighed (procentdelen af korrekt besvarede spørgsmål) blev brugt til at bedømme multiple‑choice‑ og matematik‑testene, mens Expected Calibration Error (ECE) målte, hvor godt modellernes selvtillid matchede deres faktiske præstation.
Kode blev kontrolleret ved hjælp af pass@1 (procentdelen af genererede kode‑løsninger, der bestod alle tests ved første forsøg); oversættelser blev vurderet med BLEU og chrF.
Resultaterne bekræftede forskernes hypotese: blot at ændre datoen i systemprompten ændrede, hvor præcist modellerne besvarede de samme spørgsmål.

Testresultater, der viser, hvordan fem førende modeller præsterede på MMLU, mens systemprompt‑datoen blev ændret gennem 2024. Nøjagtighed vises øverst, med forventet kalibreringsfejl (ECE) nedenunder. Alle fem modeller udviste udsving i begge målinger, på trods af at ingen andre testbetingelser blev ændret. Lavere ECE‑score indikerer bedre overensstemmelse mellem selvtillid og nøjagtighed.
Sammen med de øvrige resultater, der blev vist tidligere i artiklen, er dette potentielt dårlige nyheder for LLM‑benchmarking, fordi en model kan opnå en bedre eller dårligere score afhængigt af, hvilken dag den blev testet, hvilket muligvis kan ændre dens placering på en rangliste, uden nogen reel forbedring eller forringelse af dens evner.
Konklusion
Dette problem fremhæver kløften mellem de deterministiske computersystemer, vi var vant til indtil omkring 2023, og den meget anderledes karakter af diffusionsbaserede og lignende AI‑systemer, som har udviklet sig og fortsat udvikler sig siden da.
Datopløsning blev i princippet løst den 1. januar 1970, men er tilsyneladende vendt tilbage for at hjemsøge computerverdenen i form af cut‑off dates, blandt andre temporal concerns.
* Med titlen ‘Datere modellen: Skjulte datoer i systemprompt påvirker LLM-evaluering’
Først offentliggjort fredag den 9. oktober 2026

![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN-400x240.jpg)
![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN-80x80.jpg)









