Andersons hoek
Geheime data in systeemprompts ondermijnen de evaluatie van taalmodellen

Zonder de mogelijkheid om benchmark Large Language Models (LLM’s) uit te voeren, is het voor consumenten en bedrijven moeilijk te begrijpen welke vooruitgang een model heeft geboekt ten opzichte van recente versies, en hoe het zich verhoudt tot zijn concurrenten:

De invloedrijke LLM-leaderboard op arena.ai. Bron
Aangezien LLM’s niet-deterministisch zijn (d.w.z. ze zullen niet altijd consistente uitkomsten produceren bij dezelfde invoer), is het evalueren ervan lastig. Zelfs wanneer onderzoekers identieke prompts, modelinstellingen en benchmark‑datasets gebruiken, kunnen ogenschijnlijk kleine verschillen in de uitvoeringomgeving verschillende antwoorden opleveren en de prestatietotalen aanzienlijk veranderen.
Factoren zoals hardware‑configuratie, numerieke precisie, batchgrootte voor inferentie, en zelfs de volgorde van meerkeuze‑antwoorden kunnen de resultaten beïnvloeden. Dit kan het moeilijk maken om te zien of een gemelde verbetering echte vooruitgang weerspiegelt, of slechts een semi‑willekeurige variatie in de testomstandigheden is.
In zekere mate kan men rekening houden met enkele van deze variabelen, of tenminste bepalen welke foutmarge ze genereren, zodat vergelijkende evaluatie betekenisvol wordt. Het is belangrijk dit te proberen, aangezien veel geld en veel reputatie afhangen van het kunnen benchmarken van AI‑systemen van dit type met een zekere mate van nauwkeurigheid.
Echter, volgens nieuw onderzoek kan één specifieke variabele niet alleen schadelijk zijn voor benchmarks, maar is ook zeer moeilijk te elimineren uit de prompts die ze definiëren – de datum van vandaag.
Tijden veranderen
Het nieuw artikel*, een academische samenwerking tussen Duitsland, Mexico en de VS, stelt dat het feit dat de huidige datum automatisch en heimelijk wordt opgenomen in de systeemprompt van alle frontier‑ en veel implementaties van open-weight-modellen betekent dat reproduceerbaarheid nagenoeg onmogelijk kan zijn:
‘We identificeren een kritieke, vaak over het hoofd geziene bron van niet‑determinisme in LLM‑evaluatie: de verborgen injectie van de huidige datum in systeemprompts.’
‘Over 9 modellen, 6 datasets en vier taken verandert deze dynamische metadata de modelprestaties en herschikt de leaderboard‑rangschikkingen, en overtreft de variatie die wordt geïntroduceerd door andere systeemniveau‑factoren zoals batchgrootte of numerieke precisie.’
De onderzoekers merken ook op dat het geïdentificeerde effect groter is voor taken die gegenereerde antwoorden vereisen, met prestaties die variëren tot 6 % bij meerkeuzevragen, 14 % bij wiskundig redeneren en 7 % bij codegeneratie – en met vertaalresultaten die eveneens aanzienlijk variëren.
Het aanbieden van voorbeeldantwoorden en het aanmoedigen van stapsgewijze redenering lostte het probleem niet op – in feite maakte het slechter:

Nauwkeurigheidsfluctuaties over verschillende data in 2024 voor Llama 3.1 (8B) op de MMLU-benchmark. Stapsgewijze redenering (rood) veroorzaakt aanzienlijk grotere variabiliteit dan directe antwoorden (blauw), wat aantoont hoe chain-of-thought prompting de gevoeligheid voor de datum vergroot. Bron
Het effect werd ook geïdentificeerd in propriëtaire modellen, waarbij GPT-5.1 nauwkeurigheidsfluctuaties van tot wel 4 % vertoonde over drie meerkeuze‑benchmarks tijdens een week testen in december 2025. De onderzoekers gebruikten een lege systeemprompt, schakelden redeneren uit en zetten willekeur op nul – maar de datum werd nog steeds automatisch door de provider ingevoegd:

De nauwkeurigheid van GPT-5.1 schommelde over zeven opeenvolgende dagen in december 2025, ondanks identieke gebruikersprompts en modelinstellingen. De grootste variatie trad op bij GPQA (oranje), met een verschil van vier procentpunten tussen de beste en slechtste dag. De gestippelde lijn geeft de gemiddelde nauwkeurigheid van elke benchmark over de week weer.
De onderzoekers raden aan om de datum waar mogelijk uit systeemprompts te verwijderen, of deze te corrigeren en te documenteren, om eerlijke vergelijkingen te waarborgen. Ze merken echter op dat datumgerichte invloed mogelijk dieper verankerd is:
‘Een mogelijke reden voor de datumgevoeligheid is dat de systeemprompt vast kan staan tijdens supervised fine‑tuning (SFT) en reinforcement learning from human feedback (RLHF), waardoor het model kwetsbaar wordt voor elke kleine wijziging.’
Om het probleem te onderzoeken, probeerden de onderzoekers zes verschillende formuleringen voor de systeemprompt, en ontdekten dat deze wijzigingen de nauwkeurigheid evenveel beïnvloedden als het wijzigen van de datum (0,78 %). Daarom lijkt de datum evenveel invloed te hebben als doelbewuste prompt engineering – behalve dat deze automatisch verandert, zonder dat de gebruiker het zelfs maar merkt.
Andere benaderingen werden geprobeerd om het ‘huidige datum’-probleem te verzachten, waaronder few-shot learning (waar het model vijf voorbeeldantwoorden kreeg voordat het reageerde). Dit hielp een beetje, waardoor de gemiddelde variatie daalde van 2,52 % naar 2,27 %, maar het probleem loste het niet op.
Veranderingen in GPU‑hardware, batchgrootte, numerieke precisie, antwoordvolgorde en de formulering van de systeemprompt werden ook getest. De grootste effecten werden waargenomen bij antwoordvolgorde en promptformulering, die het dichtst bij de impact van het wijzigen van de datum kwamen.
Laatste Dagen
Het is redelijk te verwachten dat een LLM/VLM de datum vanaf het begin van een chat begrijpt; echter lijkt er geen expliciete reden te zijn om deze in de systeemprompt op te nemen (de onzichtbare rubric die veiligheidsbeperkingen oplegt en het gedrag van de LLM conditioneert op manieren die voor de gebruiker ontoegankelijk zijn) wanneer de LLM routinematig een sub‑Kb RAG‑oproep kan doen om de nieuwste datum in te lezen, als een kleine onderhoudsroutine vóór de interactie met de gebruiker.
Ongetwijfeld bestaan er andere mogelijkheden om de kwestie op te lossen; echter, aangezien het opnemen van de huidige datum in de systeemprompt tot nu toe niet als een probleem werd gezien, is er vermoedelijk weinig of geen onderzoek naar gedaan.
Online dating
Voor de tests werden identieke prompts gebruikt voor elk model, waarbij alleen de datum in de systeemprompt werd gewijzigd. Elke dag van 2024 werd getest, van 1 januari tot en met 31 december, met alle andere instellingen gelijk.
Er werden zes benchmarks gebruikt: MMLU; GPQA; en ARC-Challenge, voor meerkeuzevragen (beoordeeld op basis van de waarschijnlijkheid van het antwoord‑token). GSM8K voor stap‑voor‑stap wiskunde (eindantwoord gecontroleerd); HumanEval voor Python‑codegeneratie (unit‑tested); en WMT voor Engels‑naar‑Duits; Engels‑naar‑Fins; en Engels‑naar‑Tsjechisch vertaling (volledige output geëvalueerd). Tijd‑afhankelijke vragen werden uitgesloten.
Er werden negen modellen getest: Llama 3.1 Instruct (8B en 70B); Gemma 3 Instruct (4B en 27B); Qwen3 (4B); Qwen3-Next (80B); Phi-4 (14B); en GPT-OSS (20B en 120B).
Nauwkeurigheid (het percentage correct beantwoorde vragen) werd gebruikt om de meerkeuze‑ en wiskundetests te scoren, terwijl Expected Calibration Error (ECE) meet hoe goed het vertrouwen van de modellen overeenkwam met hun daadwerkelijke prestaties.
Code werd gecontroleerd met pass@1 (het percentage gegenereerde code‑oplossingen dat alle tests bij de eerste poging doorstaat); vertalingen werden gescoord met BLEU en chrF.
De resultaten bevestigden de hypothese van de onderzoekers: simpelweg het wijzigen van de datum in de systeemprompt veranderde hoe nauwkeurig de modellen dezelfde vragen beantwoordden.

Testresultaten die laten zien hoe vijf toonaangevende modellen presteerden op MMLU terwijl de datum van de systeemprompt gedurende 2024 werd gewijzigd. Nauwkeurigheid wordt bovenaan weergegeven, met verwachte calibratiefout (ECE) hieronder. Alle vijf modellen vertoonden schommelingen in beide metingen, ondanks dat er geen andere wijzigingen in de testomstandigheden waren. Lagere ECE‑scores duiden op een betere afstemming tussen vertrouwen en nauwkeurigheid.
Samen met andere eerder in het artikel getoonde resultaten is dit mogelijk slecht nieuws voor LLM‑benchmarking, omdat een model beter of slechter kan scoren afhankelijk van de dag waarop het werd getest, waardoor zijn positie op een ranglijst kan veranderen, zonder enige daadwerkelijke verbetering of achteruitgang in zijn capaciteiten.
Conclusie
Dit probleem benadrukt de kloof tussen de deterministische computersystemen waar we tot ongeveer 2023 aan gewend waren, en de zeer verschillende aard van op diffusie gebaseerde en soortgelijke AI‑systemen die sindsdien zijn geëvolueerd en blijven evolueren.
Datumresolutie was in wezen opgelost op 1 januari 1970, maar is blijkbaar teruggekeerd om de wereld van de informatica te achtervolgen in de vorm van afkapdatums, naast andere tijdelijke zorgen.
* Getiteld ‘Het dateren van het model: verborgen datums in systeemprompts beïnvloeden LLM-evaluatie’
Eerst gepubliceerd vrijdag 9 oktober 2026

![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN-400x240.jpg)
![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN-80x80.jpg)









