Andersons vinkel
Hemliga datum i systempromptar undergräver utvärdering av språkmodeller

Utan möjlighet att benchmark stora språkmodeller (LLM) är det svårt för konsumenter och företag att förstå vilka framsteg en modell har gjort i de senaste versionerna, och hur den står sig mot sina konkurrenter:

Den inflytelserika LLM-ledartavlan på arena.ai. Källa
Eftersom LLM:er är icke-deterministiska (dvs. de kommer inte alltid producera konsistenta resultat med samma indata) är det svårt att utvärdera dem. Även när forskare använder identiska promptar, modellinställningar och benchmark-datamängder kan till synes små skillnader i exekveringsmiljön ge olika svar och avsevärt förändra prestationspoäng.
Faktorer såsom hårdvarukonfiguration, numerisk precision, inferensbatchstorlek, och till och med ordningen av flervalsfrågesvar kan påverka resultaten. Detta kan göra det svårt att se om en rapporterad förbättring speglar verklig framsteg, eller bara någon halvslumpmässig variation i de förhållanden under vilka modellen testades.
Till viss del kan man ta hänsyn till några av dessa variabler, eller åtminstone fastställa vilken felmarginal de genererar, så att jämförande utvärdering blir meningsfull. Det är viktigt att försöka, eftersom mycket pengar och mycket anseende beror på att kunna benchmarka AI-system av detta slag med viss noggrannhet.
Men enligt ny forskning kan en särskild variabel inte bara vara destruktiv för benchmarkar, utan också vara mycket svår att eliminera från de promptar som definierar dem – dagens datum.
Tider förändras
Det nya papperet*, ett akademiskt samarbete mellan Tyskland, Mexiko och USA, påstår att det faktum att det aktuella datumet automatiskt och hemligt inkluderas i systemprompten för alla frontier- och många distributioner av öppna viktmodeller innebär att reproducerbarhet kan vara i praktiken omöjlig:
‘Vi identifierar en kritisk, ofta förbisedda källa till icke-determinism i LLM-utvärdering: den dolda injektionen av det aktuella datumet i systempromptar.’
‘Över 9 modeller, 6 datamängder och fyra uppgifter förändrar denna dynamiska metadata modellens prestanda och omorganiserar ledartavlans placeringar, vilket överstiger variansen som introduceras av andra systemnivåfaktorer såsom batch-storlek eller numerisk precision.’
Forskarna noterar också att den identifierade effekten är större för uppgifter som kräver genererade svar, med prestanda som varierar upp till 6 % på flervalsfrågor, 14 % på matematisk resonemang och 7 % på kodgenerering – och med maskinöversättningsresultat som också varierar avsevärt.
Att tillhandahålla exempel på svar och uppmuntra steg-för-steg-resonemang löste inte problemet – faktiskt gjorde det senare det sämre:

Noggrannhetsfluktuationer över olika datum under 2024 för Llama 3.1 (8B) på MMLU-benchmarken. Steg-för-steg-resonemang (rött) ger avsevärt större variation än direkta svar (blått), vilket visar hur kedjetänkande-promptning förstärker känsligheten för datumet. Källa
Effekten identifierades också i proprietära modeller, där GPT-5.1 visade noggrannhetsfluktuationer på upp till 4 % över tre flervalsbenchmarkar under en veckas testning i december 2025. Forskarna använde en tom systemprompt, inaktiverade resonemang och satte slumpmässighet till noll – men datumet infördes fortfarande automatiskt av leverantören:

GPT-5.1:s noggrannhet fluktuerade över sju på varandra följande dagar i december 2025, trots identiska användarpromptar och modellinställningar. Den största variationen inträffade på GPQA (orange), med fyra procentenheter mellan bästa och sämsta dag. Den streckade linjen representerar varje benchmarks genomsnittliga noggrannhet under veckan.
Forskarna rekommenderar att ta bort datumet från systempromptar där det är möjligt, eller att fixa och dokumentera det, för att säkerställa rättvisa jämförelser. De påpekar dock att datumcentrerad påverkan kan vara mer djupt rotad:
‘En möjlig anledning till datumkänsligheten är att systemprompten kan vara fixerad under övervakad finjustering (SFT) och förstärkningsinlärning från mänsklig återkoppling (RLHF), vilket gör modellen skör för varje liten förändring.’
För att undersöka problemet testade forskarna sex olika formuleringar av systemprompten och fann att dessa förändringar påverkade noggrannheten lika mycket som att ändra datumet (0,78 %). Därför verkar datumet ha lika stor påverkan som avsiktlig promptutformning – förutom att det ändras automatiskt, utan att användaren ens vet om det.
Andra metoder prövades för att mildra problemet med det ‘aktuella datumet’, inklusive few‑shot‑inlärning (där modellen fick fem exempel på svar innan den svarade). Detta hjälpte något och sänkte den genomsnittliga variationen från 2,52 % till 2,27 %, men löste inte problemet.
Ändringar i GPU‑hårdvara, batch‑storlek, numerisk precision, svarssortering och formuleringen av systemprompten testades också. De största effekterna sågs med svarssortering och promptformulering, som kom närmast påverkan av att ändra datumet.
Sista dagar
Det är rimligt att förvänta sig att en LLM/VLM förstår datumet redan från början av en chatt; men det verkar inte finnas någon tydlig anledning att bygga in det i systemprompten (den osedda rubriken som påför säkerhetsgränser och styr LLM:ens beteenden på sätt som är otillgängliga för användaren) när LLM:n rutinmässigt kan göra ett sub‑Kb‑RAG‑anrop för att hämta det senaste datumet som en mindre underhållsrutin innan den interagerar med användaren.
Det råder ingen tvekan om att andra möjligheter finns för att lösa frågan; men eftersom införlivandet av det aktuella datumet i systemprompten hittills inte har uppfattats som ett problem, har det sannolikt gjorts lite eller ingen undersökning i detta avseende.
Online‑dating
För testerna användes identiska prompts för varje modell, med endast datumet i systemprompten ändrat. Varje dag under 2024 testades, från 1 januari till 31 december, med alla andra inställningar oförändrade.
Sex referenspunkter användes: MMLU; GPQA; och ARC‑Challenge för flervalsfrågor (betygsatta efter sannolikheten för svarstoken). GSM8K för steg‑för‑steg‑matematik (slutligt svar kontrollerat); HumanEval för Python‑kodgenerering (enhetstestad); och WMT för översättning från engelska till tyska, engelska till finska och engelska till tjeckiska (fullständig utdata utvärderad). Tidsberoende frågor uteslöts.
Nio modeller testades: Llama 3.1 Instruct (8 B och 70 B); Gemma 3 Instruct (4 B och 27 B); Qwen3 (4 B); Qwen3‑Next (80 B); Phi‑4 (14 B); och GPT‑OSS (20 B och 120 B).
Noggrannhet (procentandelen korrekt besvarade frågor) användes för att betygsätta flervals- och mattesterna, medan förväntat kalibreringsfel (ECE) mätte hur väl modellernas förtroende överensstämde med deras faktiska prestation.
Kod kontrollerades med pass@1 (procentandelen genererade kodlösningar som klarar alla tester på första försöket); översättningar betygsattes med BLEU och chrF.
Resultaten bekräftade forskarnas hypotes: att helt enkelt ändra datumet i systemprompten förändrade hur exakt modellerna svarade på samma frågor.

Testresultat som visar hur fem ledande modeller presterade på MMLU när systempromptens datum ändrades under 2024. Noggrannhet visas högst, med förväntat kalibreringsfel (ECE) nedanför. Alla fem modeller visade fluktuationer i båda måtten, trots att inga andra testförhållanden ändrades. Lägre ECE‑poäng indikerar bättre överensstämmelse mellan förtroende och noggrannhet.
Tillsammans med andra resultat som visats tidigare i artikeln är detta potentiellt dåliga nyheter för LLM‑benchmarking, eftersom en modell kan få ett högre eller lägre resultat beroende på vilken dag den testas, vilket eventuellt kan förändra dess placering på en topplista, utan någon faktisk förbättring eller försämring av dess förmågor.
Slutsats
Denna fråga belyser klyftan mellan de deterministiska datorsystem vi var vana vid fram till omkring 2023 och den mycket annorlunda naturen hos diffusionsbaserade och liknande AI‑system som har utvecklats och fortsätter att utvecklas sedan dess.
Datumupplösning löstes i princip den 1 januari 1970, men har tydligen återkommit för att hemsöka datavärlden i form av avklippningsdatum, bland annat temporala frågor.
* Titulerad ‘Datum för modellen: Dolda datum i systempromptar påverkar LLM-utvärdering’
Först publicerad fredag 9 oktober 2026

![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN-400x240.jpg)
![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN-80x80.jpg)









