Angolo di Anderson
Date segrete nei prompt di sistema compromettono la valutazione dei modelli linguistici

Senza la possibilità di valutare i Large Language Models (LLM), è difficile per consumatori e imprese capire quale progresso abbia compiuto un modello nelle versioni recenti e come si confronti con i concorrenti:

La classifica influente dei LLM su arena.ai. Fonte
Poiché i LLM sono non deterministici (cioè, non produrranno sempre output coerenti dato lo stesso input), valutarli è complicato. Anche quando i ricercatori usano prompt identici, impostazioni del modello e set di benchmark, differenze apparentemente minori nell’ambiente di esecuzione possono produrre risposte diverse e alterare significativamente i punteggi di performance.
Fattori come la configurazione hardware, precisione numerica, dimensione del batch di inferenza, e persino l’ordine delle risposte a scelta multipla possono influenzare i risultati. Questo può rendere difficile capire se un miglioramento segnalato rifletta un reale progresso, o semplicemente una variazione semi‑casuale nelle condizioni in cui il modello è stato testato.
In una certa misura, è possibile tenere conto di alcune di queste variabili, o almeno determinare quale margine di errore generino, così che la valutazione comparativa diventi significativa. È importante provare, poiché molte risorse finanziarie e molta reputazione dipendono dalla capacità di eseguire benchmark su sistemi IA di questo tipo con un certo grado di precisione.
Tuttavia, secondo nuove ricerche, una particolare variabile non solo è distruttiva per i benchmark, ma è anche molto difficile da eliminare dai prompt che li definiscono – la data odierna.
I tempi cambiano
Il nuovo articolo*, una collaborazione accademica tra Germania, Messico e USA, afferma che il fatto che la data corrente sia inserita automaticamente e segretamente nel prompt di sistema di tutti i modelli all’avanguardia e di molte implementazioni di modelli a peso aperto rende la riproducibilità quasi impossibile:
‘Identifichiamo una fonte critica, spesso trascurata, di non‑determinismo nella valutazione dei LLM: l’iniezione nascosta della data corrente nei prompt di sistema. ‘
‘Su 9 modelli, 6 dataset e quattro compiti, questi metadati dinamici alterano le prestazioni del modello e rimescolano le classifiche, superando la varianza introdotta da altri fattori a livello di sistema come la dimensione del batch o la precisione numerica.’
I ricercatori osservano inoltre che l’effetto identificato è più marcato per i compiti che richiedono risposte generate, con prestazioni che variano fino al 6% nelle domande a scelta multipla, al 14% nel ragionamento matematico e al 7% nella generazione di codice – e con i punteggi di traduzione automatica che variano anch’essi in modo significativo.
Fornire risposte di esempio e ragionamento passo passo non ha risolto il problema – anzi, quest’ultimo lo ha peggiore:

Fluttuazioni di accuratezza su date diverse nel 2024 per Llama 3.1 (8B) sul benchmark MMLU. Il ragionamento passo passo (rosso) produce una variabilità sostanzialmente maggiore rispetto alle risposte dirette (blu), dimostrando come il prompting a catena di pensiero amplifichi la sensibilità alla data. Fonte
L’effetto è stato identificato anche nei modelli proprietari, con GPT-5.1 che mostra fluttuazioni di accuratezza fino al 4% su tre benchmark a scelta multipla durante una settimana di test a dicembre 2025. I ricercatori hanno usato un prompt di sistema vuoto, hanno disabilitato il ragionamento e hanno impostato la casualità a zero – ma la data è stata comunque inserita automaticamente dal provider:

L’accuratezza di GPT-5.1 è fluttuata su sette giorni consecutivi a dicembre 2025, nonostante prompt utente e impostazioni del modello identici. La variazione più ampia si è verificata su GPQA (arancione), raggiungendo quattro punti percentuali tra il giorno migliore e quello peggiore. La linea tratteggiata rappresenta l’accuratezza media di ciascun benchmark durante la settimana.
I ricercatori raccomandano di rimuovere la data dai prompt di sistema dove possibile, oppure di fissarla e documentarla, per garantire confronti equi. Tuttavia, osservano che l’influenza centrata sulla data potrebbe essere più radicata:
‘Una possibile ragione della sensibilità alla data è che il prompt di sistema potrebbe essere fissato durante il fine‑tuning supervisionato (SFT) e l’apprendimento per rinforzo dal feedback umano (RLHF), rendendo il modello fragile a qualsiasi lieve modifica.’
Per indagare il problema, i ricercatori hanno provato sei diverse formulazioni del prompt di sistema e hanno scoperto che queste modifiche hanno influenzato l’accuratezza tanto quanto la variazione della data (0,78%). Pertanto la data sembra avere un’influenza pari a quella della deliberata prompt engineering – salvo che cambia automaticamente, senza che l’utente se ne accorga.
Sono stati provati altri approcci per mitigare il problema della “data corrente”, tra cui few-shot learning (in cui il modello riceveva cinque risposte di esempio prima di rispondere). Questo ha aiutato un po’, riducendo la variazione media dal 2,52% al 2,27%, ma non ha risolto il problema.
Sono stati testati anche cambiamenti nell’hardware GPU, nella dimensione del batch, nella precisione numerica, nell’ordine delle risposte e nella formulazione del prompt di sistema. Gli effetti più rilevanti si sono osservati con l’ordine delle risposte e la formulazione del prompt, che si sono avvicinati maggiormente all’impatto della variazione della data.
Ultimi Giorni
È ragionevole aspettarsi che un LLM/VLM comprenda la data fin dall’inizio di una conversazione; tuttavia, non sembra esserci alcuna ragione esplicita per includerla nel prompt di sistema (la rubrica invisibile che impone guardrails e condiziona i comportamenti del LLM in modi inaccessibili all’utente) quando il LLM potrebbe regolarmente effettuare una chiamata RAG di meno di un kilobyte per acquisire la data più recente, come una piccola operazione di manutenzione prima di interagire con l’utente.
Non c’è dubbio che esistano altre possibilità per risolvere la questione; tuttavia, poiché l’inserimento della data corrente nel prompt di sistema non è stato finora percepito come un problema, presumibilmente c’è stata poca o nessuna indagine a riguardo.
Incontri Online
Per i test, sono stati utilizzati prompt identici per ogni modello, modificando solo la data nel prompt di sistema. È stata testata ogni giornata del 2024, dal 1° gennaio al 31 dicembre, mantenendo invariate tutte le altre impostazioni.
Sono stati utilizzati sei benchmark: MMLU; GPQA; e ARC-Challenge, per domande a scelta multipla (valutate in base alla probabilità del token di risposta). GSM8K per matematica passo‑passo (controllata la risposta finale); HumanEval per la generazione di codice Python (testato unitariamente); e WMT per la traduzione dall’inglese al tedesco, dall’inglese al finlandese e dall’inglese al ceco (valutata l’intera output). Le domande dipendenti dal tempo sono state escluse.
Sono stati testati nove modelli: Llama 3.1 Instruct (8B e 70B); Gemma 3 Instruct (4B e 27B); Qwen3 (4B); Qwen3-Next (80B); Phi-4 (14B); e GPT-OSS (20B e 120B).
L’accuratezza (la percentuale di domande risposte correttamente) è stata usata per valutare i test a scelta multipla e di matematica, mentre Expected Calibration Error (ECE) misurava quanto la fiducia dei modelli corrispondesse alle loro prestazioni reali.
Il codice è stato verificato usando pass@1 (la percentuale di soluzioni di codice generate che superano tutti i test al primo tentativo); le traduzioni sono state valutate con BLEU e chrF.
I risultati hanno confermato l’ipotesi dei ricercatori: il semplice cambiamento della data nel prompt di sistema ha modificato la precisione con cui i modelli rispondevano alle stesse domande.

Risultati dei test che mostrano come cinque modelli leader hanno performato su MMLU mentre la data del prompt di sistema veniva modificata nel corso del 2024. L’accuratezza è mostrata in alto, con l’errore di calibrazione previsto (ECE) sotto. Tutti e cinque i modelli hanno mostrato fluttuazioni in entrambe le misure, nonostante nessun altro cambiamento nelle condizioni del test. Punteggi ECE più bassi indicano un migliore allineamento tra fiducia e accuratezza.
Insieme ad altri risultati mostrati in precedenza nell’articolo, questa è potenzialmente una cattiva notizia per il benchmarking dei LLM, poiché un modello potrebbe ottenere un punteggio migliore o peggiore a seconda del giorno in cui è stato testato, potenzialmente modificando la sua posizione in una classifica, senza alcun reale miglioramento o deterioramento delle sue capacità.
Conclusione
Questo problema evidenzia il divario tra i sistemi informatici deterministici a cui eravamo abituati fino a circa il 2023 e la natura molto diversa dei sistemi IA basati su diffusione e simili, che si sono evoluti e continuano a evolversi da allora.
La risoluzione della data era sostanzialmente risolta il 1° gennaio 1970, ma è apparentemente tornata a perseguitare il mondo dell’informatica sotto forma di cut-off dates, tra le altre temporal concerns.
* Intitolato ‘Datare il Modello: Date Nascoste nei Prompt di Sistema Influenzano la Valutazione dei LLM’
Pubblicato per la prima volta venerdì 9 ottobre 2026

![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN-400x240.jpg)
![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN-80x80.jpg)









