Angle d’Anderson
Les dates secrètes dans les invites système sapent l’évaluation des modèles de langage

Sans la capacité de test de référence les grands modèles de langage (LLM), il est difficile pour les consommateurs et les entreprises de comprendre les progrès réalisés par un modèle au fil des versions récentes, et comment il se compare à ses concurrents :

Le tableau de bord influent des LLM sur arena.ai. Source
Comme les LLM sont non déterministes (c’est‑à‑dire qu’ils pas produiront toujours des sorties cohérentes pour les mêmes entrées), les évaluer est délicat. Même lorsque les chercheurs utilisent des invites identiques, des réglages de modèle et des jeux de données de référence, des différences apparemment mineures dans l’environnement d’exécution peuvent produire des réponses différentes et modifier de façon significative les scores de performance.
Des facteurs tels que la configuration matérielle, précision numérique, taille de lot d’inférence, et même l’ordre des réponses à choix multiples peuvent influencer les résultats. Cela peut rendre difficile de déterminer si une amélioration signalée reflète un réel progrès, ou simplement une variation semi‑aléatoire des conditions dans lesquelles le modèle a été testé.
Dans une certaine mesure, on peut tenir compte de certaines de ces variables, ou du moins déterminer la marge d’erreur qu’elles génèrent, afin que l’évaluation comparative devienne significative. Il est important d’essayer, car beaucoup d’argent et beaucoup de réputation dépendent de la capacité à évaluer ces systèmes d’IA avec un certain degré de précision.
Cependant, selon de nouvelles recherches, une variable particulière peut non seulement nuire aux évaluations, mais est également très difficile à éliminer des invites qui les définissent – la date du jour.
Les temps changent
Le nouvel article*, une collaboration académique entre l’Allemagne, le Mexique et les États‑Unis, affirme que le fait que la date actuelle soit automatiquement et secrètement incluse dans l’invite système de toutes les technologies de pointe et de nombreux déploiements de modèles à poids ouvert rend la reproductibilité presque impossible :
‘Nous identifions une source critique, souvent négligée, de non‑déterminisme dans l’évaluation des LLM : l’injection cachée de la date actuelle dans les invites système.
‘À travers 9 modèles, 6 ensembles de données et quatre tâches, ces métadonnées dynamiques modifient les performances du modèle et remettent à jour le classement du tableau de bord, dépassant la variance introduite par d’autres facteurs au niveau du système tels que la taille de lot ou la précision numérique.’
Les chercheurs notent également que l’effet identifié est plus important pour les tâches nécessitant des réponses générées, la performance variant jusqu’à 6 % sur les questions à choix multiples, 14 % sur le raisonnement mathématique et 7 % sur la génération de code – et les scores de traduction automatique varient également de façon significative.
Fournir des réponses d’exemple et encourager le raisonnement étape par étape n’a pas résolu le problème – en fait, ce dernier l’a rendu pire :

Fluctuations de précision à travers différentes dates en 2024 pour Llama 3.1 (8B) sur le benchmark MMLU. Le raisonnement étape par étape (rouge) produit une variabilité nettement supérieure à celle des réponses directes (bleu), démontrant comment l’incitation à la chaîne de pensée amplifie la sensibilité à la date. Source
L’effet a également été identifié dans les modèles propriétaires, GPT-5.1 affichant des fluctuations de précision allant jusqu’à 4 % sur trois benchmarks à choix multiples au cours d’une semaine de tests en décembre 2025. Les chercheurs ont utilisé une invite système vide, désactivé le raisonnement et fixé aléatoire à zéro – mais la date était encore insérée automatiquement par le fournisseur :

La précision de GPT-5.1 a fluctué sur sept jours consécutifs en décembre 2025, malgré des invites utilisateur et des réglages de modèle identiques. La plus grande variation est survenue sur GPQA (orange), atteignant quatre points de pourcentage entre les meilleurs et les pires jours. La ligne pointillée représente la précision moyenne de chaque benchmark sur la semaine.
Les chercheurs recommandent de supprimer la date des invites système lorsque cela est possible, ou de la corriger et la documenter, afin d’assurer des comparaisons équitables. Cependant, ils notent que l’influence centrée sur la date peut être plus profondément ancrée :
‘Une raison possible de la sensibilité à la date est que l’invite système pourrait être figée pendant le fine‑tuning supervisé (SFT) et l’apprentissage par renforcement à partir de retours humains (RLHF), rendant le modèle fragile à la moindre modification.’
Pour enquêter sur le problème, les chercheurs ont testé six formulations différentes du prompt système et ont constaté que ces changements affectaient la précision autant que la modification de la date (0,78 %). Ainsi, la date semble avoir autant d’influence que le prompt engineering délibéré – sauf qu’elle change automatiquement, sans que l’utilisateur ne le sache.
D’autres approches ont été tentées pour atténuer le problème de « date actuelle », notamment le few-shot learning (où le modèle reçoit cinq réponses d’exemple avant de répondre). Cela a aidé légèrement, faisant passer la variation moyenne de 2,52 % à 2,27 %, mais n’a pas résolu le problème.
Des variations du matériel GPU, de la taille de lot, de la précision numérique, de l’ordre des réponses et de la formulation du prompt système ont également été testées. Les effets les plus importants ont été observés avec l’ordre des réponses et la formulation du prompt, qui se sont rapprochés de l’impact d’une modification de la date.
Last Days
Il est raisonnable de s’attendre à ce qu’un LLM/VLM comprenne la date dès le début d’une conversation ; toutefois, il ne semble y avoir aucune raison explicite de l’intégrer dans le prompt système (la grille invisible qui impose des guardrails et conditionne les comportements du LLM de manière inaccessible à l’utilisateur) alors que le LLM pourrait régulièrement effectuer un appel RAG de moins d’un kilo‑octet pour récupérer la date la plus récente, comme une petite tâche de maintenance avant d’interagir avec l’utilisateur.
Il ne fait aucun doute que d’autres solutions existent pour résoudre la question ; cependant, comme l’insertion de la date actuelle dans le prompt système n’a jusqu’à présent pas été perçue comme un problème, il y a probablement eu peu ou pas d’enquête à ce sujet.
Online Dating
Pour les tests, des prompts identiques ont été utilisés pour chaque modèle, seule la date du prompt système étant modifiée. Chaque jour de 2024 a été testé, du 1 janvier au 31 décembre, tous les autres paramètres restant identiques.
Six jeux de référence ont été utilisés : MMLU ; GPQA ; et ARC-Challenge, pour des questions à choix multiples (évaluées par la probabilité du token de réponse). GSM8K pour les mathématiques pas à pas (réponse finale vérifiée) ; HumanEval pour la génération de code Python (tests unitaires) ; et WMT pour la traduction anglais‑allemand, anglais‑finnois et anglais‑tchèque (sortie complète évaluée). Les questions dépendant du temps ont été exclues.
Neuf modèles ont été testés : Llama 3.1 Instruct (8B et 70B) ; Gemma 3 Instruct (4B et 27B) ; Qwen3 (4B) ; Qwen3‑Next (80B) ; Phi‑4 (14B) ; et GPT‑OSS (20B et 120B).
La précision (pourcentage de réponses correctes) a été utilisée pour évaluer les tests à choix multiples et de mathématiques, tandis que Expected Calibration Error (ECE) mesurait dans quelle mesure la confiance des modèles correspondait à leurs performances réelles.
Le code a été vérifié à l’aide de pass@1 (pourcentage de solutions de code générées qui réussissent tous les tests dès la première tentative) ; les traductions ont été évaluées avec BLEU et chrF.
Les résultats ont confirmé l’hypothèse des chercheurs : modifier simplement la date dans le prompt système a changé la précision avec laquelle les modèles répondaient aux mêmes questions.

Résultats des tests montrant la performance de cinq modèles de pointe sur le MMLU lorsque la date du prompt système a été modifiée tout au long de 2024. La précision est affichée en haut, avec l’erreur de calibration attendue (ECE) en dessous. Les cinq modèles ont présenté des fluctuations sur les deux mesures, malgré l’absence d’autres changements dans les conditions du test. Des scores ECE plus faibles indiquent une meilleure adéquation entre la confiance et la précision.
Avec les autres résultats présentés plus haut dans l’article, cela constitue potentiellement une mauvaise nouvelle pour l’évaluation des LLM, car un modèle pourrait obtenir un meilleur ou un pire score selon le jour où il est testé, ce qui pourrait modifier sa place sur un classement, sans aucune amélioration ou détérioration réelle de ses capacités.
Conclusion
Ce problème met en évidence le fossé entre les systèmes informatiques déterministes auxquels nous étions habitués avant environ 2023, et la nature très différente des systèmes d’IA basés sur la diffusion et similaires, qui ont évolué et continuent d’évoluer depuis.
La résolution de la date a été essentiellement résolue le 1 janvier 1970, mais est apparemment revenue hanter le monde de l’informatique sous la forme de cut‑off dates, parmi d’autres temporal concerns.
* Intitulé ‘Datage du modèle : dates cachées dans les invites système affectent l’évaluation des LLM’
Première publication vendredi 9 octobre 2026

![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN-400x240.jpg)
![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN-80x80.jpg)









