Andersons Blickwinkel
Geheime Datumsangaben in Systemprompts untergraben die Bewertung von Sprachmodellen

Ohne die Möglichkeit, Large Language Models (LLMs) zu Benchmarken, ist es für Verbraucher und Unternehmen schwierig zu verstehen, welchen Fortschritt ein Modell in den letzten Versionen gemacht hat und wie es im Vergleich zu seinen Konkurrenten abschneidet:

Die einflussreiche LLM-Bestenliste bei arena.ai. Quelle
Da LLMs nicht-deterministisch sind (d. h., sie werden nicht immer konsistente Ausgaben bei gleichen Eingaben erzeugen), ist ihre Bewertung schwierig. Selbst wenn Forschende identische Prompts, Modelleinstellungen und Benchmark‑Datensätze verwenden, können scheinbar kleine Unterschiede in der Ausführungsumgebung zu unterschiedlichen Antworten führen und die Leistungswerte erheblich verändern.
Faktoren wie die Hardwarekonfiguration, numerische Präzision, Batchgröße für Inferenz und sogar die Reihenfolge der Multiple-Choice-Antworten können die Ergebnisse beeinflussen. Das kann es erschweren zu erkennen, ob ein gemeldeter Fortschritt echten Fortschritt darstellt oder lediglich eine halb‑zufällige Variation der Bedingungen, unter denen das Modell getestet wurde.
Bis zu einem gewissen Grad kann man einige dieser Variablen berücksichtigen oder zumindest das von ihnen erzeugte Fehlermargin bestimmen, sodass ein vergleichender Vergleich sinnvoll wird. Es ist wichtig, dies zu versuchen, da viel Geld und viel Reputation davon abhängen, KI‑Systeme dieser Art mit einer gewissen Genauigkeit benchmarken zu können.
Laut neuer Forschung kann jedoch eine bestimmte Variable nicht nur Benchmarks zerstören, sondern ist auch sehr schwer aus den Prompts, die sie definieren, zu entfernen – heutiges Datum.
Zeiten ändern sich
Das neue Paper*, eine akademische Zusammenarbeit zwischen Deutschland, Mexiko und den USA, behauptet, dass die Tatsache, dass das aktuelle Datum automatisch und heimlich in den Systemprompt aller neuesten und vieler Implementierungen von Open-Weight-Modelle aufgenommen wird, die Reproduzierbarkeit nahezu unmöglich machen könnte:
‘Wir identifizieren eine kritische, oft übersehene Quelle von Nicht‑Determinismus bei der Bewertung von LLMs: die versteckte Injektion des aktuellen Datums in Systemprompts.
‘Über 9 Modelle, 6 Datensätze und vier Aufgaben hinweg verändert diese dynamische Metadaten die Modellleistung und verschiebt die Ranglisten, wobei sie die durch andere systembezogene Faktoren wie Batchgröße oder numerische Präzision eingeführte Varianz übertrifft.’
Die Forschenden stellen zudem fest, dass der identifizierte Effekt bei Aufgaben, die generierte Antworten erfordern, stärker ausgeprägt ist, wobei die Leistung bei Multiple-Choice‑Fragen um bis zu 6 % , beim mathematischen Schließen um 14 % und bei der Code‑Generierung um 7 % variiert – und auch die Werte bei maschineller Übersetzung variieren signifikant.
Das Bereitstellen von Beispielantworten und das Ermutigen zu Schritt-für-Schritt‑Argumentation löste das Problem nicht – tatsächlich machte Letzteres es schlimmer:

Genauigkeitsschwankungen über verschiedene Daten im Jahr 2024 für Llama 3.1 (8B) im MMLU‑Benchmark. Schritt-für-Schritt‑Argumentation (rot) erzeugt wesentlich größere Variabilität als direkte Antworten (blau) und zeigt, wie Chain-of-Thought‑Prompting die Empfindlichkeit gegenüber dem Datum verstärkt. Quelle
Der Effekt wurde auch in proprietären Modellen festgestellt, wobei GPT-5.1 Genauigkeitsschwankungen von bis zu 4 % über drei Multiple-Choice‑Benchmarks während einer Woche Tests im Dezember 2025 zeigte. Die Forschenden verwendeten einen leeren Systemprompt, deaktivierten das Reasoning und setzten Zufälligkeit auf Null – doch das Datum wurde vom Anbieter weiterhin automatisch eingefügt:

Die Genauigkeit von GPT-5.1 schwankte über sieben aufeinanderfolgende Tage im Dezember 2025, trotz identischer Nutzer‑Prompts und Modelleinstellungen. Die größte Variation trat bei GPQA (orange) auf und erreichte vier Prozentpunkte zwischen dem besten und dem schlechtesten Tag. Die gestrichelte Linie stellt die durchschnittliche Genauigkeit jedes Benchmarks über die Woche dar.
Die Forschenden empfehlen, das Datum nach Möglichkeit aus Systemprompts zu entfernen oder es zu fixieren und zu dokumentieren, um faire Vergleiche zu gewährleisten. Sie weisen jedoch darauf hin, dass der datumzentrierte Einfluss tiefer verankert sein könnte:
‘Ein möglicher Grund für die Datumsempfindlichkeit ist, dass der Systemprompt während des Supervised Fine‑Tuning (SFT) und des Reinforcement Learning from Human Feedback (RLHF) festgelegt sein könnte, wodurch das Modell gegenüber jeder kleinen Änderung spröde wird.’
Um das Problem zu untersuchen, probierten die Forschenden sechs verschiedene Formulierungen für den System‑Prompt und stellten fest, dass diese Änderungen die Genauigkeit ebenso stark beeinflussten wie eine Änderung des Datums (0,78 %). Daher scheint das Datum ebenso viel Einfluss zu haben wie bewusste Prompt‑Engineering – nur ändert es sich automatisch, ohne dass der Nutzer es überhaupt bemerkt.
Weitere Ansätze wurden ausprobiert, um das „aktuelles‑Datum“-Problem zu mildern, darunter Few‑Shot‑Learning (bei dem das Modell fünf Beispielantworten erhielt, bevor es antwortete). Das half ein wenig und reduzierte die durchschnittliche Schwankung von 2,52 % auf 2,27 %, behebt das Problem jedoch nicht.
Änderungen bei GPU‑Hardware, Batch‑Größe, numerischer Präzision, Antwortreihenfolge und Formulierung des System‑Prompts wurden ebenfalls getestet. Die größten Effekte zeigten sich bei der Antwortreihenfolge und der Prompt‑Formulierung, die dem Einfluss einer Datumsänderung am nächsten kamen.
Last Days
Es ist vernünftig anzunehmen, dass ein LLM/VLM das Datum von Beginn eines Chats versteht; jedoch gibt es keinen offensichtlichen Grund, es in den System‑Prompt (die unsichtbare Rubrik, die Guardrails auferlegt und das Verhalten des LLM in für den Nutzer nicht zugängliche Weise konditioniert) einzubauen, wenn das LLM routinemäßig einen Sub‑KB‑RAG‑Aufruf tätigen könnte, um das aktuelle Datum als kleine Verwaltungsroutine vor der Interaktion mit dem Nutzer zu erfassen.
Zweifellos gibt es weitere Möglichkeiten, das Problem zu lösen; jedoch, da die Einbindung des aktuellen Datums in den System‑Prompt bislang nicht als Problem wahrgenommen wurde, wurde vermutlich wenig bis gar nicht danach geforscht.
Online Dating
Für die Tests wurden für jedes Modell identische Prompts verwendet, wobei nur das Datum im System‑Prompt geändert wurde. Jeder Tag des Jahres 2024 wurde getestet, vom 1. Januar bis zum 31. Dezember, wobei alle anderen Einstellungen gleich blieben.
Sechs Benchmarks wurden verwendet: MMLU; GPQA; und ARC‑Challenge für Multiple‑Choice‑Fragen (bewertet nach der Wahrscheinlichkeit des Antwort‑Tokens). GSM8K für schrittweise Mathematik (Endantwort geprüft); HumanEval für Python‑Code‑Generierung (unit‑getestet); und WMT für Übersetzungen Englisch‑Deutsch; Englisch‑Finnisch; und Englisch‑Tschechisch (vollständige Ausgabe bewertet). Zeitabhängige Fragen wurden ausgeschlossen.
Neun Modelle wurden getestet: Llama 3.1 Instruct (8 B und 70 B); Gemma 3 Instruct (4 B und 27 B); Qwen3 (4 B); Qwen3‑Next (80 B); Phi‑4 (14 B); und GPT‑OSS (20 B und 120 B).
Die Genauigkeit (der Prozentsatz korrekt beantworteter Fragen) wurde zur Bewertung der Multiple‑Choice‑ und Mathematik‑Tests verwendet, während Expected Calibration Error (ECE) maß, wie gut das Vertrauen der Modelle mit ihrer tatsächlichen Leistung übereinstimmte.
Der Code wurde mit pass@1 geprüft (der Prozentsatz der generierten Code‑Lösungen, die beim ersten Versuch alle Tests bestehen); Übersetzungen wurden mit BLEU und chrF bewertet.
Die Ergebnisse bestätigten die Hypothese der Forschenden: Allein die Änderung des Datums im System‑Prompt veränderte, wie genau die Modelle dieselben Fragen beantworteten.

Testergebnisse, die zeigen, wie fünf führende Modelle bei MMLU abschneiden, während das Datum des System‑Prompts im Verlauf des Jahres 2024 geändert wurde. Die Genauigkeit wird oben angezeigt, darunter der erwartete Kalibrierungsfehler (ECE). Alle fünf Modelle zeigten Schwankungen in beiden Messgrößen, obwohl keine anderen Testbedingungen geändert wurden. Niedrigere ECE‑Werte deuten auf eine bessere Übereinstimmung zwischen Vertrauen und Genauigkeit hin.
Zusammen mit den anderen im Artikel gezeigten Ergebnissen ist dies potenziell schlechte Nachricht für das Benchmarking von LLMs, da ein Modell je nach Testtag besser oder schlechter abschneiden könnte, was seine Position in einer Rangliste verändern kann, ohne dass es tatsächlich an Fähigkeiten zu- oder abnimmt.
Conclusion
Dieses Problem verdeutlicht die Kluft zwischen den deterministischen Computersystemen, an die wir bis etwa 2023 gewöhnt waren, und der völlig anderen Natur von diffusionsbasierten und ähnlichen KI‑Systemen, die sich seitdem entwickelt haben und weiterentwickeln.
Die Datumsauflösung wurde im Wesentlichen am 1. Januar 1970 gelöst, ist jedoch offenbar wieder als cut‑off dates in die Welt der Informatik zurückgekehrt, neben anderen temporal concerns.
* Betitelt ‘Datierung des Modells: Versteckte Daten in Systemaufforderungen beeinflussen die Bewertung von LLMs’
Erstveröffentlicht am Freitag, den 9. Oktober 2026

![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN-400x240.jpg)
![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN-80x80.jpg)









