Andersonův úhel
Tajná data v systémových výzvách podkopávají hodnocení jazykových modelů

Bez možnosti benchmark velkých jazykových modelů (LLM) je pro spotřebitele i podniky obtížné pochopit, jaký pokrok model učinil v nedávných verzích a jak si stojí vůči konkurenci:

Vlivná žebříček LLM na arena.ai. Zdroj
Protože LLM jsou nedeterministické (tj. ne vždy nevytvářejí konzistentní výstupy při stejných vstupech), jejich hodnocení je obtížné. I když výzkumníci používají identické výzvy, nastavení modelu a benchmarkové datové sady, zdánlivě drobné rozdíly v prostředí provádění mohou vést k odlišným odpovědím a podstatně změnit výkonnostní skóre.
Faktory jako konfigurace hardwaru, číselná přesnost, velikost dávky inferencí a dokonce pořadí odpovědí při výběrových otázkách mohou ovlivnit výsledky. To může ztížit zjistit, zda hlášené zlepšení odráží skutečný pokrok, nebo jen nějakou polonáhodnou variaci podmínek, za kterých byl model testován.
Do určité míry lze tyto proměnné zohlednit, nebo alespoň stanovit, jakou chybu generují, aby srovnávací hodnocení mělo smysl. Je důležité to zkusit, protože hodně peněz i reputace závisí na tom, že lze takové AI systémy s určitou přesností benchmarkovat.
Nicméně podle nového výzkumu může být jedna konkrétní proměnná nejen destruktivní pro benchmarky, ale také velmi obtížně odstranitelná z výzev, které je definují – aktuální datum.
Časy se mění
Nový článek*, akademická spolupráce mezi Německem, Mexikem a USA, tvrdí, že fakt, že aktuální datum je automaticky a tajně zahrnuto do systémové výzvy všech špičkových a mnoha nasazení modelů s otevřenou vahou, může učinit reprodukovatelnost téměř nemožnou:
‘Identifikujeme kritický, často přehlížený zdroj nedeterminismu v hodnocení LLM: skryté vložení aktuálního data do systémových výzev.’
‘Napříč 9 modely, 6 datovými sadami a čtyřmi úkoly tato dynamická metadata mění výkon modelu a přeskupuje žebříčkové pořadí, překonávajíce variabilitu zavedenou jinými faktory na úrovni systému, jako je velikost dávky nebo číselná přesnost.’
Výzkumníci také poznamenávají, že identifikovaný efekt je větší u úkolů vyžadujících generované odpovědi, přičemž výkon se může lišit až o 6 % u výběrových otázek, 14 % u matematického uvažování a 7 % při generování kódu – a skóre strojového překladu také výrazně kolísají.
Poskytnutí příkladových odpovědí a podpora krokového uvažování problém nevyřešily – naopak, to horší.

Kolísání přesnosti napříč různými daty v roce 2024 pro Llama 3.1 (8B) na benchmarku MMLU. Krokové uvažování (červená) vytváří podstatně větší variabilitu než přímé odpovědi (modrá), což demonstruje, jak řetězcové myšlení zvyšuje citlivost na datum. Zdroj
Efekt byl také zaznamenán u proprietárních modelů, přičemž GPT-5.1 vykazoval kolísání přesnosti až o 4 % napříč třemi výběrovými benchmarky během týdne testování v prosinci 2025. Výzkumníci použili prázdnou systémovou výzvu, zakázali uvažování a nastavili náhodnost na nulu – ale datum bylo poskytovatelem stále automaticky vloženo:

Přesnost GPT-5.1 kolísala po dobu sedmi po sobě jdoucích dnů v prosinci 2025, navzdory identickým uživatelským výzvám a nastavením modelu. Největší odchylka nastala u GPQA (oranžová), kde se rozdíl mezi nejlepším a nejhorším dnem pohyboval čtyřmi procentními body. Čerchovaná čára představuje průměrnou přesnost každého benchmarku během týdne.
Výzkumníci doporučují, kde je to možné, odstranit datum ze systémových výzev, nebo jej opravit a zdokumentovat, aby byly zajištěny spravedlivé srovnání. Nicméně poznamenávají, že vliv soustředěný na datum může být hluboce zakořeněn:
‘Jedním možným důvodem citlivosti na datum je, že systémová výzva může být pevně nastavena během dozorovaného jemného ladění (SFT) a posilovaného učení z lidské zpětné vazby (RLHF), což činí model křehkým vůči jakékoli drobné úpravě.’
Aby prozkoumali problém, výzkumníci vyzkoušeli šest různých formulací systémového promptu a zjistili, že tyto změny ovlivnily přesnost stejně jako změna data (0.78%). Proto se zdá, že datum má stejný vliv jako úmyslné inženýrství promptů – s výjimkou toho, že se mění automaticky, aniž by si to uživatel všiml.
Byly vyzkoušeny i jiné přístupy k omezení problému „aktuálního data“, včetně učení s několika příklady (kde model získal pět ukázkových odpovědí před tím, než odpověděl). To pomohlo mírně, snížilo průměrnou odchylku z 2.52% na 2.27%, ale problém nevyřešilo.
Byly také testovány změny v GPU hardware, velikosti batch, numerické přesnosti, pořadí odpovědí a formulaci systémového promptu. Největší účinky byly zaznamenány u pořadí odpovědí a formulace promptu, které se nejvíce přiblížily vlivu změny data.
Poslední dny
Je rozumné očekávat, že LLM/VLM pochopí datum již od samého začátku konverzace; nicméně se nezdá existovat žádný explicitní důvod zahrnout ho do systémového promptu (neviditelného kritéria, které ukládá ochranné zábrany a podmiňuje chování LLM způsoby nepřístupnými uživateli), když by LLM mohl pravidelně provést sub‑Kb RAG volání k načtení nejnovějšího data jako drobnou údržbovou operaci před zapojením uživatele.
Nepochybně existují i jiné možnosti, jak tuto záležitost vyřešit; nicméně vzhledem k tomu, že začlenění aktuálního data do systémového promptu doposud nebylo vnímáno jako problém, pravděpodobně nebylo provedeno mnoho či žádné zkoumání v této oblasti.
Online seznamování
Pro testy byly použity identické prompty pro každý model, přičemž byl měněn pouze datum v systémovém promptu. Byly testovány všechny dny roku 2024, od 1. ledna do 31. prosince, přičemž všechna ostatní nastavení zůstala stejná.
Bylo použito šest benchmarků: MMLU; GPQA; a ARC-Challenge pro výběrové otázky (hodnoceno pravděpodobností tokenu odpovědi). GSM8K pro krok‑po‑kroku matematiku (kontrola konečného výsledku); HumanEval pro generování Python kódu (testováno jednotkově); a WMT pro překlad z angličtiny do němčiny, do finštiny a do češtiny (hodnoceno kompletní výstup). Časově závislé otázky byly vyloučeny.
Bylo testováno devět modelů: Llama 3.1 Instruct (8B a 70B); Gemma 3 Instruct (4B a 27B); Qwen3 (4B); Qwen3-Next (80B); Phi-4 (14B); a GPT-OSS (20B a 120B).
Přesnost (procento správně zodpovězených otázek) byla použita k hodnocení testů s výběrovými otázkami a matematiky, zatímco Očekávaná kalibrační chyba (ECE) měřila, jak dobře se důvěra modelů shodovala s jejich skutečným výkonem.
Kód byl ověřen pomocí pass@1 (procento vygenerovaných kódových řešení, která prošla všemi testy na první pokus); překlady byly hodnoceny pomocí BLEU a chrF.
Výsledky potvrdily hypotézu výzkumníků: pouhá změna data v systémovém promptu změnila, jak přesně modely odpovídaly na stejné otázky.

Výsledky testu ukazující, jak pět předních modelů podávalo na MMLU při změně data systémového promptu během roku 2024. Přesnost je zobrazena nahoře, pod ní očekávaná kalibrační chyba (ECE). Všechny modely vykazovaly kolísání v obou měřeních, přestože nedošlo k žádným dalším změnám podmínek testu. Nižší hodnoty ECE naznačují lepší shodu mezi důvěrou a přesností.
Spolu s dalšími výsledky uvedenými dříve v článku to představuje potenciálně špatnou zprávu pro benchmarkování LLM, protože model může získat lepší nebo horší skóre v závislosti na tom, který den byl testován, což může změnit jeho pozici na žebříčku, aniž by došlo k jakémukoli skutečnému zlepšení či zhoršení jeho schopností.
Závěr
Tento problém zdůrazňuje rozdíl mezi deterministickými výpočetními systémy, na které jsme byli zvyklí před rokem 2023, a naprosto odlišnou povahou difúzních a podobných AI systémů, které se od té doby vyvíjejí a nadále vyvíjejí.
Rozlišení data bylo v podstatě vyřešeno 1. ledna 1970, ale zřejmě se vrátilo, aby pronásledovalo svět výpočetní techniky ve formě uzávěrových termínů, mezi dalšími časovými problémy.
* Nazvaný ‘Datování modelu: Skryté datumy v systémových promtech ovlivňují hodnocení LLM’
Poprvé publikováno pátek 9. října 2026

![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN-400x240.jpg)
![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN-80x80.jpg)









