Unghiul lui Anderson

Datele secrete din prompturile de sistem subminează evaluarea modelelor de limbaj

mm
Adaugă Unite.AI la sursele tale preferate pe Google
Harold Lloyd hangs from a clock face in Safety Last! (1923). The film is in the US public domain.. Source: https://www.youtube.com/watch?v=tzh4htLXp6Q

Fără capacitatea de a test comparativ Modelele Mari de Limbaj (LLM-uri), este dificil pentru consumatori și afaceri să înțeleagă ce progres a realizat un model în versiunile recente și cum se compară cu concurenții săi:

Clasamentul influent al LLM-urilor de la arena.ai. Sursă: https://arena.ai/leaderboard/chat/text

Clasamentul influent al LLM-urilor de la arena.ai. Sursă

Deoarece LLM-urile sunt nedeterministe (adică, ele nu vor produce întotdeauna ieșiri coerente pentru aceleași intrări), evaluarea lor este complicată. Chiar și atunci când cercetătorii utilizează prompturi identice, setări ale modelului și seturi de date de benchmark, diferențe aparent minore în mediul de execuție pot genera răspunsuri diferite și pot altera semnificativ scorurile de performanță.

Factori precum configurația hardware, precizia numerică, dimensiunea lotului de inferență, și chiar ordinea răspunsurilor la întrebările cu alegere multiplă pot influența rezultatele. Acest lucru poate face dificil să se determine dacă o îmbunătățire raportată reflectă un progres real sau doar o variație semi‑aleatorie a condițiilor în care modelul a fost testat.

Într-o anumită măsură, se pot ține cont de unele dintre aceste variabile sau, cel puțin, se poate stabili ce marjă de eroare generează, astfel încât evaluarea comparativă să devină semnificativă. Este important să se încerce, deoarece o sumă considerabilă de bani și o reputație importantă depind de capacitatea de a evalua comparativ sistemele AI de acest tip cu un anumit grad de precizie.

Cu toate acestea, potrivit unor cercetări noi, o anumită variabilă nu numai că poate distruge benchmark-urile, ci este și foarte dificil de eliminat din prompturile care le definesc – data curentă.

Timpul se schimbă

Noua lucrare*, o colaborare academică între Germania, Mexic și SUA, susține că faptul că data curentă este inclusă automat și în secret în promptul de sistem al tuturor modelelor de frontieră și al multor implementări ale modelelor cu greutăţi deschise înseamnă că reproducibilitatea ar putea fi aproape imposibilă:

‘Identificăm o sursă critică, adesea neglijată, de nondeterminism în evaluarea LLM-urilor: injectarea ascunsă a datei curente în prompturile de sistem.’

‘În cadrul a 9 modele, 6 seturi de date și patru sarcini, aceste metadate dinamice modifică performanța modelului și rearanjează clasamentele, depășind variația introdusă de alți factori la nivel de sistem, cum ar fi dimensiunea lotului sau precizia numerică.’

Cercetătorii observă, de asemenea, că efectul identificat este mai pronunțat pentru sarcini care necesită răspunsuri generate, performanța variind cu până la 6 % la întrebările cu alegere multiplă, 14 % la raționamentul matematic și 7 % la generarea de cod – iar scorurile de traducere automată variază, de asemenea, semnificativ.

Furnizarea de răspunsuri exemplare și încurajarea raționamentului pas cu pas nu a rezolvat problema – de fapt, aceasta a făcut-o mai gravă:

Fluctuații ale acurateții în funcție de diferite date în 2024 pentru Llama 3.1 (8B) pe benchmark-ul MMLU. Raționamentul pas cu pas (roșu) produce o variabilitate mult mai mare decât răspunsurile directe (albastru), demonstrând cum prompting‑ul de tip lanț de gândire amplifică sensibilitatea la dată. Sursă - https://arxiv.org/pdf/2609.36931

Fluctuații ale acurateții în funcție de diferite date în 2024 pentru Llama 3.1 (8B) pe benchmark-ul MMLU. Raționamentul pas cu pas (roșu) produce o variabilitate mult mai mare decât răspunsurile directe (albastru), demonstrând cum prompting‑ul de tip lanț de gândire amplifică sensibilitatea la dată. Sursă

Efectul a fost identificat și în modele proprietare, GPT-5.1 afișând fluctuații ale acurateții de până la 4 % pe trei benchmark-uri cu întrebări cu alegere multiplă în timpul unei săptămâni de testare în decembrie 2025. Cercetătorii au utilizat un prompt de sistem gol, au dezactivat raționamentul și au setat aleatorietatea la zero – dar data a fost în continuare inserată automat de furnizor:

Acuratețea lui GPT-5.1 a fluctuat pe parcursul a șapte zile consecutive în decembrie 2025, în ciuda prompturilor utilizatorului identice și a setărilor modelului. Cea mai mare variație a avut loc la GPQA (portocaliu), atingând patru puncte procentuale între cea mai bună și cea mai proastă zi. Linia punctată reprezintă media acurateții fiecărui benchmark pe săptămână.

Acuratețea lui GPT-5.1 a fluctuat pe parcursul a șapte zile consecutive în decembrie 2025, în ciuda prompturilor utilizatorului identice și a setărilor modelului. Cea mai mare variație a avut loc la GPQA (portocaliu), atingând patru puncte procentuale între cea mai bună și cea mai proastă zi. Linia punctată reprezintă media acurateții fiecărui benchmark pe săptămână.

Cercetătorii recomandă eliminarea datei din prompturile de sistem acolo unde este posibil, sau corectarea și documentarea acesteia, pentru a asigura comparații corecte. Totuși, ei observă că influența centrată pe dată ar putea fi mai adânc înrădăcinată:

‘Un posibil motiv pentru sensibilitatea la dată este că promptul de sistem ar putea fi fixat în timpul ajustării supravegheate (SFT) și al învățării prin consolidare din feedback uman (RLHF), făcând modelul fragil la orice modificare minoră.’

Pentru a investiga problema, cercetătorii au încercat șase formulări diferite pentru promptul de sistem și au constatat că aceste modificări au afectat acuratețea la fel de mult ca schimbarea datei (0,78%). Prin urmare, data pare să aibă la fel de multă influență ca ingineria deliberată inginerie a promptului – cu excepția faptului că se schimbă automat, fără ca utilizatorul să știe.

Au fost încercate și alte abordări pentru a atenua problema „datei curente”, inclusiv învățare cu puține exemple (în care modelul a primit cinci răspunsuri exemplu înainte de a răspunde). Acest lucru a ajutat puțin, reducând variația medie de la 2,52% la 2,27%, dar nu a rezolvat problema.

Au fost testate și modificări ale hardware-ului GPU, dimensiunea batch-ului, precizia numerică, ordinea răspunsurilor și formularea promptului de sistem. Cele mai mari efecte s-au observat la ordinea răspunsurilor și la formularea promptului, care s-au apropiat cel mai mult de impactul schimbării datei.

Ultimele zile

Este rezonabil să ne așteptăm ca un LLM/VLM să înțeleagă data încă de la începutul unei conversații; totuși, nu există un motiv explicit pentru a o încorpora în promptul de sistem (rubrica nevăzută care impune garduri de siguranță și condiționează comportamentele LLM‑ului în moduri inaccesibile utilizatorului) când modelul ar putea, în mod obișnuit, să facă un apel RAG sub‑Kb pentru a prelua data cea mai recentă, ca o rutină minoră de întreținere înainte de interacțiunea cu utilizatorul.

Fără îndoială există și alte posibilități de rezolvare a problemei; totuși, deoarece includerea datei curente în promptul de sistem nu a fost până acum percepută ca o problemă, se pare că s‑a investigat puțin sau deloc în acest sens.

Întâlniri online

Pentru teste, s‑au folosit prompturi identice pentru fiecare model, modificându‑se doar data din promptul de sistem. Au fost testate toate zilele din 2024, de la 1 ianuarie până la 31 decembrie, menținând toate celelalte setări neschimbate.

Au fost folosite șase seturi de referință: MMLU; GPQA; și ARC‑Challenge, pentru întrebări cu alegere multiplă (evaluat prin probabilitatea token‑ului de răspuns). GSM8K pentru matematică pas cu pas (răspunsul final verificat); HumanEval pentru generarea de cod Python (testat unit); și WMT pentru traducere engleză‑germană; engleză‑finlandeză; și engleză‑cehă (evaluare completă a ieșirii). Întrebările dependente de timp au fost excluse.

Au fost testați nouă modele: Llama 3.1 Instruct (8B și 70B); Gemma 3 Instruct (4B și 27B); Qwen3 (4B); Qwen3‑Next (80B); Phi‑4 (14B); și GPT‑OSS (20B și 120B).

Acuratețea (procentul de întrebări răspunse corect) a fost utilizată pentru a evalua testele de alegere multiplă și matematică, în timp ce Eroare de calibrare așteptată (ECE) a măsurat cât de bine încrederea modelelor se potrivește cu performanța lor reală.

Codul a fost verificat folosind pass@1 (procentul de soluții de cod generate care trec toate testele la prima încercare); traducerile au fost evaluate cu BLEU și chrF.

Rezultatele au confirmat ipoteza cercetătorilor: simpla schimbare a datei în promptul de sistem a modificat modul în care modelele răspundeau corect la aceleași întrebări.

Rezultatele testelor care arată cum cinci modele de top au performat pe MMLU pe măsură ce data promptului de sistem a fost modificată de-a lungul anului 2024. Acuratețea este afișată în partea de sus, iar eroarea de calibrare așteptată (ECE) sub ea. Toate cele cinci modele au prezentat fluctuații în ambele măsuri, în ciuda lipsei altor modificări ale condițiilor de testare. Scoruri ECE mai mici indică o aliniere mai bună între încredere și acuratețe.

Rezultatele testelor care arată cum cinci modele de top au performat pe MMLU pe măsură ce data promptului de sistem a fost modificată de-a lungul anului 2024. Acuratețea este afișată în partea de sus, iar eroarea de calibrare așteptată (ECE) sub ea. Toate cele cinci modele au prezentat fluctuații în ambele măsuri, în ciuda lipsei altor modificări ale condițiilor de testare. Scoruri ECE mai mici indică o aliniere mai bună între încredere și acuratețe.

Împreună cu alte rezultate prezentate anterior în articol, aceasta reprezintă potențial o veste proastă pentru benchmarking‑ul LLM, deoarece un model ar putea obține un scor mai bun sau mai slab în funcție de ziua în care este testat, schimbându‑și poziția pe un clasament fără nicio îmbunătățire sau declin real al capacităților sale.

Concluzie

Această problemă evidențiază diviziunea dintre sistemele de calcul deterministe la care eram obișnuiți înainte de aproximativ 2023 și natura foarte diferită a sistemelor AI bazate pe difuzie și similare, care au evoluat și continuă să evolueze de atunci.

Rezoluția datei a fost practic rezolvată pe 1 ianuarie 1970, dar, aparent, a revenit să bântuie lumea calculului sub forma datelor limită, printre alte probleme temporale.

 

* Intitulat ‘Datarea modelului: date ascunse în prompturile de sistem afectează evaluarea LLM’

Publicat prima dată vineri, 9 octombrie 2026

Scriitor în învățare automată, specialist de domeniu în sinteza imaginilor umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai de la DNEG.
Site web: martinanderson.ai
Contact: martin@martinanderson.ai