Kąt Andersona

Tajne daty w systemowych podpowiedziach podważają ocenę modeli językowych

mm
Dodaj Unite.AI do preferowanych źródeł w Google
Harold Lloyd hangs from a clock face in Safety Last! (1923). The film is in the US public domain.. Source: https://www.youtube.com/watch?v=tzh4htLXp6Q

Bez możliwości benchmarkować dużych modeli językowych (LLM), konsumentom i firmom trudno zrozumieć, jaki postęp model poczynił w ostatnich wersjach i jak wypada w porównaniu z konkurencją:

Wpływowy ranking LLM na arena.ai. Źródło: https://arena.ai/leaderboard/chat/text

Wpływowy ranking LLM na arena.ai. Źródło

Ponieważ LLM są niedeterministyczne (tj. nie zawsze generują spójne wyniki przy tych samych danych wejściowych), ich ocena jest trudna. Nawet gdy badacze używają identycznych podpowiedzi, ustawień modelu i zestawów danych benchmarkowych, pozornie drobne różnice w środowisku wykonawczym mogą generować różne odpowiedzi i znacząco zmieniać wyniki wydajności.

Czynniki takie jak konfiguracja sprzętu, precyzja numeryczna, rozmiar partii inferencji, a nawet kolejność odpowiedzi wielokrotnego wyboru mogą wpływać na wyniki. To może utrudniać ocenę, czy zgłoszona poprawa odzwierciedla rzeczywisty postęp, czy jedynie pewną półlosową zmienność warunków, w których model był testowany.

W pewnym stopniu można uwzględnić niektóre z tych zmiennych, albo przynajmniej określić, jaki margines błędu generują, aby porównawcza ocena stała się znacząca. Warto to zrobić, ponieważ duże pieniądze i reputacja zależą od możliwości benchmarkowania systemów AI tego rodzaju z pewnym stopniem dokładności.

Jednak według nowych badań, jedna konkretna zmienna może nie tylko niszczyć benchmarki, ale jest również bardzo trudna do wyeliminowania z podpowiedzi, które je definiują – dzisiejsza data.

Czasy się zmieniają

nowy artykuł*, akademicka współpraca między Niemcami, Meksykiem i USA, twierdzi, że fakt automatycznego i ukrytego dołączania bieżącej daty do systemowej podpowiedzi we wszystkich najnowocześniejszych i wielu wdrożeniach modeli o otwartych wagach oznacza, że reprodukowalność może być praktycznie niemożliwa:

‘Identyfikujemy krytyczne, często pomijane źródło niedeterministyczności w ocenie LLM: ukryte wprowadzanie bieżącej daty do systemowych podpowiedzi.’

‘Wśród 9 modeli, 6 zestawów danych i czterech zadań, te dynamiczne metadane zmieniają wydajność modelu i przestawiają pozycje w rankingu, przewyższając zmienność wprowadzoną przez inne czynniki systemowe, takie jak rozmiar partii czy precyzja numeryczna.’

Badacze zauważają również, że zidentyfikowany efekt jest większy w zadaniach wymagających generowanych odpowiedzi, przy czym wydajność waha się aż o 6 % w pytaniach wielokrotnego wyboru, 14 % w rozumowaniu matematycznym i 7 % w generowaniu kodu – a wyniki tłumaczenia maszynowego również wykazują znaczące zmienności.

Podanie przykładowych odpowiedzi i zachęcanie do rozumowania krok po kroku nie rozwiązało problemu – w rzeczywistości to drugie uczyniło to gorsze:

Fluktuacje dokładności w różnych datach w 2024 roku dla Llama 3.1 (8B) w benchmarku MMLU. Rozumowanie krok po kroku (czerwony) powoduje znacznie większą zmienność niż bezpośrednie odpowiedzi (niebieski), demonstrując, jak podpowiedzi typu chain-of-thought zwiększają wrażliwość na datę. Źródło - https://arxiv.org/pdf/2609.36931

Fluktuacje dokładności w różnych datach w 2024 roku dla Llama 3.1 (8B) w benchmarku MMLU. Rozumowanie krok po kroku (czerwony) powoduje znacznie większą zmienność niż bezpośrednie odpowiedzi (niebieski), demonstrując, jak podpowiedzi typu chain-of-thought zwiększają wrażliwość na datę. Źródło

Efekt został również zidentyfikowany w modelach własnościowych, przy czym GPT-5.1 wykazał wahania dokładności do 4 % w trzech benchmarkach wielokrotnego wyboru podczas tygodnia testów w grudniu 2025 roku. Badacze użyli pustej podpowiedzi systemowej, wyłączyli rozumowanie i ustawili losowość na zero – jednak data była nadal automatycznie wstawiana przez dostawcę:

Dokładność GPT-5.1 wahała się przez siedem kolejnych dni w grudniu 2025 roku, pomimo identycznych podpowiedzi użytkownika i ustawień modelu. Największa zmienność wystąpiła w GPQA (pomarańczowy), osiągając cztery punkty procentowe między najlepszym a najgorszym dniem. Przerywana linia przedstawia średnią dokładność każdego benchmarku w ciągu tygodnia.

Dokładność GPT-5.1 wahała się przez siedem kolejnych dni w grudniu 2025 roku, pomimo identycznych podpowiedzi użytkownika i ustawień modelu. Największa zmienność wystąpiła w GPQA (pomarańczowy), osiągając cztery punkty procentowe między najlepszym a najgorszym dniem. Przerywana linia przedstawia średnią dokładność każdego benchmarku w ciągu tygodnia.

Badacze zalecają usunięcie daty z podpowiedzi systemowych, gdzie to możliwe, lub jej ustalenie i udokumentowanie, aby zapewnić uczciwe porównania. Jednak zauważają, że wpływ skoncentrowany na dacie może być głębiej zakorzeniony:

‘Jednym możliwym powodem wrażliwości na datę jest to, że podpowiedź systemowa może być ustalona podczas nadzorowanego dopasowywania (SFT) i uczenia ze wzmocnieniem na podstawie opinii ludzkich (RLHF), co czyni model kruchym na jakąkolwiek drobną modyfikację.’

Aby zbadać problem, badacze wypróbowali sześć różnych sformułowań systemowego promptu i stwierdzili, że te zmiany wpływały na dokładność tak samo jak zmiana daty (0,78 %). Dlatego data wydaje się mieć tak samo duży wpływ jak celowa inżynieria promptów – z tym że zmienia się automatycznie, bez wiedzy użytkownika.

Wypróbowano inne podejścia mające złagodzić problem „bieżącej daty”, w tym uczenie few-shot (gdzie model otrzymał pięć przykładowych odpowiedzi przed udzieleniem odpowiedzi). Pomogło to nieco, obniżając średnią zmienność z 2,52 % do 2,27 %, ale nie rozwiązało problemu.

Testowano także zmiany w sprzęcie GPU, rozmiarze batcha, precyzji numerycznej, kolejności odpowiedzi oraz sformułowaniu systemowego promptu. Największe efekty zaobserwowano przy zmianie kolejności odpowiedzi i sformułowania promptu, które były najbliższe wpływowi zmiany daty.

Ostatnie dni

Warto założyć, że LLM/VLM rozumie datę od samego początku rozmowy; jednak nie wydaje się istnieć wyraźny powód, aby wbudowywać ją w systemowy prompt (niewidzialny zestaw reguł narzucający ograniczenia i kształtujący zachowania LLM w sposób niedostępny dla użytkownika), gdy LLM może rutynowo wykonać zapytanie sub‑KB RAG, aby pobrać najnowszą datę jako drobną czynność konserwacyjną przed interakcją z użytkownikiem.

Nie ma wątpliwości, że istnieją inne możliwości rozwiązania tej kwestii; jednakże, ponieważ wprowadzenie bieżącej daty do systemowego promptu nie było dotąd postrzegane jako problem, prawdopodobnie podjęto niewiele lub wcale nie badano tego zagadnienia.

Randki online

W testach użyto identycznych promptów dla każdego modelu, zmieniając jedynie datę w systemowym promptcie. Testowano każdy dzień 2024 roku, od 1 stycznia do 31 grudnia, przy zachowaniu wszystkich pozostałych ustawień.

Użyto sześciu benchmarków: MMLU; GPQA; oraz ARC-Challenge do pytań wielokrotnego wyboru (ocenianych na podstawie prawdopodobieństwa tokenu odpowiedzi). GSM8K do krok po kroku matematyki (sprawdzano ostateczną odpowiedź); HumanEval do generowania kodu w Pythonie (testy jednostkowe); oraz WMT do tłumaczeń z angielskiego na niemiecki, angielski na fiński i angielski na czeski (oceniano pełny wynik). Pytania zależne od czasu zostały wykluczone.

Testowano dziewięć modeli: Llama 3.1 Instruct (8B i 70B); Gemma 3 Instruct (4B i 27B); Qwen3 (4B); Qwen3-Next (80B); Phi-4 (14B); oraz GPT-OSS (20B i 120B).

Dokładność (procent poprawnie odpowiedzianych pytań) była używana do oceny testów wielokrotnego wyboru i matematyki, podczas gdy Expected Calibration Error (ECE) mierzyła, jak dobrze pewność modeli odpowiada ich rzeczywistej wydajności.

Kod sprawdzano przy użyciu pass@1 (procent wygenerowanych rozwiązań kodowych, które przechodzą wszystkie testy za pierwszym razem); tłumaczenia oceniano przy użyciu BLEU i chrF.

Wyniki potwierdziły hipotezę badaczy: prosta zmiana daty w systemowym promptcie zmieniła dokładność, z jaką modele odpowiadały na te same pytania.

Wyniki testów pokazujące, jak pięć wiodących modeli radziło sobie w benchmarku MMLU, gdy data systemowego promptu była zmieniana w ciągu 2024 roku. Dokładność przedstawiono na górze, a poniżej błąd kalibracji (ECE). Wszystkie pięć modeli wykazało wahania w obu miarach, pomimo braku innych zmian w warunkach testu. Niższe wyniki ECE wskazują lepsze dopasowanie między pewnością a dokładnością.

Wyniki testów pokazujące, jak pięć wiodących modeli radziło sobie w benchmarku MMLU, gdy data systemowego promptu była zmieniana w ciągu 2024 roku. Dokładność przedstawiono na górze, a poniżej błąd kalibracji (ECE). Wszystkie pięć modeli wykazało wahania w obu miarach, pomimo braku innych zmian w warunkach testu. Niższe wyniki ECE wskazują lepsze dopasowanie między pewnością a dokładnością.

Wraz z innymi wynikami przedstawionymi wcześniej w artykule, jest to potencjalnie zła wiadomość dla benchmarkingu LLM, ponieważ model może uzyskać lepszy lub gorszy wynik w zależności od dnia testu, co może zmienić jego pozycję w rankingu, bez rzeczywistej poprawy lub spadku jego możliwości.

Wnioski

Problem ten uwypukla podział między deterministycznymi systemami komputerowymi, do których byliśmy przyzwyczajeni przed rokiem 2023, a zupełnie inną naturą systemów AI opartych na dyfuzji i podobnych, które ewoluowały i nadal ewoluują od tego czasu.

Rozwiązanie rozdzielczości dat zostało w zasadzie osiągnięte 1 stycznia 1970, ale, jak się wydaje, powróciło, by nękać świat informatyki w postaci dat granicznych, oraz innych kwestii czasowych.

 

* Tytuł ‘Datowanie modelu: Ukryte daty w systemowych podpowiedziach wpływają na ocenę LLM’

Opublikowano po raz pierwszy w piątek, 9 października 2026

Pisarz zajmujący się uczeniem maszynowym, specjalista w dziedzinie syntezy ludzkich obrazów. Były szef ds. treści badawczych w Metaphysic.ai, aż do jej rozwiązania w Brahma.ai firmy DNEG.
Strona internetowa: martinanderson.ai
Kontakt: martin@martinanderson.ai