Погляд Anderson
Секретні дати у системних підказках підривають оцінювання мовних моделей

Без можливості бенчмарку великих мовних моделей (LLM) споживачам і компаніям важко зрозуміти, який прогрес модель зробила у порівнянні з останніми версіями та як вона протистоїть конкурентам:

Впливовий рейтинг LLM на arena.ai. Джерело
Оскільки LLM є недетермінованими (тобто вони не завжди генерують послідовні результати за однакових вхідних даних), їх оцінювання є складним. Навіть коли дослідники використовують ідентичні підказки, налаштування моделей і набори даних для бенчмарку, здавалося б незначні відмінності у середовищі виконання можуть давати різні відповіді та суттєво змінювати оцінки продуктивності.
Такі фактори, як конфігурація апаратного забезпечення, числова точність, розмір пакету інференції, і навіть порядок відповідей у тестах з множинним вибором можуть впливати на результати. Це може ускладнити визначення, чи відображає повідомлене покращення реальний прогрес, чи лише випадкову варіацію умов, у яких модель тестувалася.
У певній мірі можна враховувати деякі з цих змінних або принаймні визначити, яку похибку вони створюють, щоб порівняльна оцінка була значущою. Варто спробувати, оскільки великі фінансові витрати та репутація залежать від можливості проводити бенчмарк AI‑систем такого типу з певним рівнем точності.
Проте, згідно з новими дослідженнями, одна конкретна змінна може не лише руйнувати бенчмарки, а й дуже важко підлягає усуненню з підказок, що їх визначають – поточна дата.
Час змінюється
Нова стаття*, академічна співпраця між Німеччиною, Мексикою та США, стверджує, що автоматичне та таємне включення поточної дати у системну підказку всіх передових та багатьох розгортань моделей з відкритою вагою означає, що відтворюваність може бути майже неможливою:
‘Ми виявляємо критичне, часто ігнороване джерело недетермінізму в оцінюванні LLM: приховане впровадження поточної дати у системні підказки.
‘У межах 9 моделей, 6 наборів даних та чотирьох завдань, ці динамічні метадані змінюють продуктивність моделей і переставляють рейтинги, перевищуючи варіації, спричинені іншими системними факторами, такими як розмір батчу або числова точність.’
Дослідники також зазначають, що виявлений ефект сильніше проявляється у завданнях, що потребують генерованих відповідей, причому продуктивність варіюється до 6 % у тестах з множинним вибором, 14 % у математичному мисленні та 7 % у генерації коду – а оцінки машинного перекладу також суттєво коливаються.
Надання прикладів відповідей і заохочення покрокового міркування не вирішило проблему – навпаки, останнє зробило її гірше:

Коливання точності у різні дати у 2024 році для Llama 3.1 (8B) на бенчмарку MMLU. Покрокове міркування (червоним) створює значно більшу варіативність, ніж прямі відповіді (синім), демонструючи, як підказка «ланцюжок міркувань» підсилює чутливість до дати. Джерело
Ефект також був виявлений у пропрієтарних моделях, де GPT-5.1 демонстрував коливання точності до 4 % у трьох тестах з множинним вибором протягом тижня тестування у грудні 2025 року. Дослідники використали порожню системну підказку, вимкнули міркування та встановили випадковість на нуль – проте дата все одно автоматично вставлялася провайдером:

Точність GPT-5.1 коливалася протягом семи послідовних днів у грудні 2025 року, незважаючи на ідентичні підказки користувачів та налаштування моделі. Найбільша варіація спостерігалася на GPQA (оранжевий), досягнувши чотирьох процентних пунктів між найкращим і найгіршим днями. Пунктирна лінія представляє середню точність кожного бенчмарку за тиждень.
Дослідники рекомендують, де це можливо, видаляти дату з системних підказок або фіксувати та документувати її, щоб забезпечити справедливі порівняння. Проте вони зазначають, що вплив, пов’язаний з датою, може бути глибше вкоріненим:
‘Однією з можливих причин чутливості до дати є те, що системна підказка може бути зафіксована під час контрольованого тонкого налаштування (SFT) та підкріплювального навчання з людським зворотним зв’язком (RLHF), що робить модель крихкою до будь‑якої незначної модифікації.’
Щоб дослідити проблему, дослідники випробували шість різних формулювань системного підказки і виявили, що ці зміни впливають на точність так само, як зміна дати (0,78 %). Тому дата, здається, має такий самий вплив, як навмисна інженерія підказок – лише вона змінюється автоматично, без відома користувача.
Інші підходи були випробувані для пом’якшення проблеми «поточна дата», включаючи навчання з кількома прикладами (коли модель отримувала п’ять прикладів відповідей перед відповіддю). Це трохи допомогло, знизивши середню варіацію з 2,52 % до 2,27 %, але проблему не вирішило.
Змінювалися апаратне забезпечення GPU, розмір пакету, числова точність, порядок відповідей та формулювання системної підказки. Найбільший ефект спостерігався при зміні порядку відповідей та формулювання підказки, які були найблизькими до впливу зміни дати.
Останні дні
Варто очікувати, що LLM/VLM розумітиме дату з самого початку чату; проте, немає явної причини включати її в системну підказку (невидимий критерій, що накладає обмеження і визначає поведінку LLM у спосіб, недоступний користувачеві), коли модель могла б регулярно робити підзапит RAG розміром менше кілобайту, щоб отримати останню дату як невелику рутинну операцію перед взаємодією з користувачем.
Без сумніву існують інші можливості вирішення питання; проте, оскільки включення поточної дати в системну підказку досі не вважалося проблемою, ймовірно, мало або зовсім не проводилося розслідувань щодо цього.
Онлайн-знайомства
Для тестів використовували однакові підказки для кожної моделі, змінюючи лише дату в системній підказці. Тестували кожен день 2024 року, з 1 січня по 31 грудня, при незмінних усіх інших налаштуваннях.
Для оцінки використано шість бенчмарків: MMLU; GPQA; та ARC-Challenge для питань з вибором відповіді (оцінюються за ймовірністю токену відповіді). GSM8K для покрокової математики (перевірка остаточної відповіді); HumanEval для генерації коду Python (модульне тестування); та WMT для перекладу англійська‑німецька; англійська‑фінська; і англійська‑чеська (оцінюється повний вивід). Питання, залежні від часу, були виключені.
Тестували дев’ять моделей: Llama 3.1 Instruct (8B і 70B); Gemma 3 Instruct (4B і 27B); Qwen3 (4B); Qwen3-Next (80B); Phi-4 (14B); та GPT-OSS (20B і 120B).
Точність (відсоток правильно відповіданих питань) використовувалась для оцінки тестів з вибором відповіді та математики, тоді як Очікувана помилка калібрування (ECE) вимірювала, наскільки добре впевненість моделей відповідає їх фактичній продуктивності.
Код перевіряли за допомогою pass@1 (відсоток згенерованих кодових рішень, які проходять усі тести з першої спроби); переклади оцінювали за допомогою BLEU та chrF.
Результати підтвердили гіпотезу дослідників: просте змінення дати в системній підказці змінило точність відповідей моделей на ті самі питання.

Результати тесту, що показують, як п’ять провідних моделей працювали на MMLU при зміні дати системної підказки протягом 2024 року. Точність показана вгорі, а очікувана помилка калібрування (ECE) — нижче. Усі п’ять моделей демонстрували коливання в обох показниках, незважаючи на відсутність інших змін умов тесту. Нижчі значення ECE вказують на кращу відповідність між впевненістю та точністю.
Разом з іншими результатами, наведеними раніше в статті, це потенційно погані новини для бенчмаркінгу LLM, оскільки модель може отримати кращий або гірший бал залежно від того, в який день її тестували, що може змінити її позицію в таблиці лідерів без реального покращення чи погіршення її можливостей.
Висновок
Ця проблема підкреслює розрив між детермінованими обчислювальними системами, до яких ми звикли до приблизно 2023 року, і зовсім іншим характером дифузійних та подібних AI‑систем, які розвивалися і продовжують розвиватися з того часу.
Розрізнення дати було фактично вирішено 1 січня 1970 року, але, очевидно, повернулося, щоб переслідувати світ обчислень у вигляді дат відсічі, серед інших темпоральних питань.
* Назва ‘Знайомство з моделлю: Приховані дати в системних підказках впливають на оцінювання LLM’
Вперше опубліковано у п’ятницю, 9 жовтня 2026 року

![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN-400x240.jpg)
![AI-generated image (GPT-2 + Photoshop [non-AI]) - a maintenance worker scrapes the word 'Relations' from the frosted glass door of an office labeled 'Human Relations', above newly painted 'Employee Relations', while an HR manager points toward a partially obscured seated industrial robot inside. A yellow-and-black border reads 'AI FANTASY INSIDE' and 'REALITY OUTSIDE'.](https://www.unite.ai/wp-content/uploads/2026/07/handbook-MAIN-80x80.jpg)









