Взгляд Anderson

Секретные даты в системных подсказках подрывают оценку языковых моделей

mm
Добавьте Unite.AI в избранные источники в Google
Harold Lloyd hangs from a clock face in Safety Last! (1923). The film is in the US public domain.. Source: https://www.youtube.com/watch?v=tzh4htLXp6Q

Без возможности бенчмарка больших языковых моделей (LLM) потребителям и компаниям трудно понять, какого прогресса достигла модель в последних версиях и как она сравнивается с конкурентами:

Влиятельный рейтинг LLM на arena.ai. Источник: https://arena.ai/leaderboard/chat/text

Влиятельный рейтинг LLM на arena.ai. Источник

Поскольку LLM являются недетерминированными (т. е. они не всегда будут выдавать согласованные результаты при одинаковых входных данных), их оценка сложна. Даже когда исследователи используют одинаковые подсказки, настройки модели и наборы данных для бенчмарка, казалось бы незначительные различия в среде выполнения могут приводить к разным ответам и существенно менять показатели производительности.

Такие факторы, как конфигурация оборудования, численная точность, размер пакета вывода, а также порядок вариантов ответов, могут влиять на результаты. Это может затруднить определение, отражает ли заявленное улучшение реальный прогресс или лишь полупроизвольные колебания условий тестирования модели.

В определённой степени можно учесть часть этих переменных или, как минимум, определить их погрешность, чтобы сравнительная оценка имела смысл. Стоит попытаться, поскольку большие деньги и репутация зависят от возможности бенчмарка AI‑систем такого типа с определённой точностью.

Однако, согласно новым исследованиям, одна конкретная переменная может не только разрушать бенчмарки, но и её крайне трудно устранить из подсказок, их определяющих, — текущая дата.

Время меняется

В новой статье*, академическом сотрудничестве между Германией, Мексикой и США, утверждается, что автоматическое и скрытое включение текущей даты в системную подсказку всех передовых и многих развертываний моделей с открытым весом делает воспроизводимость практически невозможной:

‘Мы выявляем критический, часто упускаемый из виду источник недетерминированности в оценке LLM: скрытую инъекцию текущей даты в системные подсказки.

‘На 9 моделях, 6 наборах данных и четырёх задачах эта динамическая мета‑информация изменяет производительность модели и переставляет позиции в рейтинге, превосходя вариативность, вызванную другими системными факторами, такими как размер пакета или численная точность.’

Исследователи также отмечают, что выявленный эффект более выражен для задач, требующих генерируемых ответов: производительность варьируется до 6 % в тестах с выбором ответа, до 14 % в математическом рассуждении и до 7 % при генерации кода — при этом показатели машинного перевода также изменяются значительно.

Предоставление примеров ответов и поощрение поэтапного рассуждения не решило проблему — на самом деле, последнее сделало её хуже:

Колебания точности в разные даты в 2024 году для Llama 3.1 (8B) по бенчмарку MMLU. Поэтапное рассуждение (красный) вызывает существенно большую изменчивость, чем прямые ответы (синий), демонстрируя, как подсказки цепочки мыслей усиливают чувствительность к дате. Источник — https://arxiv.org/pdf/2609.36931

Колебания точности в разные даты в 2024 году для Llama 3.1 (8B) по бенчмарку MMLU. Поэтапное рассуждение (красный) вызывает существенно большую изменчивость, чем прямые ответы (синий), демонстрируя, как подсказки цепочки мыслей усиливают чувствительность к дате. Источник

Эффект также был обнаружен в проприетарных моделях: у GPT-5.1 наблюдались колебания точности до 4 % по трем бенчмаркам с выбором ответа в течение недели тестирования в декабре 2025 года. Исследователи использовали пустую системную подсказку, отключили рассуждения и установили случайность в ноль, но дата всё равно автоматически вставлялась поставщиком:

Точность GPT-5.1 колебалась в течение семи подряд дней в декабре 2025 года, несмотря на одинаковые пользовательские подсказки и настройки модели. Наибольшее отклонение наблюдалось в тесте GPQA (оранжевый), достигнув четырёх процентных пунктов между лучшим и худшим днями. Пунктирная линия представляет среднюю точность каждого бенчмарка за неделю.

Точность GPT-5.1 колебалась в течение семи подряд дней в декабре 2025 года, несмотря на одинаковые пользовательские подсказки и настройки модели. Наибольшее отклонение наблюдалось в тесте GPQA (оранжевый), достигнув четырёх процентных пунктов между лучшим и худшим днями. Пунктирная линия представляет среднюю точность каждого бенчмарка за неделю.

Исследователи рекомендуют по возможности удалять дату из системных подсказок или фиксировать и документировать её, чтобы обеспечить справедливое сравнение. Однако они отмечают, что влияние, связанное с датой, может быть более глубоко укоренившимся.

‘Одна из возможных причин чувствительности к дате заключается в том, что системная подсказка может быть зафиксирована во время контролируемой донастройки (SFT) и обучения с подкреплением от обратной связи человека (RLHF), делая модель хрупкой к любым небольшим изменениям.’

Чтобы исследовать проблему, исследователи попробовали шесть разных формулировок системного запроса и обнаружили, что эти изменения влияют на точность так же сильно, как изменение даты (0,78 %). Поэтому дата, по‑видимому, оказывает такое же влияние, как целенаправленный инжиниринг запросов — только она меняется автоматически, без ведома пользователя.

Были испробованы и другие подходы к смягчению проблемы «текущей даты», включая обучение с несколькими примерами (когда модель получала пять примерных ответов перед тем, как ответить). Это помогло немного, снизив среднее отклонение с 2,52 % до 2,27 %, но проблему не устранило.

Изменения аппаратного обеспечения GPU, размера пакета, числовой точности, порядка ответов и формулировки системного запроса также были протестированы. Наибольший эффект наблюдался при изменении порядка ответов и формулировки запроса, которые приблизились к влиянию изменения даты.

Последние дни

Разумно ожидать, что LLM/VLM будет понимать дату с самого начала чата; однако нет явной причины включать её в системный запрос (невидимую рубрику, накладывающую ограничительные рамки и определяющую поведение LLM способами, недоступными пользователю), когда модель могла бы регулярно выполнять суб‑килобайтный RAG‑запрос для получения актуальной даты как небольшую рутинную операцию перед взаимодействием с пользователем.

Несомненно, существуют и другие возможности решить вопрос; однако, поскольку включение текущей даты в системный запрос до сих пор не рассматривалось как проблема, вероятно, было проведено мало или вовсе не проводилось исследований в этом направлении.

Онлайн‑знакомства

Для тестов использовались одинаковые подсказки для каждой модели, менялась только дата в системном запросе. Тестировались все дни 2024 года, с 1 января по 31 декабря, при прочих одинаковых настройках.

Для оценки использовалось шесть наборов тестов: MMLU; GPQA; и ARC-Challenge для вопросов с выбором ответа (оценка по вероятности токена ответа). GSM8K — пошаговая математика (проверка окончательного ответа); HumanEval — генерация кода на Python (юнит‑тестирование); и WMT для переводов с английского на немецкий, с английского на финский и с английского на чешский (оценка полного вывода). Вопросы, зависящие от времени, были исключены.

Было протестировано девять моделей: Llama 3.1 Instruct (8B и 70B); Gemma 3 Instruct (4B и 27B); Qwen3 (4B); Qwen3-Next (80B); Phi-4 (14B); и GPT-OSS (20B и 120B).

Точность (процент правильно отвеченных вопросов) использовалась для оценки тестов с выбором ответа и математических задач, тогда как Ожидаемая ошибка калибровки (ECE) измеряла, насколько уверенность моделей соответствовала их реальной производительности.

Код проверялся с помощью метрики pass@1 (процент сгенерированных решений кода, прошедших все тесты с первой попытки); переводы оценивались с помощью BLEU и chrF.

Результаты подтвердили гипотезу исследователей: простое изменение даты в системном запросе изменило точность ответов моделей на одних и тех же вопросах.

Результаты тестов, показывающие, как пять ведущих моделей выступали в MMLU при изменении даты системного запроса в течение 2024 года. Точность указана вверху, ниже — ожидаемая ошибка калибровки (ECE). Все пять моделей демонстрировали колебания по обеим метрикам, несмотря на отсутствие других изменений условий тестирования. Более низкие значения ECE указывают на лучшую согласованность между уверенностью и точностью.

Результаты тестов, показывающие, как пять ведущих моделей выступали в MMLU при изменении даты системного запроса в течение 2024 года. Точность указана вверху, ниже — ожидаемая ошибка калибровки (ECE). Все пять моделей демонстрировали колебания по обеим метрикам, несмотря на отсутствие других изменений условий тестирования. Более низкие значения ECE указывают на лучшую согласованность между уверенностью и точностью.

В сочетании с другими результатами, приведёнными ранее в статье, это может стать плохой новостью для бенчмаркинга LLM, поскольку модель может получить более высокий или более низкий балл в зависимости от того, в какой день её тестируют, что может изменить её позицию в таблице лидеров без реального улучшения или ухудшения её возможностей.

Заключение

Эта проблема подчёркивает разрыв между детерминированными вычислительными системами, к которым мы привыкли до примерно 2023 года, и совершенно иной природой диффузионных и подобных ИИ‑систем, которые развивались и продолжают развиваться с тех пор.

Разрешение даты было по сути решено 1 января 1970 года, но, по‑видимому, вновь вернулось, чтобы преследовать мир вычислений в виде дат отсечения, среди прочих временных проблем.

 

*«Свидание с моделью: скрытые даты в системных запросах влияют на оценку LLM»

Первый раз опубликовано в пятницу, 9 октября 2026 года

Автор в области машинного обучения, специалист по синтезу человеческих изображений. Бывший руководитель отдела исследовательского контента в Metaphysic.ai, до его объединения с Brahma.ai от DNEG.
Веб‑сайт: martinanderson.ai
Контакт: martin@martinanderson.ai