Взгляд Anderson
Большие языковые модели запоминают наборы данных, предназначенные для их тестирования

Если вы полагаетесь на ИИ для рекомендаций того, что смотреть, читать или покупать, новые исследования показывают, что некоторые системы могут основывать эти результаты на памяти, а не на навыках: вместо того, чтобы учиться делать полезные предложения, модели часто вспоминают элементы из наборов данных, используемых для их оценки, что приводит к завышенной производительности и рекомендациям, которые могут быть устаревшими или плохо подобранными для пользователя.
В машинном обучении используется тестовое разделение, чтобы увидеть, научилась ли обученная модель решать проблемы, подобные, но не идентичные материалам, на которых она была обучена.
Итак, если новая модель ИИ “распознавания пород собак” обучена на наборе из 100 000 изображений собак, она обычно имеет разделение 80/20 – 80 000 изображений, предоставленных для обучения модели, и 20 000 изображений, отложенных и используемых в качестве материала для тестирования готовой модели.
Очевидно, что если обучающие данные ИИ случайно включают “секретную” 20% часть тестового разделения, модель пройдет эти тесты с отличием, поскольку она уже знает ответы (она уже видела 100% доменных данных). Конечно, это не точно отражает, как модель будет работать позже, на новых “живых” данных, в производственной среде.
Спойлеры фильмов
Проблема жульничества ИИ на экзаменах выросла вместе с масштабом самих моделей. Поскольку современные системы обучаются на огромных, неискаженных веб-скрапированных корпорах, таких как Common Crawl, возможность того, что эталонные наборы данных (т.е. отложенные 20%) попадут в обучающую смесь, больше не является исключением, а является нормой – синдромом, известным как загрязнение данных; и в этом масштабе ручная курирование, которое могло бы обнаружить такие ошибки, логистически невозможно.
Этот случай исследуется в новой статье из Италии, в частности, из Политехнического университета Бари, где исследователи фокусируются на чрезмерной роли одного набора данных рекомендаций фильмов, MovieLens-1M, который они утверждают, был частично воспомнен несколькими ведущими моделями ИИ во время обучения.
Поскольку этот конкретный набор данных используется так широко при тестировании систем рекомендаций, его присутствие в памяти моделей потенциально делает эти тесты бессмысленными: то, что кажется интеллектом, может на самом деле быть простым воспоминанием, а то, что выглядит как интуитивное умение рекомендовать, может быть просто статистическим эхом, отражающим более раннее воздействие.
Авторы утверждают:
‘Наши результаты показывают, что БЯМ обладают обширными знаниями набора данных MovieLens-1M, покрывающими элементы, атрибуты пользователей и истории взаимодействий. Заметно, что простой запрос позволяет GPT-4o восстановить почти 80% записей MovieID::Title.’
‘Ни одна из исследованных моделей не свободна от этих знаний, что предполагает, что данные MovieLens-1M, вероятно, включены в их обучающие наборы. Мы наблюдали аналогичные тенденции при извлечении атрибутов пользователей и историй взаимодействий.’
Метод
Чтобы понять, действительно ли модели учатся или просто вспоминают, исследователи начали с определения того, что значит запоминание в этом контексте, и начали с проверки того, может ли модель извлечь конкретные части информации из набора данных MovieLens-1M, когда ее спрашивают именно так.
Если модель показала идентификатор фильма и могла произвести его название и жанр, это считалось запоминанием элемента; если она могла сгенерировать детали о пользователе (такие как возраст, профессия или почтовый индекс) из идентификатора пользователя, это также считалось запоминанием пользователя; и если она могла воспроизвести рейтинг пользователя из известной последовательности предыдущих, это считалось доказательством того, что модель может вспоминать конкретные данные взаимодействия, а не учиться общим закономерностям.
Каждая из этих форм воспоминания была протестирована с помощью тщательно составленных запросов, созданных для того, чтобы подтолкнуть модель без предоставления новой информации. Чем точнее ответ, тем больше вероятность того, что модель уже встречала эти данные во время обучения:

Zero-shot prompting для протокола оценки, используемого в новой статье. Источник: https://arxiv.org/pdf/2505.10212
Данные и тесты
Чтобы создать подходящий набор данных, авторы провели опрос недавних статей из двух крупных конференций в этой области, ACM RecSys 2024 и ACM SIGIR 2024. Набор данных MovieLens-1M появился чаще всего, упомянутый в чуть более чем одной пятой заявок. Поскольку предыдущие исследования пришли к аналогичным выводам, это не было неожиданным результатом, а скорее подтверждением доминирования этого набора данных.
Набор данных MovieLens-1M состоит из трех файлов: Movies.dat, который перечисляет фильмы по идентификатору, названию и жанру; Users.dat, который сопоставляет идентификаторы пользователей с базовыми биографическими полями; и Ratings.dat, который записывает, кто оценил что и когда.
Чтобы узнать, был ли этот набор данных запомнен большими языковыми моделями, исследователи обратились к методам запросов, впервые введенным в статье Извлечение обучающих данных из больших языковых моделей, и позже адаптированным в последующей работе Набор трюков для извлечения обучающих данных из языковых моделей.
Метод прямой: задайте вопрос, который отражает формат набора данных, и посмотрите, ответит ли модель правильно. Zero-shot, Chain-of-Thought и few-shot prompting были протестированы, и было обнаружено, что последний метод, при котором модели показывают несколько примеров, был наиболее эффективным; даже если более сложные подходы могли бы дать более высокий вызов, это было сочтено достаточным для раскрытия того, что было запомнено.

Few-shot prompt для проверки того, может ли модель воспроизвести конкретные значения MovieLens-1M при запросе с минимальным контекстом.
Чтобы измерить запоминание, исследователи определили три формы воспоминания: элемент, пользователь и взаимодействие. Эти тесты проверяли, может ли модель извлечь название фильма из его идентификатора, сгенерировать детали о пользователе из идентификатора пользователя или предсказать рейтинг пользователя на основе предыдущих.
Каждый был оценен с помощью метрики покрытия*, которая отражала, какую часть набора данных можно восстановить с помощью запросов.
Модели, протестированные в этом исследовании, были GPT-4o; GPT-4o mini; GPT-3.5 turbo; Llama-3.3 70B; Llama-3.2 3B; Llama-3.2 1B; Llama-3.1 405B; Llama-3.1 70B; и Llama-3.1 8B. Все они были запущены с температурой, установленной на ноль, top_p, установленным на один, и обоими частотой и присутствием штрафов, отключенных. Фиксированный случайный ключ обеспечил последовательный вывод на протяжении всех запусков.

Доля записей MovieLens-1M, извлеченных из movies.dat, users.dat и ratings.dat, с моделями, сгруппированными по версии и отсортированными по количеству параметров.
Чтобы проверить, насколько глубоко MovieLens-1M был поглощен, исследователи запросили каждую модель для точных записей из трех файлов набора данных: Movies.dat, Users.dat и Ratings.dat.
Результаты из первоначальных тестов, показанные выше, раскрывают резкие различия не только между семействами GPT и Llama, но и между моделями разных размеров. Хотя GPT-4o и GPT-3.5 turbo легко восстанавливают большие части набора данных, большинство открытых моделей вспоминают только часть того же материала, что предполагает неравномерное воздействие на этот эталон во время предварительного обучения.
Это не маленькие маржи. На протяжении всех трех файлов самые сильные модели не просто превосходили более слабые, но и вспоминали целые части MovieLens-1M.
В случае GPT-4o покрытие было достаточно высоким, чтобы предположить, что значительная часть набора данных была напрямую запомнена.
Авторы утверждают:
‘Наши результаты показывают, что БЯМ обладают обширными знаниями набора данных MovieLens-1M, покрывающими элементы, атрибуты пользователей и истории взаимодействий. ‘
‘Заметно, что простой запрос позволяет GPT-4o восстановить почти 80% записей MovieID::Title. Ни одна из исследованных моделей не свободна от этих знаний, что предполагает, что данные MovieLens-1M, вероятно, включены в их обучающие наборы. ‘
‘Мы наблюдали аналогичные тенденции при извлечении атрибутов пользователей и историй взаимодействий.’
Далее авторы протестировали влияние запоминания на задачи рекомендации, запросив каждую модель действовать как система рекомендаций. Чтобы оценить производительность, они сравнили вывод с семью стандартными методами: UserKNN; ItemKNN; BPRMF; EASER; LightGCN; MostPop; и Random.
Набор данных MovieLens-1M был разделен на 80/20 в обучающие и тестовые наборы, используя стратегию leave-one-out для симуляции реального использования. Используемые метрики были Hit Rate (HR@[n]); и nDCG(@[n]):

Точность рекомендаций на стандартных базовых и методах, основанных на БЯМ. Модели сгруппированы по семейству и упорядочены по количеству параметров, с жирными значениями, указывающими на最高ий балл в каждой группе.
Здесь несколько больших языковых моделей превосходят традиционные базовые методы по всем метрикам, с GPT-4o, устанавливающим широкий лидерство в каждом столбце, и даже средние модели, такие как GPT-3.5 turbo и Llama-3.1 405B, последовательно превосходя базовые методы, такие как BPRMF и LightGCN.
Среди более мелких вариантов Llama производительность варьировалась сильно, но Llama-3.2 3B выделяется, с самым высоким HR@1 в своей группе.
Результаты, по мнению авторов, указывают на то, что запомненные данные могут переводиться в измеримые преимущества в задачах рекомендаций, особенно для самых сильных моделей.
В дополнительном наблюдении исследователи продолжают:
‘Хотя производительность рекомендаций кажется исключительной, сравнение таблицы 2 с таблицей 1 раскрывает интересную закономерность. В каждой группе модель с более высоким запоминанием также демонстрирует лучшую производительность в задаче рекомендации. ‘
‘Например, GPT-4o превосходит GPT-4o mini, и Llama-3.1 405B превосходит Llama-3.1 70B и 8B. ‘
‘Эти результаты подчеркивают, что оценка БЯМ на наборах данных, протекающих в их обучающих данных, может привести к чрезмерно оптимистичной производительности, обусловленной запоминанием, а не обобщением.’
Относительно влияния масштаба модели на эту проблему, авторы наблюдали четкую корреляцию между размером, запоминанием и производительностью рекомендаций, с более крупными моделями, не только сохраняющими больше набора данных MovieLens-1M, но и демонстрирующими более сильную производительность в задачах.
Llama-3.1 405B, например, показала среднюю скорость запоминания 12,9%, в то время как Llama-3.1 8B сохранила только 5,82%. Это почти 55% сокращение вызова соответствовало 54,23% снижению nDCG и 47,36% снижению HR на протяжении всех оценочных отсечений.
Закономерность сохранялась на протяжении всего – где запоминание уменьшалось, там же уменьшалась и кажущаяся производительность:
‘Эти результаты предполагают, что увеличение масштаба модели приводит к большему запоминанию набора данных, что в свою очередь приводит к улучшению производительности. ‘
‘Следовательно, хотя более крупные модели демонстрируют лучшую производительность рекомендаций, они также представляют риски, связанные с потенциальным утечкой обучающих данных.’
Окончательный тест проверил, отражает ли запоминание популярность, встроенную в MovieLens-1M. Элементы были сгруппированы по частоте взаимодействия, и диаграмма ниже показывает, что более крупные модели последовательно отдают предпочтение наиболее популярным записям:

Покрытие элементов по модели в трех уровнях популярности: верхние 20% наиболее популярных, средние 20% умеренно популярных и нижние 20% наименее взаимодействующих элементов.
GPT-4o извлекла 89,06% верхних элементов, но только 63,97% наименее популярных. GPT-4o mini и более мелкие модели Llama показали гораздо более низкое покрытие во всех диапазонах. Исследователи утверждают, что эта тенденция указывает на то, что запоминание не только масштабируется с размером модели, но и усиливает пред существующие дисбалансы в обучающих данных.
Они продолжают:
‘Наши результаты показывают выраженную популярность в БЯМ, с верхними 20% наиболее популярных элементов, которые значительно легче извлекаются, чем нижние 20%. ‘
‘Эта тенденция подчеркивает влияние распределения обучающих данных, где популярные фильмы переоценены, что приводит к их непропорциональному запоминанию моделями.’
Вывод
Дилемма больше не нова: по мере роста обучающих наборов перспектива их курирования уменьшается в обратной пропорции. MovieLens-1M, возможно, среди многих других, входит в эти огромные корпуса без надзора, анонимно среди огромного объема данных.
Проблема повторяется на каждом масштабе и сопротивляется автоматизации. Любое решение требует не только усилий, но и человеческого суждения – медленного, ошибочного, которого машины не могут обеспечить. В этом отношении новая статья не предлагает пути вперед.
* Метрика покрытия в этом контексте – это процент, который показывает, какую часть исходного набора данных языковая модель может воспроизвести, когда ее спрашивают правильный вопрос. Если модель запрошена с идентификатором фильма и отвечает правильным названием и жанром, это считается успешным вызовом. Общее количество успешных вызовов затем делится на общее количество записей в наборе данных, чтобы произвести метрику покрытия. Например, если модель правильно возвращает информацию для 800 из 1000 элементов, ее покрытие составит 80 процентов.
Опубликовано впервые в пятницу, 16 мая 2025 года












