Погляд Anderson
Великі мовні моделі запам’ятовують набори даних, призначені для їх тестування

Якщо ви покладаєтесь на штучний інтелект для рекомендацій того, що дивитися, читати чи купувати, нові дослідження свідчать про те, що деякі системи можуть базувати ці результати на пам’яті, а не на умі: замість того, щоб вивчати корисні поради, моделі часто згадують елементи з наборів даних, використаних для їх оцінки, що призводить до переоцінки результатів і рекомендацій, які можуть бути застарілими або погано підходити користувачеві.
У машинному навчанні використовується тестовий розріз, щоб побачити, чи навчена модель навчилася розв’язувати проблеми, подібні, але не ідентичні матеріалу, на якому вона була навчена.
Отже, якщо нова модель розпізнавання порід собак використовується для навчання на наборі з 100 000 зображень собак, вона зазвичай містить розріз 80/20 – 80 000 зображень для навчання моделі; і 20 000 зображень, які зберігаються та використовуються як матеріал для тестування закінченої моделі.
Очевидно, якщо навчальні дані моделі випадково містять “таємну” 20% частину тестового розрізу, модель буде проходити ці тести на відмінно, оскільки вона вже знає відповіді (вона вже бачила 100% даних домену). Очевидно, що це не точно відображає, як модель буде працювати пізніше, на нових “живих” даних, у виробничому контексті.
Спойлери фільмів
Проблема того, що штучний інтелект здурує на своїх іспитах, виросла разом з масштабом самих моделей. Через те, що сучасні системи навчаються на величезних, недискримінаційних веб-корпусах, таких як Common Crawl, можливість того, що набори даних для оцінки (тобто, збережена 20%) потраплять у навчальний набір, вже не є винятком, а нормою – синдромом, відомим як забруднення даних; і на цьому рівні ручна кураторія, яка могла б викрити такі помилки, логістично неможлива.
Цей випадок досліджується в новій роботі Італійського політехнічного університету в Барі, де дослідники фокусуються на надмірній ролі одного набору рекомендацій фільмів, MovieLens-1M, який вони стверджують, був частково запам’ятований кількома провідними моделями штучного інтелекту під час навчання.
Через те, що цей конкретний набір даних широко використовується при тестуванні систем рекомендацій, його присутність у пам’яті моделі потенційно робить ці тести безглуздими: те, що здається інтелектом, може насправді бути простим запам’ятовуванням, а те, що виглядає як інтуїтивна уміння рекомендацій, може бути просто статистичним ехом, що відображає попереднє знання.
Дослідники стверджують:
‘Наші результати демонструють, що великі мовні моделі володіють широкими знаннями набору даних MovieLens-1M, що охоплює елементи, атрибути користувачів та історії взаємодій. Значно, проста підказка дозволяє GPT-4o відновити майже 80% записів ідентифікаторів фільмів.
‘Жодна з досліджених моделей не вільна від цього знання, що свідчить про те, що дані MovieLens-1M, ймовірно, входять до їх навчальних наборів. Ми спостерігали подібні тенденції при відновленні атрибутів користувачів та історій взаємодій.’
Нова робота названа Чи запам’ятовують великі мовні моделі набори рекомендацій? Попереднє дослідження MovieLens-1M, і походить від шести дослідників Політехнічного університету. Потік для відтворення їхньої роботи доступний на GitHub.
Метод
Щоб зрозуміти, чи дійсно моделі навчаються або просто згадують, дослідники почали з визначення того, що означає запам’ятовування в цьому контексті, і почали з тестування того, чи може модель відновити конкретні частини інформації з набору даних MovieLens-1M, коли її підказують правильним чином.
Якщо модель була показана ідентифікатор фільму і могла виробити його назву та жанр, це вважалося запам’ятовуванням елемента; якщо вона могла генерувати дані про користувача (наприклад, вік, професію чи поштовий індекс) з ідентифікатора користувача, це також вважалося запам’ятовуванням користувача; і якщо вона могла відновити рейтинг фільму користувачем з відомої послідовності попередніх рейтингів, це вважалося доказом того, що модель може згадувати конкретні дані взаємодій, а не вивчає загальні закономірності.
Кожен з цих форм запам’ятовування був протестований за допомогою ретельно написаних підказок, створених для того, щоб підштовхнути модель без надання їй нової інформації. Чим точніша відповідь, тим більш ймовірно, що модель вже зустрічала ці дані під час навчання:

Zero-shot prompting for the evaluation protocol used in the new paper. Source: https://arxiv.org/pdf/2505.10212
Дані та тести
Щоб створити відповідний набір даних, автори провели опитування недавніх робіт з двох основних конференцій галузі, ACM RecSys 2024, і ACM SIGIR 2024. MovieLens-1M з’явився найчастіше, цитований у понад одному з п’яти подань. Оскільки ранішні дослідження прийшли до подібних висновків, це не був несподіваний результат, а радше підтвердження домінування цього набору даних.
MovieLens-1M складається з трьох файлів: Movies.dat, який перелічує фільми за ідентифікатором, назвою та жанром; Users.dat, який відображає ідентифікатори користувачів на базові біографічні поля; і Ratings.dat, який реєструє, хто оцінив що і коли.
Щоб дізнатися, чи було це дані запам’ятовані великими мовними моделями, дослідники звернулися до технік підказування, вперше введених у роботі Вилучення навчальних даних з великих мовних моделей, і пізніше адаптованих у пізнішій роботі Багаття трюків для витягування навчальних даних з мовних моделей.
Метод прямий: поставте питання, яке відображає формат набору даних, і побачите, чи модель відповідає правильно. Zero-shot, Chain-of-Thought, і few-shot prompting були протестовані, і було виявлено, що останній метод, у якому модель показується кілька прикладів, був найбільш ефективним; навіть якщо більш складні підходи можуть дати вищу пам’ять, це було достатньо, щоб показати, що було запам’ятовано.

Few-shot prompt used to test whether a model can reproduce specific MovieLens-1M values when queried with minimal context.
Щоб виміряти запам’ятовування, дослідники визначили три форми запам’ятовування: елемент, користувач, і взаємодія. Ці тести перевіряли, чи може модель відновити назву фільму з його ідентифікатора, згенерувати дані про користувача з ідентифікатора користувача, або передбачити рейтинг фільму користувачем на основі попередніх рейтингів. Кожен був оцінений за допомогою метрики покриття*, яка відображала, скільки набору даних можна відновити через підказування.
Моделі, які були протестовані, були GPT-4o; GPT-4o mini; GPT-3.5 turbo; Llama-3.3 70B; Llama-3.2 3B; Llama-3.2 1B; Llama-3.1 405B; Llama-3.1 70B; і Llama-3.1 8B. Всі вони були запущені з температурою, встановленою на нуль, top_p встановлено на один, і обидва частота і присутність штрафів були вимкнені. Фіксований послідовний номер забезпечував послідовний вивід під час запусків.

Proportion of MovieLens-1M entries retrieved from movies.dat, users.dat, and ratings.dat, with models grouped by version and sorted by parameter count.
Щоб з’ясувати, наскільки глибоко MovieLens-1M був поглинений, дослідники підказали кожній моделі точні записи з трьох файлів набору даних: Movies.dat, Users.dat, і Ratings.dat.
Результати початкових тестів, показані вище, розкривають різкі відмінності не тільки між сім’ями GPT і Llama, але також між моделями різних розмірів. Хоча GPT-4o і GPT-3.5 turbo відновлюють великі частини набору даних з легкістю, більшість відкритих моделей відновлюють тільки частину того ж матеріалу, що свідчить про нерівномірну експозицію цього бенчмарку під час попереднього навчання.
Ці не маленькі маржі. По всім трьом файлам найсильніші моделі не просто перевершували слабші моделі, а відновлювали цілі частини MovieLens-1M.
У випадку з GPT-4o покриття було достатньо високим, щоб припустити, що суттєва частина набору даних була безпосередньо запам’ятована.
Дослідники стверджують:
‘Наші результати демонструють, що великі мовні моделі володіють широкими знаннями набору даних MovieLens-1M, що охоплює елементи, атрибути користувачів та історії взаємодій.
‘Значно, проста підказка дозволяє GPT-4o відновити майже 80% записів ідентифікаторів фільмів. Жодна з досліджених моделей не вільна від цього знання, що свідчить про те, що дані MovieLens-1M, ймовірно, входять до їх навчальних наборів.
‘Ми спостерігали подібні тенденції при відновленні атрибутів користувачів та історій взаємодій.’
Далі дослідники протестували вплив запам’ятовування на завдання рекомендацій, підказуючи кожній моделі виступити як система рекомендацій. Щоб оцінити продуктивність, вони порівняли вивід проти семи стандартних методів: UserKNN; ItemKNN; BPRMF; EASER; LightGCN; MostPop; і Random.
Набір даних MovieLens-1M був розділений на 80/20 у навчальний і тестовий набори, використовуючи стратегію leave-one-out для симуляції реального використання. Метрики, які були використані, були Hit Rate (HR@[n]); і nDCG(@[n]):

Recommendation accuracy on standard baselines and LLM-based methods. Models are grouped by family and ordered by parameter count, with bold values indicating the highest score within each group.
Тут кілька великих мовних моделей перевершують традиційні бенчмарки по всіх метриках, з GPT-4o, який встановлює широкий лідерство у кожному стовпчику, і навіть середні моделі, такі як GPT-3.5 turbo і Llama-3.1 405B, які перевершують бенчмарки, такі як BPRMF і LightGCN.
У випадку з меншими варіантами Llama продуктивність різко варіюється, але Llama-3.2 3B виділяється, з найвищим HR@1 у своїй групі.
Результати, як стверджують дослідники, свідчать про те, що запам’ятовані дані можуть перетворитися на вимірювані переваги у завданнях рекомендацій, особливо для найсильніших моделей.
У додатковому спостереженні дослідники продовжують:
‘Хоча продуктивність рекомендацій здається видатною, порівняння таблиць 2 і 1 показує цікавий шаблон. У кожній групі модель з вищим запам’ятовуванням також демонструє вищу продуктивність у завданнях рекомендацій.
‘Наприклад, GPT-4o перевершує GPT-4o mini, і Llama-3.1 405B перевершує Llama-3.1 70B і 8B.
‘Ці результати підкреслюють той факт, що оцінка великих мовних моделей на наборах даних, які були виточені під час їх навчання, може привести до переоцінки продуктивності, яка спричинена запам’ятовуванням, а не узагальненням.’
Відносно впливу масштабу моделі на цю проблему, дослідники спостерігали чітку кореляцію між розміром, запам’ятовуванням і продуктивністю рекомендацій, з більшістю моделей, які не тільки зберігали більше даних MovieLens-1M, але також демонстрували вищу продуктивність у завданнях після навчання.
Llama-3.1 405B, наприклад, показала середній рівень запам’ятовування 12,9%, тоді як Llama-3.1 8B зберігала тільки 5,82%. Це майже 55% зниження запам’ятовування відповідало 54,23% зниженню nDCG і 47,36% зниженню HR по метрикам оцінки.
Шаблон зберігався протягом усього процесу – де запам’ятовування знижувалося, там також знижувалася видимість продуктивності:
‘Ці результати свідчать про те, що збільшення масштабу моделі призводить до більшого запам’ятовування набору даних, що призводить до покращення продуктивності.
‘Отже, хоча більші моделі демонструють вищу продуктивність рекомендацій, вони також несуть ризики, пов’язані з потенційною витоком навчальних даних.’
Останній тест перевіряв, чи відображає запам’ятовування популярність, закладену у MovieLens-1M. Елементи були згруповані за частотою взаємодій, і нижче показано, що більші моделі послідовно віддавали перевагу найбільш популярним елементам:

Item coverage by model across three popularity tiers: top 20% most popular; middle 20% moderately popular; and the bottom 20% least interacted items.
GPT-4o відновила 89,06% найпопулярніших елементів, але тільки 63,97% найменш популярних. GPT-4o mini і менші моделі Llama показали значно нижче покриття по всіх смугах.
Дослідники продовжують:
‘Наші результати показують виражену популярність у великих мовних моделях, з найпопулярнішими 20% елементів, які значно легше відновлюються, ніж нижні 20%.
‘Ця тенденція підкреслює вплив розподілу навчальних даних, де популярні фільми перебувають у надлишку, що призводить до їх надмірного запам’ятовування моделями.’
Висновок
Ділема вже не нова: коли навчальні набори зростають, перспектива їх кураторства зменшується у зворотному порядку. MovieLens-1M, можливо, серед багатьох інших, потрапляє у ці величезні корпуси без нагляду, анонімно серед величезної кількості даних.
Проблема повторюється у кожному масштабі і опирається автоматизації. Будь-яке рішення вимагає не тільки зусиль, а й людської уваги – повільної, ненадійної, яку машини не можуть забезпечити. У цьому відношенні нова робота не пропонує жодного шляху вперед.
* Метрика покриття в цьому контексті є відсотком, який показує, скільки оригінального набору даних велика мовна модель може відновити, коли їй задають правильне питання. Якщо модель підказується ідентифікатором фільму і відповідає правильною назвою та жанром, це вважається успішним запам’ятовуванням. Загальна кількість успішних запам’ятовувань потім ділиться на загальну кількість записів у наборі даних, щоб виробити метрику покриття. Наприклад, якщо модель правильно повертає інформацію для 800 з 1000 елементів, її покриття складає 80 відсотків.
Перше опублікування: п’ятниця, 16 травня 2025












