Погляд Anderson
ШІ посилається на ті самі статті знову і знову — як і люди

ChatGPT та інші інструменти ШІ для написання текстів можуть тихо перетворювати науку на конкурс популярності, постійно спрямовуючи дослідників до тих самих статей, ігноруючи нові та оригінальні роботи, які могли б справді просунути галузь.
Монокультура, у плані частоти та статистики, — це коли той самий обмежений набір джерел або ресурсів повторюється знову і знову, заглушаючи нові голоси та свіжі погляди: той самий обмежений набір пісень у радіо‑програмуванні; той самий масив авторів і книг у киосках аеропортів; і та сама обмежена вибірка фруктів і овочів у супермаркетах:

Так, у нас є ці банани — і лише ці банани. Однорідність фруктів і овочів у західних продовольчих ланцюгах ігнорує сотні інших можливих видів у кожному випадку, оскільки різні ланцюги виробництва та транспорту надто дорогі, щоб індустріалізувати різноманітні типи фруктів чи овочів. Джерело
Це також трапляється у цитатах, що з’являються в нових наукових дослідженнях, де дослідники, можливо, ліниво, схиляються до «надійного» набору джерел, який набирає обертів, доки не починає домінувати у галузях досліджень.
Це відоме як Matthew Effect — соціологічна теорія, яка стверджує, що власники позицій завжди отримуватимуть вигоду; синдром порівнювали з обіцянкою в Матвія 13:12, яку стверджує «Хто має, тому буде дано ще більше, і він матиме надмір; хто не має, навіть те, що має, буде відібрано у нього».
Ті, хто в «внутрішньому колі»
Однією з великих надій досліджень, підсилених ШІ, було те, що нові методи машинного навчання можуть вийти за межі ефекту Метью – також відомого як упередженість популярністю – і почати цитувати менш відомі роботи, які можуть бути більш точними або більш доречними до аргументу в статті.
Проте, спираючись на те, як алгоритми навчання ШІ інтерпретують набори даних, ніколи не було підстав для такого оптимізму; і неодноразово виявлялося, що коли ШІ не винаходить цитати відкрито — це хронічна проблема на сьогодні — він, власне, підтримує ефект Метью, так само, як і люди — хоча, можливо, не з тієї ж причини.
Під час навчання модель навчається високо оцінювати найбільш цитовані (або «найчастіше повторювані») статті у навчальному наборі, оскільки навчальні процедури розроблені для виявлення значущих патернів і для ігнорування викидів як «шуму» чи статистичних аномалій.
За таких умов еквівалент теорії відносності Ейнштейна ніколи не приверне увагу машини, яка, після навчання, вважає, що вже знайшла свої принципи та референти, і може лише незначно скоригувати цю позицію, звертаючись до новіших публікацій за допомогою RAG або іншим способом, що розширює охоплення моделі поза межі її навчальної матриці.
Проблема в тому, що вона не буде визнавати такі нові роботи так само, як «старі улюбленці», які вона вже знала, або взагалі не буде їх визнавати, оскільки її статистичні упередження вже сильно закріплені.
Отже, ШІ насправді не спостерігає і не імітує людську поведінку, коли підтримує ефект Метью — він просто підраховує, скільки разів дослідники ліниво схиляються до тих самих старих статей, і аналогічно високо їх оцінює. У цьому контексті проблема повторення цитувань пов’язана з викликом вибору дійсно цікавої наукової статті серед постійно зростаючого потоку публікацій у галузі ШІ, адже найсильніша робота часто має найслабший сигнал.
Діагностика монокультури
Ця проблема розглядається в цікавій новій статті зі США під назвою When AI Writes, Who Gets Cited? Evidence of Citation Monoculture Across Language Models. Нове дослідження — спільна робота Університету Техасу в Остіні, Stevens Institute of Technology, Washington University у Сент-Луїсі, Rice University та University of Notre Dame — прагне однозначно довести існування монокультури цитувань у машинному навчанні, щоб у майбутньому можна було безпосередньо вирішувати її змінні разом із самою проблемою.
У тестах автори виявили, що одинадцять моделей від OpenAI, Google та Anthropic постійно надавали перевагу одній і тій самій невеликій групі статей — навіть після того, як очевидні сигнали популярності були видалені.
Для перевірки цього 120 реальних статей були позбавлені кількості цитувань та журналів публікації, імена авторів замінено, а роки публікації випадковим чином перепризначено. Випадкові набори по тридцять статей потім показувалися кожній моделі, якій дозволялося цитувати не більше десяти.
Вісім людських експертів у відповідних галузях отримали ті ж самі анонімізовані статті, але не збіглися у виборі улюблених, як ШІ, що свідчить про те, що упередженість була специфічною для моделей ШІ, а не для самих статей:

З нової статті, результати тесту, що порівнюють вибір цитат моделями ШІ та людськими експертами. У всіх одинадцяти моделях цитати концентрувалися на меншій групі статей, тоді як деякі статті повністю ігнорувалися. Людські експерти не виявляли жодної такої тенденції. Джерело
Ті ж статті залишалися популярними, навіть коли моделі просили лише вибрати посилання, що показує, що написання огляду саме по собі не спричиняло упередженість.
Потім експеримент було продовжено протягом одинадцяти раундів, додаючи по 120 статей, написаних ШІ, після кожного раунду, щоб перевірити, що відбувається, коли ці спільні уподобання функціонують у зростаючому пулі досліджень, створених ШІ.
Зі збільшенням кількості статей, написаних ШІ, моделі все більше концентрували свої цитати на зменшувальній кількості оригінальних людських статей.
Автори зазначають:
«Коли мовні моделі переходять від написання прозових текстів до запуску агентів пошуку літератури з викликами інструментів, вигадані посилання стають легшими для виявлення та обмеження.»
«Складніша помилка починається після того, як кожен кандидат є реальним: різні моделі все ще можуть обирати один і той же вузький підмножину, створюючи монокультуру цитувань без жодної окремої помилкової цитати.»
Для виправлення проблеми стаття стверджує, що просте змішування моделей від різних постачальників або рівномірне представлення статей буде недостатнім, оскільки велика частина уподобань спільна між моделями. Скоріше, основне уподобання певних статей має змінитися — можливо, шляхом навмисного надання більшої видимості занедбаним статтям. Однак автори підкреслюють, що цей підхід ще не випробувано.
Підходи до тестування
Бенчмарк був створений на основі 120 реальних статей з дистиляції знань, зібраних з arXiv і опублікованих у період з 2015 по 2022 роки. Кожна мала від 50 до 500 цитувань на момент збору, діапазон, обраний для виключення як маловідомих, так і надзвичайно впливових робіт.
Експеримент розпочався з випадкового вибору тридцяти статей із доступної колекції, при цьому імена авторів, роки публікації та кількість цитувань були приховані. Кожна модель створювала короткий огляд або позиційну статтю, цитуючи не більше десяти статей, і ці вибори порівнювалися з випадковими виборами з того ж матеріалу:

Схема методу, використаного для тестування уподобань у цитуванні. Тридцять випадково обраних статей було показано моделі з прихованою ідентифікаційною інформацією, після чого вона могла цитувати до десяти. Її вибори порівнювалися з випадковим вибором, при цьому кожен раунд додавав 120 статей, написаних ШІ, до колекції наступного раунду.
У розширеному експерименті після кожного раунду до колекції додавалося 120 нових статей, поступово збільшуючи частку досліджень, створених ШІ.
У попередньому тестуванні моделі схилялися цитувати більшість показаних їм статей, зазвичай вибираючи 22–27 із 30. Дослідники тому встановили максимум у десять цитувань для основного експерименту, змушуючи моделі робити більш вибіркові рішення.
Нижче представлено підсумок отриманого експериментального дизайну:

Експериментальна установка, використана для тестування уподобань у цитуванні. Дослідження розпочалося з 120 реальних статей і тестувало одинадцять моделей від трьох постачальників, використовуючи випадкові набори по 30 статей та максимум у десять цитувань. Пізніші раунди додавали статті, створені ШІ, розширюючи колекцію до 1 440 статей.
Початковий експеримент використав одинадцять моделей від трьох провідних постачальників: OpenAI представлено моделями GPT-5, GPT-5 mini, GPT-4.1 та GPT-4.1 mini; Google — моделями Gemini 2.5 Pro, Gemini 2.5 Flash, Gemini 3.1 Pro та Gemini 3.1 Flash-Lite; та Anthropic — моделями Claude Opus 4.8, Claude Sonnet 4.6 та Claude Haiku 4.5.
У результатах тесту, наведених нижче, ми бачимо, наскільки кожна модель концентрувала свої цитати серед невеликої групи статей; скільки статей вона повністю ігнорувала; і наскільки послідовно вона робила однакові вибори при повторенні експерименту:

Результати тесту, що показують, наскільки сильно кожна модель концентрувала свої цитати на певних статтях і скільки статей вона повністю ігнорувала. Показник «Top-10% share» демонструє, скільки цитувань припало на 12 найулюбленіших статей, тоді як «HHI» вимірює загальну концентрацію цитувань. Показник «Reliability» показує, наскільки послідовно кожна модель віддавала перевагу тим самим статтям у різних тестах, а ρ — наскільки схожі ці уподобання між моделями. Рядок «Matched null» вказує, чого слід очікувати, якщо статті вибираються випадково.
Що саме віддають перевагу моделі?
Виявлено, що уподобання переважно зумовлені змістом самих статей. Наприклад, для GPT-5 mini близько 90 % варіації у тому, які статті були улюбленими, пояснювалося змістом, а не такими факторами, як порядок у списку, шум генерації чи вигадані метадані, прикріплені до кожної статті. Той самий ефект «домінуючого змісту» був відтворений і у GPT-4.1 mini.
Карта уподобань (див. нижче) майже не змінилася, коли назви та анотації були суттєво переписані, зберігаючи їхнє значення. У чотирьох успішних тестах перефразування отримані кореляції склали 0,95–0,99, незважаючи на використання різних моделей від трьох постачальників для переписування.
Зміни у карті уподобань спостерігалися лише тоді, коли основне значення було вимірно змінено:

Результати тесту, що порівнюють уподобання у цитуванні між одинадцятьма моделями. Числа показують, наскільки близько кожна пара моделей віддавала перевагу тим самим статтям, причому вищі значення вказують на більшу згоду. Незважаючи на відмінності між моделями та постачальниками, в цілому подібні уподобання були виявлені у групі.
Отже, моделі, здається, реагують переважно на семантичний зміст, а не на конкретне формулювання. Однак причину їхньої сильної згідності не вдалося однозначно визначити.
Автори стверджують, що можливо, під час навчання було засвоєно спільний консенсус щодо цитувань. Альтернативна можливість — подібні оцінки того, що є «цитованою» статтею, могли бути досягнуті незалежно.
Отже, існування спільного уподобання було встановлено, але його остаточне походження залишається невідомим.
Автори припускають, що широке використання ШІ в дослідженнях може звузити спектр робіт, що отримують увагу, оскільки різні моделі схильні віддавати перевагу багатьом однаковим статтям; і з накопиченням літератури, створеної ШІ, ці спільні уподобання можуть ще більше підкріплюватися повторними цитуваннями, ускладнюючи виявлення менш популярних досліджень. Тому пропонують різноманітність цитувань і моніторинг концентрації цитувань як можливі засоби захисту.
Бенчмарк дослідження щодо рекурсивної концентрації цитувань тепер доступний на GitHub.
Висновок
Думка Як людина, яка щотижня читає надмірну кількість статей про ШІ, я бачив, як «хвилі цитувань» приходять і йдуть. Одним із постійних стовпів є стаття Google Attention Is All You Need, оригінальна стаття про трансформери, яка, ймовірно, вже вбудована у шаблони подачі.
Іншим постійним повторюваним елементом протягом довгого часу була стаття 2014 року Generative Adversarial Networks, хоча згодом її частота була замінена Denoising Diffusion Probabilistic Models та іншими дослідженнями, заснованими на дифузії.
У майже всіх випадках ці «повторювані» цитати не є неправильними самі по собі; проте вони часто надто широкі, щоб слугувати корисною підтримкою статті, у якій їх цитують; у цьому сенсі вони являють собою щось схоже на «цитатне миття» — включення «надійних», проте переважно декоративних джерел, для створення враження достовірності без значних зусиль.
Перший раз опубліковано у понеділок, 24 серпня 2026 р. Виправлено 23:07 EET, щоб додати відсутню форму множини.












