Погляд Anderson

ШІ посилається на ті самі статті знову і знову — як і люди

mm
Додайте Unite.AI до бажаних джерел у Google
AI-generated article image (GPT Image 2): an industrial humanoid robot sits with its feet raised, reading Popular Mechanics beside a turntable playing a record and a partially filled metal record rack. A cat sleeps on otherwise empty shelving behind it. A yellow-and-black border reads ‘AI FANTASY INSIDE’ and ‘REALITY OUTSIDE’.

ChatGPT та інші інструменти ШІ для написання текстів можуть тихо перетворювати науку на конкурс популярності, постійно спрямовуючи дослідників до тих самих статей, ігноруючи нові та оригінальні роботи, які могли б справді просунути галузь.

 

Монокультура, у плані частоти та статистики, — це коли той самий обмежений набір джерел або ресурсів повторюється знову і знову, заглушаючи нові голоси та свіжі погляди: той самий обмежений набір пісень у радіо‑програмуванні; той самий масив авторів і книг у киосках аеропортів; і та сама обмежена вибірка фруктів і овочів у супермаркетах:

Yes, we have these bananas, and only these bananas. Source - https://www.thaitissues.com/en/post/a-deep-dive-into-the-grand-naine-banana-the-king-of-the-global-banana-market-and-its-crossroads-f

Так, у нас є ці банани — і лише ці банани. Однорідність фруктів і овочів у західних продовольчих ланцюгах ігнорує сотні інших можливих видів у кожному випадку, оскільки різні ланцюги виробництва та транспорту надто дорогі, щоб індустріалізувати різноманітні типи фруктів чи овочів. Джерело

Це також трапляється у цитатах, що з’являються в нових наукових дослідженнях, де дослідники, можливо, ліниво, схиляються до «надійного» набору джерел, який набирає обертів, доки не починає домінувати у галузях досліджень.

Це відоме як Matthew Effect — соціологічна теорія, яка стверджує, що власники позицій завжди отримуватимуть вигоду; синдром порівнювали з обіцянкою в Матвія 13:12, яку стверджує «Хто має, тому буде дано ще більше, і він матиме надмір; хто не має, навіть те, що має, буде відібрано у нього».

Ті, хто в «внутрішньому колі»

Однією з великих надій досліджень, підсилених ШІ, було те, що нові методи машинного навчання можуть вийти за межі ефекту Метью – також відомого як упередженість популярністю – і почати цитувати менш відомі роботи, які можуть бути більш точними або більш доречними до аргументу в статті.

Проте, спираючись на те, як алгоритми навчання ШІ інтерпретують набори даних, ніколи не було підстав для такого оптимізму; і неодноразово виявлялося, що коли ШІ не винаходить цитати відкрито — це хронічна проблема на сьогодні — він, власне, підтримує ефект Метью, так само, як і люди — хоча, можливо, не з тієї ж причини.

Під час навчання модель навчається високо оцінювати найбільш цитовані (або «найчастіше повторювані») статті у навчальному наборі, оскільки навчальні процедури розроблені для виявлення значущих патернів і для ігнорування викидів як «шуму» чи статистичних аномалій.

За таких умов еквівалент теорії відносності Ейнштейна ніколи не приверне увагу машини, яка, після навчання, вважає, що вже знайшла свої принципи та референти, і може лише незначно скоригувати цю позицію, звертаючись до новіших публікацій за допомогою RAG або іншим способом, що розширює охоплення моделі поза межі її навчальної матриці.

Проблема в тому, що вона не буде визнавати такі нові роботи так само, як «старі улюбленці», які вона вже знала, або взагалі не буде їх визнавати, оскільки її статистичні упередження вже сильно закріплені.

Отже, ШІ насправді не спостерігає і не імітує людську поведінку, коли підтримує ефект Метью — він просто підраховує, скільки разів дослідники ліниво схиляються до тих самих старих статей, і аналогічно високо їх оцінює. У цьому контексті проблема повторення цитувань пов’язана з викликом вибору дійсно цікавої наукової статті серед постійно зростаючого потоку публікацій у галузі ШІ, адже найсильніша робота часто має найслабший сигнал.

Діагностика монокультури

Ця проблема розглядається в цікавій новій статті зі США під назвою When AI Writes, Who Gets Cited? Evidence of Citation Monoculture Across Language Models. Нове дослідження — спільна робота Університету Техасу в Остіні, Stevens Institute of Technology, Washington University у Сент-Луїсі, Rice University та University of Notre Dame — прагне однозначно довести існування монокультури цитувань у машинному навчанні, щоб у майбутньому можна було безпосередньо вирішувати її змінні разом із самою проблемою.

У тестах автори виявили, що одинадцять моделей від OpenAI, Google та Anthropic постійно надавали перевагу одній і тій самій невеликій групі статей — навіть після того, як очевидні сигнали популярності були видалені.

Для перевірки цього 120 реальних статей були позбавлені кількості цитувань та журналів публікації, імена авторів замінено, а роки публікації випадковим чином перепризначено. Випадкові набори по тридцять статей потім показувалися кожній моделі, якій дозволялося цитувати не більше десяти.

Вісім людських експертів у відповідних галузях отримали ті ж самі анонімізовані статті, але не збіглися у виборі улюблених, як ШІ, що свідчить про те, що упередженість була специфічною для моделей ШІ, а не для самих статей:

From the new paper, test results comparing citation choices by AI models and human experts. Across all eleven models, citations were concentrated on a smaller group of papers, while some papers were repeatedly passed over entirely. Human experts showed neither tendency. Source - https://arxiv.org/pdf/2608.19230

З нової статті, результати тесту, що порівнюють вибір цитат моделями ШІ та людськими експертами. У всіх одинадцяти моделях цитати концентрувалися на меншій групі статей, тоді як деякі статті повністю ігнорувалися. Людські експерти не виявляли жодної такої тенденції. Джерело

Ті ж статті залишалися популярними, навіть коли моделі просили лише вибрати посилання, що показує, що написання огляду саме по собі не спричиняло упередженість.

Потім експеримент було продовжено протягом одинадцяти раундів, додаючи по 120 статей, написаних ШІ, після кожного раунду, щоб перевірити, що відбувається, коли ці спільні уподобання функціонують у зростаючому пулі досліджень, створених ШІ.

Зі збільшенням кількості статей, написаних ШІ, моделі все більше концентрували свої цитати на зменшувальній кількості оригінальних людських статей.

Автори зазначають:

«Коли мовні моделі переходять від написання прозових текстів до запуску агентів пошуку літератури з викликами інструментів, вигадані посилання стають легшими для виявлення та обмеження.»

«Складніша помилка починається після того, як кожен кандидат є реальним: різні моделі все ще можуть обирати один і той же вузький підмножину, створюючи монокультуру цитувань без жодної окремої помилкової цитати.»

Для виправлення проблеми стаття стверджує, що просте змішування моделей від різних постачальників або рівномірне представлення статей буде недостатнім, оскільки велика частина уподобань спільна між моделями. Скоріше, основне уподобання певних статей має змінитися — можливо, шляхом навмисного надання більшої видимості занедбаним статтям. Однак автори підкреслюють, що цей підхід ще не випробувано.

Підходи до тестування

Бенчмарк був створений на основі 120 реальних статей з дистиляції знань, зібраних з arXiv і опублікованих у період з 2015 по 2022 роки. Кожна мала від 50 до 500 цитувань на момент збору, діапазон, обраний для виключення як маловідомих, так і надзвичайно впливових робіт.

Експеримент розпочався з випадкового вибору тридцяти статей із доступної колекції, при цьому імена авторів, роки публікації та кількість цитувань були приховані. Кожна модель створювала короткий огляд або позиційну статтю, цитуючи не більше десяти статей, і ці вибори порівнювалися з випадковими виборами з того ж матеріалу:

Method used to test citation preferences. Thirty randomly selected papers were shown to a model with identifying information hidden, after which it could cite up to ten. Its choices were compared with random selection, while each round added 120 AI-written papers to the next round's collection.

Схема методу, використаного для тестування уподобань у цитуванні. Тридцять випадково обраних статей було показано моделі з прихованою ідентифікаційною інформацією, після чого вона могла цитувати до десяти. Її вибори порівнювалися з випадковим вибором, при цьому кожен раунд додавав 120 статей, написаних ШІ, до колекції наступного раунду.

У розширеному експерименті після кожного раунду до колекції додавалося 120 нових статей, поступово збільшуючи частку досліджень, створених ШІ.

У попередньому тестуванні моделі схилялися цитувати більшість показаних їм статей, зазвичай вибираючи 22–27 із 30. Дослідники тому встановили максимум у десять цитувань для основного експерименту, змушуючи моделі робити більш вибіркові рішення.

Нижче представлено підсумок отриманого експериментального дизайну:

Experimental setup used to test citation preferences. The study began with 120 real papers and tested eleven models from three vendors, using randomized sets of 30 papers and a maximum of ten citations. Later rounds added AI-generated papers, expanding the collection to 1,440 papers.

Експериментальна установка, використана для тестування уподобань у цитуванні. Дослідження розпочалося з 120 реальних статей і тестувало одинадцять моделей від трьох постачальників, використовуючи випадкові набори по 30 статей та максимум у десять цитувань. Пізніші раунди додавали статті, створені ШІ, розширюючи колекцію до 1 440 статей.

Початковий експеримент використав одинадцять моделей від трьох провідних постачальників: OpenAI представлено моделями GPT-5, GPT-5 mini, GPT-4.1 та GPT-4.1 mini; Google — моделями Gemini 2.5 Pro, Gemini 2.5 Flash, Gemini 3.1 Pro та Gemini 3.1 Flash-Lite; та Anthropic — моделями Claude Opus 4.8, Claude Sonnet 4.6 та Claude Haiku 4.5.

У результатах тесту, наведених нижче, ми бачимо, наскільки кожна модель концентрувала свої цитати серед невеликої групи статей; скільки статей вона повністю ігнорувала; і наскільки послідовно вона робила однакові вибори при повторенні експерименту:

Test results showing how strongly each model concentrated its citations on particular papers and how many papers it ignored entirely. 'Top-10% share' shows how many citations went to the 12 most-favored papers, while 'HHI' measures how concentrated citations were overall. 'Reliability' shows how consistently each model favored the same papers across tests, and ρ shows how similar those preferences were across models. The 'Matched null' row indicates what would be expected if papers were chosen at random.

Результати тесту, що показують, наскільки сильно кожна модель концентрувала свої цитати на певних статтях і скільки статей вона повністю ігнорувала. Показник «Top-10% share» демонструє, скільки цитувань припало на 12 найулюбленіших статей, тоді як «HHI» вимірює загальну концентрацію цитувань. Показник «Reliability» показує, наскільки послідовно кожна модель віддавала перевагу тим самим статтям у різних тестах, а ρ — наскільки схожі ці уподобання між моделями. Рядок «Matched null» вказує, чого слід очікувати, якщо статті вибираються випадково.

Що саме віддають перевагу моделі?

Виявлено, що уподобання переважно зумовлені змістом самих статей. Наприклад, для GPT-5 mini близько 90 % варіації у тому, які статті були улюбленими, пояснювалося змістом, а не такими факторами, як порядок у списку, шум генерації чи вигадані метадані, прикріплені до кожної статті. Той самий ефект «домінуючого змісту» був відтворений і у GPT-4.1 mini.

Карта уподобань (див. нижче) майже не змінилася, коли назви та анотації були суттєво переписані, зберігаючи їхнє значення. У чотирьох успішних тестах перефразування отримані кореляції склали 0,95–0,99, незважаючи на використання різних моделей від трьох постачальників для переписування.

Зміни у карті уподобань спостерігалися лише тоді, коли основне значення було вимірно змінено:

Test results comparing citation preferences across the eleven models. The numbers show how closely each pair of models favored the same papers, with higher values indicating greater agreement. Despite differences between models and vendors, broadly similar preferences were found across the group

Результати тесту, що порівнюють уподобання у цитуванні між одинадцятьма моделями. Числа показують, наскільки близько кожна пара моделей віддавала перевагу тим самим статтям, причому вищі значення вказують на більшу згоду. Незважаючи на відмінності між моделями та постачальниками, в цілому подібні уподобання були виявлені у групі.

Отже, моделі, здається, реагують переважно на семантичний зміст, а не на конкретне формулювання. Однак причину їхньої сильної згідності не вдалося однозначно визначити.

Автори стверджують, що можливо, під час навчання було засвоєно спільний консенсус щодо цитувань. Альтернативна можливість — подібні оцінки того, що є «цитованою» статтею, могли бути досягнуті незалежно.

Отже, існування спільного уподобання було встановлено, але його остаточне походження залишається невідомим.

Автори припускають, що широке використання ШІ в дослідженнях може звузити спектр робіт, що отримують увагу, оскільки різні моделі схильні віддавати перевагу багатьом однаковим статтям; і з накопиченням літератури, створеної ШІ, ці спільні уподобання можуть ще більше підкріплюватися повторними цитуваннями, ускладнюючи виявлення менш популярних досліджень. Тому пропонують різноманітність цитувань і моніторинг концентрації цитувань як можливі засоби захисту.

Бенчмарк дослідження щодо рекурсивної концентрації цитувань тепер доступний на GitHub.

Висновок

Думка Як людина, яка щотижня читає надмірну кількість статей про ШІ, я бачив, як «хвилі цитувань» приходять і йдуть. Одним із постійних стовпів є стаття Google Attention Is All You Need, оригінальна стаття про трансформери, яка, ймовірно, вже вбудована у шаблони подачі.

Іншим постійним повторюваним елементом протягом довгого часу була стаття 2014 року Generative Adversarial Networks, хоча згодом її частота була замінена Denoising Diffusion Probabilistic Models та іншими дослідженнями, заснованими на дифузії.

У майже всіх випадках ці «повторювані» цитати не є неправильними самі по собі; проте вони часто надто широкі, щоб слугувати корисною підтримкою статті, у якій їх цитують; у цьому сенсі вони являють собою щось схоже на «цитатне миття» — включення «надійних», проте переважно декоративних джерел, для створення враження достовірності без значних зусиль.

 

Перший раз опубліковано у понеділок, 24 серпня 2026 р. Виправлено 23:07 EET, щоб додати відсутню форму множини.

Автор у галузі машинного навчання, фахівець у сфері синтезу зображень людей. Колишній керівник дослідницького контенту в Metaphysic.ai, до його злиття з Brahma.ai, що належить DNEG.
Веб‑сайт: martinanderson.ai
Контакт: martin@martinanderson.ai