Взгляд Anderson
ИИ Цитирует Одни И Те же Статьи Снова и Снова – Точно Как Люди

ChatGPT и другие инструменты ИИ для написания могут тихо превращать науку в конкурс популярности, постоянно направляя исследователей к одним и тем же статьям, игнорируя новые и оригинальные работы, которые действительно могли бы продвинуть область.
Монокультура, в терминах частоты и статистики, представляет собой ситуацию, когда один и тот же ограниченный набор источников или ресурсов повторяется снова и снова, заглушая новые голоса и свежие взгляды: тот же ограниченный набор песен в радиоэфире; тот же один и тот же набор авторов и книг на полках в аэропортах; и тот же ограниченный ассортимент фруктов и овощей в супермаркетах:

Да, у нас есть эти бананы — и только эти бананы. Однородность фруктов и овощей в западных продовольственных цепочках игнорирует сотни других видов, потому что различные цепочки производства и транспортировки слишком дороги для индустриализации разнообразных фруктов и овощей. Источник
Это происходит и со ссылками в новых научных исследованиях: исследователи, возможно из лени, по умолчанию используют «надёжный» набор источников, который набирает влияние и постепенно начинает доминировать в направлениях исследований.
Это известно как эффект Матфея — социологическая теория, согласно которой обладающие преимуществом будут и дальше получать выгоду. Явление сравнивают с обещанием в Евангелии от Матфея 13:12, где говорится: «Кто имеет, тому будет дано ещё больше, и у него будет изобилие. Кто не имеет, у того отнимут даже то, что он имеет».
Внутри Круга
Одной из великих надежд исследований с поддержкой ИИ было то, что новые методы машинного обучения могут выйти за пределы эффекта Мэтью — также известного как смещение в пользу популярности – и начать цитировать менее известные работы, которые могут быть более точными или более уместными для аргумента в статье.
Однако, исходя из того, как процедуры обучения ИИ интерпретируют наборы данных, никогда не было достаточных оснований для такого оптимизма; и неоднократно обнаруживалось, что когда ИИ не выдумывает цитаты откровенно — текущая хроническая проблема — он действительно усиливает эффект Мэтью, как и люди — хотя, возможно, не по той же причине.
Во время обучения модель учится высоко ранжировать наиболее цитируемые (или «наиболее часто повторяемые») статьи в обучающем наборе, поскольку процедуры обучения предназначены для выявления значимых паттернов и игнорируют выбросы как «шум», или статистические аномалии.
При таком режиме эквивалент теории относительности Эйнштейна никогда не получит внимания от модели, которая, будучи обученной, считает, что уже нашла свои принципы и референты, и может лишь слегка скорректировать эту позицию, обратившись к более новым публикациям через RAG, или другими способами, расширяющими охват модели за пределы её обученной матрицы.
Проблема в том, что она не будет придавать таким новым работам тот же статус, что и «старым фаворитам», которые она уже знала, или вовсе не будет их учитывать, поскольку её статистические предубеждения уже глубоко укоренились.
Таким образом, ИИ не наблюдает и не имитирует человеческое поведение, когда он поддерживает эффект Мэтью — он просто подсчитывает количество случаев, когда исследователи лениво используют одни и те же старые статьи, и аналогично ранжируют их высоко. В этом отношении проблема повторяющихся цитат связана с задачей выбора действительно интересной научной статьи из непрерывно растущего потока публикаций по ИИ, поскольку самая сильная работа часто имеет самый слабый сигнал.
Диагностика Монокультуры
Эта проблема рассматривается в интересной новой статье из США под названием When AI Writes, Who Gets Cited? Evidence of Citation Monoculture Across Language Models. Новое исследование — совместный проект Университета Техаса в Остине, Института технологий Стивенса, Вашингтонского университета в Сент-Луисе, Университета Райса и Университета Нотр-Дам — стремится однозначно доказать существование цитатной монокультуры в машинном обучении, чтобы её переменные могли быть потенциально напрямую устранены в будущем, вместе с самой проблемой.
В тестах авторы обнаружили, что одиннадцать моделей от OpenAI, Google и Anthropic постоянно предпочитали одну и ту же небольшую группу статей — даже после того, как очевидные сигналы популярности были удалены.
Для проверки этого 120 реальных статей были лишены количества цитирований и информации о журналах, имена авторов заменены, а годы публикаций случайным образом переименованы. Затем каждому модели показывали случайные наборы из тридцати статей, при этом модель могла цитировать не более десяти.
Восемь экспертов‑человек в соответствующих областях получили те же слепые статьи, но не пришли к тем же фаворитам, что и ИИ, что свидетельствует о том, что предвзятость была специфична для моделей ИИ, а не для самих статей:

Из новой статьи, результаты тестов, сравнивающие выбор цитат моделями ИИ и человеческими экспертами. По всем одиннадцати моделям цитаты концентрировались на небольшой группе статей, в то время как некоторые статьи полностью игнорировались. Человеческие эксперты не проявляли ни одной из этих тенденций. Source – https://arxiv.org/pdf/2608.19230 Источник
Те же статьи оставались популярными даже когда модели просили лишь выбрать ссылки, показывая, что написание обзора само по себе не вызывало предвзятость.
Эксперимент затем был расширен до одиннадцати раундов, при каждом из которых после раунда добавлялось 120 статей, написанных ИИ, чтобы проверить, что происходит, когда эти общие предпочтения действуют в растущем пуле исследований, созданных ИИ.
По мере добавления всё большего количества статей, написанных ИИ, модели всё сильнее концентрировали свои цитаты на уменьшающемся числе оригинальных человеческих статей.
Авторы отмечают:
‘По мере того как языковые модели переходят от составления текста к запуску агентов поиска литературы с вызовами инструментов, поддельные ссылки становятся легче обнаруживаемыми и контролируемыми.’
‘Серьёзный сбой начинается после того, как каждый кандидат оказывается реальным: разные модели всё равно могут выбрать один и тот же узкий набор, создавая цитатную монокультуру без того, чтобы какая‑то отдельная цитата была неверной.’
В качестве меры по исправлению проблемы статья утверждает, что простое смешивание моделей от разных поставщиков или предоставление одинаковой экспозиции статьям будет недостаточным, поскольку большая часть предпочтения общая для моделей. Вместо этого внутреннее предпочтение конкретных статей должно измениться — возможно, посредством целенаправленного предоставления менее известным статьям большего внимания. Однако авторы подчёркивают, что такой подход пока не проверен.
Подходы к Тестированию
Эталон был построен на основе 120 реальных статей по дистилляции знаний, собранных с arXiv и опубликованных в период с 2015 по 2022 годы. Каждая из них имела от 50 до 500 цитирований на момент сбора, диапазон, выбранный для исключения как малоизвестных, так и исключительно влиятельных работ.
Эксперимент начался с случайного выбора тридцати статей из доступного набора, при этом имена авторов, годы публикаций и количество цитирований скрывались. Каждая модель создавала короткий обзор или позиционный текст, цитируя не более десяти статей, и эти выборы сравнивались со случайными отборками из того же материала:

Метод, использованный для тестирования предпочтений цитирования. Тридцать случайно выбранных статей были показаны модели с скрытой идентифицирующей информацией, после чего она могла цитировать до десяти. Ее выборы сравнивались со случайным отбором, при этом каждый раунд добавлял 120 статей, написанных ИИ, в набор следующего раунда.
В расширенном эксперименте после каждого раунда в набор добавлялось 120 новых статей, постепенно увеличивая долю исследований, написанных ИИ.
В предварительном тестировании модели, как правило, цитировали большинство представленных им статей, обычно выбирая от 22 до 27 из 30. Поэтому исследователи установили максимум в десять цитат для основного эксперимента, заставив модели делать более избирательный выбор.
Ниже представлено резюме полученного экспериментального дизайна:

Экспериментальная установка, использованная для тестирования предпочтений цитирования. Исследование началось с 120 реальных статей и протестировало одиннадцать моделей от трёх поставщиков, используя случайные наборы из 30 статей и максимум в десять цитат. Поздние раунды добавляли статьи, сгенерированные ИИ, расширяя набор до 1 440 статей.
Начальный эксперимент использовал одиннадцать моделей от трёх основных поставщиков: OpenAI представлена GPT-5, GPT-5 mini, GPT-4.1 и GPT-4.1 mini; Google — Gemini 2.5 Pro, Gemini 2.5 Flash, Gemini 3.1 Pro и Gemini 3.1 Flash-Lite; Anthropic — Claude Opus 4.8, Claude Sonnet 4.6 и Claude Haiku 4.5.
В результатах тестов, показанных ниже, мы видим, насколько каждая модель концентрировала свои цитаты в небольшой группе статей; сколько статей она полностью игнорировала; и насколько последовательно она делала одинаковый выбор при повторении эксперимента:

Результаты тестов, показывающие, насколько сильно каждая модель концентрировала свои цитаты на конкретных статьях и сколько статей полностью игнорировала. ‘Доля топ‑10 %’ показывает, сколько цитат пришлось на 12 наиболее предпочитаемых статей, в то время как ‘HHI’ измеряет степень концентрации цитирований в целом. ‘Надёжность’ показывает, насколько последовательно каждая модель предпочитала одни и те же статьи в разных тестах, а ρ показывает, насколько похожи эти предпочтения между моделями. Строка ‘Matched null’ указывает, чего ожидать, если статьи выбираются случайно.
Что На Самом Деле Предпочитают Модели?
Было обнаружено, что предпочтение в подавляющем большинстве определяется содержанием самих статей. Например, для GPT-5 mini около 90 % вариации в том, какие статьи предпочитались, объяснялось содержанием, а не такими факторами, как порядок в списке, шум генерации или поддельные метаданные, прикреплённые к каждой статье. Тот же эффект «доминирующего содержания» был воспроизведён с GPT-4.1 mini.
Карта предпочтений (см. ниже) также почти не изменилась, когда заголовки и аннотации были существенно переписаны при сохранении их смысла. В четырёх успешных тестах парафразирования получены корреляции от 0,95 до 0,99, несмотря на использование разных моделей от трёх поставщиков для переписывания.
Изменения в карте предпочтений наблюдались только тогда, когда основной смысл был заметно изменён:

Результаты тестов, сравнивающие предпочтения цитирования между одиннадцатью моделями. Числа показывают, насколько близко каждая пара моделей предпочитала одни и те же статьи, при этом более высокие значения указывают на большую согласованность. Несмотря на различия между моделями и поставщиками, в группе наблюдались в целом схожие предпочтения.
Таким образом, модели, по-видимому, реагируют в первую очередь на семантическое содержание, а не на конкретные формулировки. Однако причина их сильного согласия не могла быть однозначно определена.
Возможно, как утверждают авторы, общий консенсус по цитированию мог быть усвоен во время обучения. Альтернативной возможностью является то, что схожие суждения о том, что считается «цитируемой» статьёй, могут быть достигнуты независимо.
Таким образом, наличие общего предпочтения было установлено, но его окончательное происхождение остаётся неизвестным.
Авторы предполагают, что широкое использование ИИ в исследованиях может сузить диапазон работ, получающих внимание, поскольку разные модели склонны предпочитать многие из одних и тех же статей; и по мере накопления литературы, генерируемой ИИ, эти общие предпочтения могут ещё сильнее усиливаться через повторяющиеся цитаты, делая менее популярные исследования всё труднее обнаружить. Поэтому разнообразие цитат и мониторинг концентрации цитирований предлагаются в качестве возможных мер защиты.
Бенчмарк исследования для рекурсивной концентрации ссылок теперь доступен на GitHub.
Заключение
Мнение Как человек, который еженедельно читает огромное количество статей по ИИ, я наблюдал «волны цитирований», приходящие и уходящие. Одним из постоянных столпов является статья Google Attention Is All You Need, оригинальная статья о трансформерах, которая теперь, вероятно, жёстко встроена в шаблоны подачи.
Другим часто повторяющимся объектом, длительное время, была работа 2014 года Generative Adversarial Networks, хотя впоследствии её частота была превзойдена Denoising Diffusion Probabilistic Models и другими исследованиями на основе диффузионных моделей.
Во почти всех случаях эти «повторяющиеся» цитаты не являются неправильными per se; однако они часто слишком широки, чтобы быть полезной поддержкой для статьи, в которой они цитируются; и в этом смысле они представляют собой нечто похожее на «цитатную мойку» — включение «надёжных», но в основном декоративных ссылок, придающих работе видимость достоверности при минимальных усилиях.
Первоначально опубликовано в понедельник, 24 августа 2026 г. Исправлено 23:07 EET, чтобы добавить недостающее множественное число.












