Взгляд Anderson
ИИ Цитирует Одни И Те же Статьи Снова и Снова — Точно Как Люди

ChatGPT и другие инструменты ИИ для написания могут тихо превращать науку в конкурс популярности, постоянно направляя исследователей к одним и тем же статьям, игнорируя новые и оригинальные работы, которые действительно могли бы продвинуть область.
Монокультура, с точки зрения частоты и статистики, — это когда один и тот же ограниченный набор источников или ресурсов повторяется снова и снова, заглушая новые голоса и свежие взгляды: тот же ограниченный набор песен в радиопрограммировании; тот же один и тот же набор авторов и книг в киосках аэропортов; и тот же ограниченный ассортимент фруктов и овощей в супермаркетах:

Yes, we have these bananas – and only these bananas. Homogeneity of fruit and vegetables in western food chains disregards the hundreds of other species possibilities in each case, because the various generation and transport chains are too expensive to industrialize for diverse types of fruit or vegetables. Source
Это также происходит в цитатах, которые появляются в новых научных исследованиях, где исследователи, возможно лениво, по умолчанию используют «надёжный» набор источников, который набирает обороты, пока не начнёт доминировать в направлениях исследований.
Это известно как Эффект Мэттью — социологическая теория, предполагающая, что привилегированные всегда будут получать выгоду; синдром сравнивают с обещанием из Матфея 13:12, которое гласит «Кому есть, тому дано будет ещё больше, и у него будет изобилие. У кого нет, даже то, что у него есть, будет отнято».
Внутри группы
Одной из главных надежд исследований, усиленных ИИ, было то, что новые методы машинного обучения смогут выйти за пределы эффекта Мэттью — также известного как смещение в сторону популярности — и начать цитировать менее известные работы, которые могут быть более проницательными или более уместными к аргументу, изложенному в статье.
Однако, исходя из того, как процедуры обучения ИИ интерпретируют наборы данных, никогда не было реальных оснований для такого оптимизма; и неоднократно обнаруживалось, что когда ИИ не изобретает цитаты напрямую — текущая хроническая проблема — он действительно усиливает эффект Мэттью, как и люди — хотя, возможно, не по той же причине.
Во время обучения модель учится высоко ранжировать наиболее часто цитируемую (или «наиболее часто повторяемую») статью в наборе данных, поскольку процедуры обучения созданы для выявления значимых закономерностей и игнорируют выбросы как «шум» или статистические аномалии.
При таком подходе эквивалент теории относительности Эйнштейна никогда не получит внимания от машины, которая, будучи обученной, считает, что уже нашла свои принципы и референты, и может лишь слегка скорректировать эту позицию, обратившись к более новым публикациям через RAG или другими способами, расширяющими охват модели за пределы обучающей матрицы.
Проблема в том, что она не будет признавать такие новые работы так же, как «старые фавориты», которые уже известны, или вовсе не будет их учитывать, поскольку её статистические предубеждения уже глубоко укоренились.
Таким образом, ИИ на самом деле не наблюдает и не имитирует человеческое поведение, когда он поддерживает эффект Мэттью — он просто подсчитывает, сколько раз исследователи лениво используют одни и те же старые статьи, и соответственно ранжирует их высоко. В этом отношении проблема повторяющихся цитат связана с задачей выбора действительно интересной научной статьи из непрерывно растущего потока публикаций по ИИ, поскольку самая сильная работа часто имеет самый слабый сигнал.
Диагностика монокультуры
Эта проблема рассматривается в интересной новой статье из США под названием When AI Writes, Who Gets Cited? Evidence of Citation Monoculture Across Language Models. Новая работа — совместный проект Университета Техаса в Остине, Института технологий Стивенса, Вашингтонского университета в Сент-Луисе, Университета Райса и Университета Нотр-Дам — стремится однозначно доказать существование цитатной монокультуры в машинном обучении, чтобы её переменные могли быть непосредственно решены в будущем, вместе с самой проблемой.
В тестах авторы обнаружили, что одиннадцать моделей от OpenAI, Google и Anthropic постоянно отдают предпочтение одной и той же небольшой группе статей — даже после удаления очевидных сигналов популярности.
Для проверки этого 120 реальных статей были лишены количества цитирований и мест публикации, имена авторов заменены, а годы публикаций случайным образом переименованы. Затем каждой модели показывали случайные наборы из тридцати статей, и ей разрешалось цитировать не более десяти.
Восемь экспертов‑человек в соответствующих областях получили те же слепые статьи, но не пришли к тем же фаворитам, что и ИИ, что свидетельствует о том, что предвзятость была специфичной для моделей ИИ, а не для самих статей:

From the new paper, test results comparing citation choices by AI models and human experts. Across all eleven models, citations were concentrated on a smaller group of papers, while some papers were repeatedly passed over entirely. Human experts showed neither tendency. Source
Те же статьи оставались популярными даже когда модели просили лишь выбрать ссылки, показывая, что написание обзора само по себе не вызывало предвзятость.
Эксперимент затем был расширен до одиннадцати раундов, при этом после каждого раунда добавлялось 120 статей, написанных ИИ, чтобы проверить, что происходит, когда эти общие предпочтения действуют в растущем пуле исследований, созданных ИИ.
По мере добавления всё большего количества статей, написанных ИИ, модели всё сильнее концентрировали свои цитаты на уменьшающемся числе оригинальных человеческих статей.
Авторы заявляют:
‘По мере того как языковые модели переходят от составления текста к запуску агентов поиска литературы с вызовами инструментов, сфабрикованные ссылки становятся легче обнаружить и ограничить.’
‘Серьёзный сбой начинается после того, как каждый кандидат оказывается реальным: разные модели всё равно могут выбирать один и тот же узкий набор, создавая цитатную монокультуру, хотя ни одна отдельная цитата не является ошибочной.’
В качестве способа решения проблемы статья утверждает, что простое смешивание моделей от разных поставщиков или предоставление статьям одинаковой экспозиции будет недостаточно, поскольку большая часть предпочтений общая для моделей. Скорее, основное предпочтение конкретных статей должно измениться — возможно, путем целенаправленного повышения значимости игнорируемых статей. Однако авторы подчеркивают, что такой подход пока не проверен.
Подходы к тестированию
Эталон был построен из 120 реальных статей по дистилляции знаний, собранных с arXiv и опубликованных в период с 2015 по 2022 годы. Каждая из них имела от 50 до 500 цитирований на момент сбора, диапазон, выбранный для исключения как малоизвестных, так и исключительно влиятельных работ.
Эксперимент начался с случайного выбора тридцати статей из доступного набора, при этом имена авторов, годы публикаций и количество цитирований были скрыты. Каждая модель создавала короткий обзор или позиционный текст, цитируя не более десяти статей, и эти выборы сравнивались со случайными отборками из того же материала:

Schema for the method used for testing citation preferences. Thirty randomly selected papers were shown to a model with identifying information hidden, after which it could cite up to ten. Its choices were compared with random selection, while each round added 120 AI-written papers to the next round’s collection.
В расширенном эксперименте после каждого раунда в набор добавлялось 120 новых сгенерированных статей, постепенно увеличивая долю исследований, написанных ИИ.
В предварительном тестировании модели склонны были цитировать большинство показанных им статей, обычно выбирая от 22 до 27 из 30. Поэтому исследователи установили максимум в десять цитат для основного эксперимента, заставив модели делать более избирательные выборы.
Ниже представлено резюме получившегося экспериментального дизайна:

Experimental setup used to test citation preferences. The study began with 120 real papers and tested eleven models from three vendors, using randomized sets of 30 papers and a maximum of ten citations. Later rounds added AI-generated papers, expanding the collection to 1,440 papers.
В начальном эксперименте использовались одиннадцать моделей от трёх основных поставщиков: OpenAI представила GPT-5, GPT-5 mini, GPT-4.1 и GPT-4.1 mini; Google — Gemini 2.5 Pro, Gemini 2.5 Flash, Gemini 3.1 Pro и Gemini 3.1 Flash-Lite; а Anthropic — Claude Opus 4.8, Claude Sonnet 4.6 и Claude Haiku 4.5.
В результатах тестов, показанных ниже, мы видим, насколько каждая модель сосредотачивала свои цитаты на небольшой группе статей; сколько статей она полностью игнорировала; и насколько последовательно она делала одинаковый выбор при повторении эксперимента:

Test results showing how strongly each model concentrated its citations on particular papers and how many papers it ignored entirely. ‘Top-10% share’ shows how many citations went to the 12 most-favored papers, while ‘HHI’ measures how concentrated citations were overall. ‘Reliability’ shows how consistently each model favored the same papers across tests, and ρ shows how similar those preferences were across models. The ‘Matched null’ row indicates what would be expected if papers were chosen at random.
Что именно предпочитают модели?
Предпочтения, как оказалось, в подавляющем большинстве определялись содержимым самих статей. Например, для GPT-5 mini около 90 % вариаций в том, какие статьи предпочитались, объяснялось содержимым, а не такими факторами, как порядок списка, шум генерации или сфабрикованные метаданные, прикреплённые к каждой статье. Тот же эффект «доминирующего содержания» был воспроизведён для GPT-4.1 mini.
Карта предпочтений (см. ниже) также практически не менялась, когда названия и аннотации были существенно переписаны при сохранении их смысла. В четырёх успешных тестах парафразирования получены корреляции от 0,95 до 0,99, несмотря на использование разных моделей от трёх поставщиков для переписывания.
Изменения в карте предпочтений наблюдались только тогда, когда основной смысл был измеримо изменён:

Test results comparing citation preferences across the eleven models. The numbers show how closely each pair of models favored the same papers, with higher values indicating greater agreement. Despite differences between models and vendors, broadly similar preferences were found across the group
Следовательно, модели, по-видимому, реагируют в первую очередь на семантическое содержание, а не на конкретные формулировки. Однако причина их сильного согласия не могла быть окончательно определена.
Возможно, как утверждают авторы, общий консенсус по цитированию был усвоен в процессе обучения. Альтернативная возможность состоит в том, что схожие суждения о том, что считается «цитируемой» статьёй, могут быть достигнуты независимо.
Таким образом, существование общего предпочтения было подтверждено, но его конечное происхождение остаётся неизвестным.
Авторы предполагают, что широкое использование ИИ в исследованиях может сузить диапазон работ, получающих внимание, поскольку разные модели склонны предпочитать многие из одних и тех же статей; и по мере накопления литературы, созданной ИИ, эти общие предпочтения могут ещё сильнее укрепляться через повторяющиеся цитаты, делая менее предпочтительные исследования всё труднее обнаружить. Поэтому разнообразие цитат и мониторинг концентрации цитирований предлагаются в качестве возможных мер защиты.
Эталон исследования по рекурсивной концентрации цитат теперь доступен на GitHub.
Заключение
МнениеКак человек, который каждую неделю читает огромное количество статей по ИИ, я наблюдал, как «волны цитирований» приходят и уходят. Одним из постоянных столпов является статья Google Attention Is All You Need, оригинальная статья о трансформерах, которая, вероятно, уже жёстко закодирована в шаблоны подачи.
Другим часто повторяющимся нарушителем в течение длительного времени была работа 2014 года Generative Adversarial Networks, хотя со временем её частота была заменена Denoising Diffusion Probabilistic Models и другими исследованиями, основанными на диффузионных моделях.
Практически во всех случаях эти «повторяющиеся» цитаты сами по себе не являются неправильными; однако они часто слишком широки, чтобы быть полезной поддержкой для статьи, в которой они цитируются; и в этом смысле они представляют собой нечто похожее на «цитатную мойку» — включение «надёжных», но в основном декоративных цитат, придающих видимость достоверности при минимальных усилиях.
Первоначально опубликовано в понедельник, 24 августа 2026 г.












