Взгляд Anderson

ИИ Цитирует Одни И Те же Статьи Снова и Снова – Точно Как Люди

mm
Добавьте Unite.AI в избранные источники в Google
AI-generated article image (GPT Image 2): an industrial humanoid robot sits with its feet raised, reading Popular Mechanics beside a turntable playing a record and a partially filled metal record rack. A cat sleeps on otherwise empty shelving behind it. A yellow-and-black border reads ‘AI FANTASY INSIDE’ and ‘REALITY OUTSIDE’.

ChatGPT и другие инструменты ИИ для написания могут тихо превращать науку в конкурс популярности, постоянно направляя исследователей к одним и тем же статьям, игнорируя новые и оригинальные работы, которые действительно могли бы продвинуть область.

 

Монокультура, в терминах частоты и статистики, представляет собой ситуацию, когда один и тот же ограниченный набор источников или ресурсов повторяется снова и снова, заглушая новые голоса и свежие взгляды: тот же ограниченный набор песен в радиоэфире; тот же один и тот же набор авторов и книг на полках в аэропортах; и тот же ограниченный ассортимент фруктов и овощей в супермаркетах:

Yes, we have these bananas, and only these bananas. Source - https://www.thaitissues.com/en/post/a-deep-dive-into-the-grand-naine-banana-the-king-of-the-global-banana-market-and-its-crossroads-f

Да, у нас есть эти бананы — и только эти бананы. Однородность фруктов и овощей в западных продовольственных цепочках игнорирует сотни других видов, потому что различные цепочки производства и транспортировки слишком дороги для индустриализации разнообразных фруктов и овощей. Источник

Это происходит и со ссылками в новых научных исследованиях: исследователи, возможно из лени, по умолчанию используют «надёжный» набор источников, который набирает влияние и постепенно начинает доминировать в направлениях исследований.

Это известно как эффект Матфея — социологическая теория, согласно которой обладающие преимуществом будут и дальше получать выгоду. Явление сравнивают с обещанием в Евангелии от Матфея 13:12, где говорится: «Кто имеет, тому будет дано ещё больше, и у него будет изобилие. Кто не имеет, у того отнимут даже то, что он имеет».

Внутри Круга

Одной из великих надежд исследований с поддержкой ИИ было то, что новые методы машинного обучения могут выйти за пределы эффекта Мэтью — также известного как смещение в пользу популярности – и начать цитировать менее известные работы, которые могут быть более точными или более уместными для аргумента в статье.

Однако, исходя из того, как процедуры обучения ИИ интерпретируют наборы данных, никогда не было достаточных оснований для такого оптимизма; и неоднократно обнаруживалось, что когда ИИ не выдумывает цитаты откровенно — текущая хроническая проблема — он действительно усиливает эффект Мэтью, как и люди — хотя, возможно, не по той же причине.

Во время обучения модель учится высоко ранжировать наиболее цитируемые (или «наиболее часто повторяемые») статьи в обучающем наборе, поскольку процедуры обучения предназначены для выявления значимых паттернов и игнорируют выбросы как «шум», или статистические аномалии.

При таком режиме эквивалент теории относительности Эйнштейна никогда не получит внимания от модели, которая, будучи обученной, считает, что уже нашла свои принципы и референты, и может лишь слегка скорректировать эту позицию, обратившись к более новым публикациям через RAG, или другими способами, расширяющими охват модели за пределы её обученной матрицы.

Проблема в том, что она не будет придавать таким новым работам тот же статус, что и «старым фаворитам», которые она уже знала, или вовсе не будет их учитывать, поскольку её статистические предубеждения уже глубоко укоренились.

Таким образом, ИИ не наблюдает и не имитирует человеческое поведение, когда он поддерживает эффект Мэтью — он просто подсчитывает количество случаев, когда исследователи лениво используют одни и те же старые статьи, и аналогично ранжируют их высоко. В этом отношении проблема повторяющихся цитат связана с задачей выбора действительно интересной научной статьи из непрерывно растущего потока публикаций по ИИ, поскольку самая сильная работа часто имеет самый слабый сигнал.

Диагностика Монокультуры

Эта проблема рассматривается в интересной новой статье из США под названием When AI Writes, Who Gets Cited? Evidence of Citation Monoculture Across Language Models. Новое исследование — совместный проект Университета Техаса в Остине, Института технологий Стивенса, Вашингтонского университета в Сент-Луисе, Университета Райса и Университета Нотр-Дам — стремится однозначно доказать существование цитатной монокультуры в машинном обучении, чтобы её переменные могли быть потенциально напрямую устранены в будущем, вместе с самой проблемой.

В тестах авторы обнаружили, что одиннадцать моделей от OpenAI, Google и Anthropic постоянно предпочитали одну и ту же небольшую группу статей — даже после того, как очевидные сигналы популярности были удалены.

Для проверки этого 120 реальных статей были лишены количества цитирований и информации о журналах, имена авторов заменены, а годы публикаций случайным образом переименованы. Затем каждому модели показывали случайные наборы из тридцати статей, при этом модель могла цитировать не более десяти.

Восемь экспертов‑человек в соответствующих областях получили те же слепые статьи, но не пришли к тем же фаворитам, что и ИИ, что свидетельствует о том, что предвзятость была специфична для моделей ИИ, а не для самих статей:

From the new paper, test results comparing citation choices by AI models and human experts. Across all eleven models, citations were concentrated on a smaller group of papers, while some papers were repeatedly passed over entirely. Human experts showed neither tendency. Source - https://arxiv.org/pdf/2608.19230

Из новой статьи, результаты тестов, сравнивающие выбор цитат моделями ИИ и человеческими экспертами. По всем одиннадцати моделям цитаты концентрировались на небольшой группе статей, в то время как некоторые статьи полностью игнорировались. Человеческие эксперты не проявляли ни одной из этих тенденций. Source – https://arxiv.org/pdf/2608.19230 Источник

Те же статьи оставались популярными даже когда модели просили лишь выбрать ссылки, показывая, что написание обзора само по себе не вызывало предвзятость.

Эксперимент затем был расширен до одиннадцати раундов, при каждом из которых после раунда добавлялось 120 статей, написанных ИИ, чтобы проверить, что происходит, когда эти общие предпочтения действуют в растущем пуле исследований, созданных ИИ.

По мере добавления всё большего количества статей, написанных ИИ, модели всё сильнее концентрировали свои цитаты на уменьшающемся числе оригинальных человеческих статей.

Авторы отмечают:

‘По мере того как языковые модели переходят от составления текста к запуску агентов поиска литературы с вызовами инструментов, поддельные ссылки становятся легче обнаруживаемыми и контролируемыми.’

‘Серьёзный сбой начинается после того, как каждый кандидат оказывается реальным: разные модели всё равно могут выбрать один и тот же узкий набор, создавая цитатную монокультуру без того, чтобы какая‑то отдельная цитата была неверной.’

В качестве меры по исправлению проблемы статья утверждает, что простое смешивание моделей от разных поставщиков или предоставление одинаковой экспозиции статьям будет недостаточным, поскольку большая часть предпочтения общая для моделей. Вместо этого внутреннее предпочтение конкретных статей должно измениться — возможно, посредством целенаправленного предоставления менее известным статьям большего внимания. Однако авторы подчёркивают, что такой подход пока не проверен.

Подходы к Тестированию

Эталон был построен на основе 120 реальных статей по дистилляции знаний, собранных с arXiv и опубликованных в период с 2015 по 2022 годы. Каждая из них имела от 50 до 500 цитирований на момент сбора, диапазон, выбранный для исключения как малоизвестных, так и исключительно влиятельных работ.

Эксперимент начался с случайного выбора тридцати статей из доступного набора, при этом имена авторов, годы публикаций и количество цитирований скрывались. Каждая модель создавала короткий обзор или позиционный текст, цитируя не более десяти статей, и эти выборы сравнивались со случайными отборками из того же материала:

Method used to test citation preferences. Thirty randomly selected papers were shown to a model with identifying information hidden, after which it could cite up to ten. Its choices were compared with random selection, while each round added 120 AI-written papers to the next round's collection.

Метод, использованный для тестирования предпочтений цитирования. Тридцать случайно выбранных статей были показаны модели с скрытой идентифицирующей информацией, после чего она могла цитировать до десяти. Ее выборы сравнивались со случайным отбором, при этом каждый раунд добавлял 120 статей, написанных ИИ, в набор следующего раунда.

В расширенном эксперименте после каждого раунда в набор добавлялось 120 новых статей, постепенно увеличивая долю исследований, написанных ИИ.

В предварительном тестировании модели, как правило, цитировали большинство представленных им статей, обычно выбирая от 22 до 27 из 30. Поэтому исследователи установили максимум в десять цитат для основного эксперимента, заставив модели делать более избирательный выбор.

Ниже представлено резюме полученного экспериментального дизайна:

Experimental setup used to test citation preferences. The study began with 120 real papers and tested eleven models from three vendors, using randomized sets of 30 papers and a maximum of ten citations. Later rounds added AI-generated papers, expanding the collection to 1,440 papers.

Экспериментальная установка, использованная для тестирования предпочтений цитирования. Исследование началось с 120 реальных статей и протестировало одиннадцать моделей от трёх поставщиков, используя случайные наборы из 30 статей и максимум в десять цитат. Поздние раунды добавляли статьи, сгенерированные ИИ, расширяя набор до 1 440 статей.

Начальный эксперимент использовал одиннадцать моделей от трёх основных поставщиков: OpenAI представлена GPT-5, GPT-5 mini, GPT-4.1 и GPT-4.1 mini; Google — Gemini 2.5 Pro, Gemini 2.5 Flash, Gemini 3.1 Pro и Gemini 3.1 Flash-Lite; Anthropic — Claude Opus 4.8, Claude Sonnet 4.6 и Claude Haiku 4.5.

В результатах тестов, показанных ниже, мы видим, насколько каждая модель концентрировала свои цитаты в небольшой группе статей; сколько статей она полностью игнорировала; и насколько последовательно она делала одинаковый выбор при повторении эксперимента:

Test results showing how strongly each model concentrated its citations on particular papers and how many papers it ignored entirely. 'Top-10% share' shows how many citations went to the 12 most-favored papers, while 'HHI' measures how concentrated citations were overall. 'Reliability' shows how consistently each model favored the same papers across tests, and ρ shows how similar those preferences were across models. The 'Matched null' row indicates what would be expected if papers were chosen at random.

Результаты тестов, показывающие, насколько сильно каждая модель концентрировала свои цитаты на конкретных статьях и сколько статей полностью игнорировала. ‘Доля топ‑10 %’ показывает, сколько цитат пришлось на 12 наиболее предпочитаемых статей, в то время как ‘HHI’ измеряет степень концентрации цитирований в целом. ‘Надёжность’ показывает, насколько последовательно каждая модель предпочитала одни и те же статьи в разных тестах, а ρ показывает, насколько похожи эти предпочтения между моделями. Строка ‘Matched null’ указывает, чего ожидать, если статьи выбираются случайно.

Что На Самом Деле Предпочитают Модели?

Было обнаружено, что предпочтение в подавляющем большинстве определяется содержанием самих статей. Например, для GPT-5 mini около 90 % вариации в том, какие статьи предпочитались, объяснялось содержанием, а не такими факторами, как порядок в списке, шум генерации или поддельные метаданные, прикреплённые к каждой статье. Тот же эффект «доминирующего содержания» был воспроизведён с GPT-4.1 mini.

Карта предпочтений (см. ниже) также почти не изменилась, когда заголовки и аннотации были существенно переписаны при сохранении их смысла. В четырёх успешных тестах парафразирования получены корреляции от 0,95 до 0,99, несмотря на использование разных моделей от трёх поставщиков для переписывания.

Изменения в карте предпочтений наблюдались только тогда, когда основной смысл был заметно изменён:

Test results comparing citation preferences across the eleven models. The numbers show how closely each pair of models favored the same papers, with higher values indicating greater agreement. Despite differences between models and vendors, broadly similar preferences were found across the group

Результаты тестов, сравнивающие предпочтения цитирования между одиннадцатью моделями. Числа показывают, насколько близко каждая пара моделей предпочитала одни и те же статьи, при этом более высокие значения указывают на большую согласованность. Несмотря на различия между моделями и поставщиками, в группе наблюдались в целом схожие предпочтения.

Таким образом, модели, по-видимому, реагируют в первую очередь на семантическое содержание, а не на конкретные формулировки. Однако причина их сильного согласия не могла быть однозначно определена.

Возможно, как утверждают авторы, общий консенсус по цитированию мог быть усвоен во время обучения. Альтернативной возможностью является то, что схожие суждения о том, что считается «цитируемой» статьёй, могут быть достигнуты независимо.

Таким образом, наличие общего предпочтения было установлено, но его окончательное происхождение остаётся неизвестным.

Авторы предполагают, что широкое использование ИИ в исследованиях может сузить диапазон работ, получающих внимание, поскольку разные модели склонны предпочитать многие из одних и тех же статей; и по мере накопления литературы, генерируемой ИИ, эти общие предпочтения могут ещё сильнее усиливаться через повторяющиеся цитаты, делая менее популярные исследования всё труднее обнаружить. Поэтому разнообразие цитат и мониторинг концентрации цитирований предлагаются в качестве возможных мер защиты.

Бенчмарк исследования для рекурсивной концентрации ссылок теперь доступен на GitHub.

Заключение

Мнение Как человек, который еженедельно читает огромное количество статей по ИИ, я наблюдал «волны цитирований», приходящие и уходящие. Одним из постоянных столпов является статья Google Attention Is All You Need, оригинальная статья о трансформерах, которая теперь, вероятно, жёстко встроена в шаблоны подачи.

Другим часто повторяющимся объектом, длительное время, была работа 2014 года Generative Adversarial Networks, хотя впоследствии её частота была превзойдена Denoising Diffusion Probabilistic Models и другими исследованиями на основе диффузионных моделей.

Во почти всех случаях эти «повторяющиеся» цитаты не являются неправильными per se; однако они часто слишком широки, чтобы быть полезной поддержкой для статьи, в которой они цитируются; и в этом смысле они представляют собой нечто похожее на «цитатную мойку» — включение «надёжных», но в основном декоративных ссылок, придающих работе видимость достоверности при минимальных усилиях.

 

Первоначально опубликовано в понедельник, 24 августа 2026 г. Исправлено 23:07 EET, чтобы добавить недостающее множественное число.

Автор в области машинного обучения, специалист по синтезу человеческих изображений. Бывший руководитель отдела исследовательского контента в Metaphysic.ai, до его объединения с Brahma.ai от DNEG.
Веб‑сайт: martinanderson.ai
Контакт: martin@martinanderson.ai