Взгляд Anderson
Борьба с AI‑slop в научных статьях

ИИ делает всё в масштабе, от веб‑скрейпинга уровня DOS‑атаки до создания или обеспечения таких огромных объёмов научных публикаций, из‑за чего ситуация превращается одновременно в логистический кризис и в кризис качества, поскольку соотношение сигнал‑шум продолжает становиться непроходимым.
На прошлой неделе препринт‑сервер arXiv объявил, что вводит новую политику ограничения скорости для отправителей, которым теперь будет разрешено не более двух отправок в месяц. По словам анонса, эта мера принята в ответ на головокружительный рост количества подач за короткий период:

Ежемесячные подачи в категорию cs.AI на arXiv с января 2024 по сентябрь 2026 года, показывающие более чем шестикратное увеличение за этот период. Источник
В блоге Кэт Боборис, объявляющем о шаге, который вызвал комментарии на Hacker News в прошлый четверг, указано, что arXiv получил 40 363 подачи в сентябре 2026 года — почти вдвое больше, чем 20 569 в сентябре 2024 года, и более чем в четыре раза больше, чем 9 869 в сентябре 2016 года.
По наблюдениям Боборис, подачи за последний месяц также породили почти 9 000 запросов в службу поддержки для персонала и модераторов arXiv:
‘Наши модераторы наблюдают рост количества узконаправленных «тонких» статей, а также «салями‑статей», когда одна работа разбивается и подаётся как набор более мелких статей.
‘Также наблюдается заметный рост плотных, написанных ИИ статей. Инструменты ИИ упрощают авторам возможность заполнять arXiv и другие репозитории этими низкокачественными статьями.’
Уже в мае текущего года arXiv принял меру внедрения годового запрета на неконтролируемый AI‑контент; а в октябре прошлого года сообщил авторам обзоров и позиционных статей (обе категории могут быть созданы с меньшими усилиями, чем полное академическое исследование), что для их публикации на arXiv потребуется поддержка со стороны рецензентов.
На данный момент часто ограничивающее количество HTTP‑запросов на домене arXiv не так заметно, и можно лишь надеяться, что его очень полезные RSS‑ленты выживут в этой продолжающейся реструктуризации. На прошлой неделе Reddit объявил о давно ожидаемом полном прекращении своих RSS‑лент, которое начнётся со середины следующего месяца. Тем не менее, некоммерческий статус arXiv означает, что получить мало аналогичного капитала можно, заставляя читателей посещать сайт обязательно или вводя обязательные входы — по крайней мере, пока.
Против растущего потока
На фоне таких серьёзных и растущих проблем с негативным воздействием использования ИИ в научных исследованиях — особенно в отношении исследований, связанных с ИИ, которые затмили все остальные категории и из тени вышли, став политическим и экономическим индикатором в последнее время — возникло направление исследований, изучающее способы противодействия падению качества статей, связанных с ИИ.
Последнее решение проблемы представлено в виде сотрудничества между Сеульским национальным университетом в Корее и Университетом Миннесоты в США. Статья, названная Science or Slop?: Benchmarking and Mitigating Scientific Slop in AI-Generated Papers, предлагает измерять «научный slop» через сбои в связях между утверждениями статьи, доказательствами, цитатами и её структурой:

Из новой статьи — обзор подхода к «научному slop», показывающий, как сбои в структуре, аргументации и поддерживающих артефактах могут выявлять слабости, которые пропускают традиционные детекторы AI‑текста. Источник
В отличие от предыдущих подходов, новая система смотрит за пределы самого текста, чтобы оценить, подкреплены ли утверждения статьи её аргументами, доказательствами и цитатами. Авторы заявляют*:
‘Каждая часть статьи может выглядеть правдоподобно в изоляции, поэтому такие сбои невидимы для детекторов уровня токенов и могут быть обнаружены или исправлены только на уровне всей статьи. Чтобы оценить и смягчить научный slop, эта статья решает три задачи.’
‘Во-первых, метрики уровня токенов не способны отразить, как научное рассуждение связывается по всей статье. Разделы, утверждения, цитаты, доказательства и артефакты могут казаться правдоподобными, тогда как их взаимосвязи разрушаются. Мы неоднократно наблюдаем такие сбои в полностью сгенерированных ИИ‑статьях, и рецензенты ICLR уже штрафуют их даже в рукописях, написанных людьми.
‘Во‑вторых, обнаружение этих шаблонов остаётся неизмеренным. Существующие наборы тестов помечают только текст, поэтому степень, с которой детекторы, включая большие языковые модели, читающие всю статью, выявляют эти шаблоны, никогда не измерялась.
‘Третье, эти шаблоны трудно надёжно смягчать. В то время как сигналы на уровне токенов можно удалить путём перефразирования, исправление этих шаблонов требует восстановления недостающих связей без изменения основной науки.’
Новый бенчмарк авторов, названный SciSlopBench, был реализован в виде SciSlopHarness, фреймворка, предназначенного для обнаружения и исправления ошибок в научных рассуждениях статьи, при сохранении исходных научных доказательств:

Примеры сравнения ошибочных отрывков с правками, выполненными SciSlopHarness. Неподдерживаемые добавления отклоняются, тогда как утверждения переупорядочиваются или переписываются при необходимости, чтобы лучше отражать доступные в статье доказательства.
Сам бенчмарк SciSlopBench был построен на основе 390 статей, сгенерированных ИИ, каждая из которых сопоставлена с написанной человеком статьёй, решающей схожую исследовательскую задачу и тип вклада.
В тестах SciSlopBench использовался для различения 390 пар статей, где каждая пара состояла из упомянутой выше статьи, сгенерированной ИИ, и статьи, написанной человеком, сопоставленной по исследовательской проблеме и типу вклада. Бенчмарк корректно определял ИИ‑сгенерированную статью в 85,9 % этих сравнений, существенно опережая традиционные детекторы ИИ‑текста.
Авторы заявляют:
‘В то время как стандартные правки оставляют остаточный slop и прямое подсказка, учитывающая slop, провоцирует манипуляцию вознаграждением, SciSlopHarness уменьшает оставшийся разрыв между ИИ и человеком на 63 % по сравнению с самой сильной базовой правкой, не требуя целевых человеческих ссылок.
‘В целом, мы демонстрируем, что статьи, сгенерированные ИИ, оставляют фундаментальные следы в их глобальном рассуждении, и что ответственное смягчение требует строгого доказательного обоснования, а не лишь улучшения текста.’
В дополнение к вкладу самой статьи, авторы реализовали принципы своей новой работы в виде живого демонстрационного примера, где пользователи могут отправлять научные статьи для анализа количества AI‑slop, содержащегося в них.
Интересно, что сама новая статья, проанализированная демо, получает «умеренный» показатель slop 40/100†:

Новая статья, проанализированная её собственным алгоритмом, получает отмеченные области «slop», выявленные новым процессом авторов. Источник
Метод и подход к данным
Сотрудничество 2025 Почему slop имеет значение описало «поверхностную компетентность» как определяющую характеристику AI‑slop, где кажущееся качество скрывает отсутствие содержания. Новая работа применяет эту идею более конкретно к научным статьям, определяя «научный slop» как недостатки, затрудняющие понимание того, как организовано исследование; как поддерживаются его утверждения; и как можно изучать его методы и доказательства, при этом недостатки группируются по структуре; аргументации; и артефактам:

Правила измерения шести типов научного slop, используемых в бенчмарке. Таблица показывает, что проверяется для каждой метрики, как рассчитывается оценка и что представляет собой максимальная оценка 1, при этом более высокие оценки указывают на более обширные ошибки.
Шесть мер научного slop, определённых в статье, включают ссылки между разделами (являются ли ссылки разделов осмысленными к материалу в других частях статьи); макро избыточность (повторяют ли более поздние разделы ранее представленный материал); граф аргументов (правильно ли утверждения поддерживаются предшествующим рассуждением); изоляцию цитат (используются ли цитаты поверхностно, без объяснения того, как цитируемые работы соотносятся со статьёй или друг с другом); изложение фигур (объясняют ли фигурные изображения метод); и пробел в доказательствах (подкреплены ли представленные результаты конкретными примерами).
Бенчмарк был построен путём сопоставления статей, сгенерированных ИИ, с сопоставимыми/эквивалентными статьями, написанными человеком, при этом ИИ‑статьи отобраны из FARS и конкурса 2025 Agents4Science.
Для каждой автоматически сгенерированной статьи FARS исследователи проверяли её ссылки в поисках статьи, написанной человеком того же типа и принятой в ведущем журнале, после чего подбирали наиболее близкую по теме, получив 143 пары. Статьи Agents4Science аналогично сопоставлялись с человеческими аналогами, добавив ещё 247 пар и доведя набор до 390 пар ИИ‑человек в сумме. Статьи охватывают естественные, социальные и природные науки, хотя набор данных сильно смещён в сторону компьютерных наук.
Для оценки метрик производительность измерялась с помощью PairAcc, который показывает, как часто человеческая статья ранжируется выше своей ИИ‑версии; и AUROC, который измеряет общее разделение между человеческими и ИИ‑статьями при разных порогах. Авторы также приводят результаты обнаружения при фиксированном уровне ложноположительных результатов для человеческих статей в 5 %.
Тесты
Начальные тесты сравнили SciSlop с детекторами ИИ‑текста Binoculars; DetectGPT; и NTS††, а также с автоматизированными системами рецензирования AI Scientist Reviewer и CycleReviewer.
Для последующих тестов по доработке использовались четыре базовых подхода: base prompting; Claude Code; reviewer-based refinement; и slop-aware revision. Первым трем были даны лишь общие указания по улучшению статьи, тогда как slop-aware revision дополнительно получили определения и местоположения обнаруженного slop. Все они сравнивались с SciSlopHarness при одинаковых условиях доработки.
Для реализации детекторам текста предоставлялся текст статьи, тогда как остальные методы получали исходный код статьи и, при необходимости, доступ к её коду. Binoculars использовал Falcon-7B базовые и инструктивные модели; DetectGPT применял T5-3B для генерации 100 возмущений; AI Scientist использовал Qwen2.5-32B-Instruct; а CycleReviewer использовал выпущенный 8‑B чекпоинт. Для статей, превышающих лимит в 2 048 токенов у Falcon, неперекрывающиеся окна оценивались отдельно и усреднялись.
Начальные результаты обнаружения представлены в двух таблицах ниже: SciSlop достиг 85,9 % PairAcc, по сравнению с 68,7 % у Binoculars и 68,5 % у самого сильного автоматизированного рецензента, сократив уровень ошибок более чем вдвое:

Результаты обнаружения, сравнивающие SciSlop с детекторами ИИ‑текста и автоматизированными рецензентами, а также результаты его шести отдельных измерений slop. SciSlop достигает наивысшего общего PairAcc, тогда как ссылки между разделами дают самый сильный отдельный результат.
Ссылки между разделами показали особенно высокую эффективность сами по себе, достигнув 90,5 % PairAcc без необходимости модели и обнаружив 65 % ИИ‑сгенерированных статей при уровне ложноположительных результатов 5 %, по сравнению с 24 % у Binoculars.
Авторы утверждают, что эти результаты показывают, что взаимосвязи внутри статьи дают более сильный сигнал ИИ‑генерации, чем традиционное детектирование на уровне текста в этом наборе данных, одновременно выявляя конкретные слабости, которые впоследствии можно будет исправлять.
Затем была изучена связь между научным slop и человеческой оценкой качества статьи. Как показано в первом столбце ниже, более высокий slop коррелирует с более низкими оценками ICLR по общему рейтингу, надёжности, презентации и вкладу:

Сравнение SciSlop с детекторами ИИ‑текста и автоматизированными рецензентами в контексте результатов рецензий ICLR. Левая панель отображает степень ИИ‑подобия относительно оценок рецензий; центр сравнивает отдельные измерения рецензий; правая показывает эффективность различения отклонённых и принятых статей за девять лет.
Отклонённые и принятые статьи также отличались от случайного уровня во всех девяти рассмотренных годах, тогда как традиционные детекторы показывали результаты ниже случайного уровня в большинстве сравнений.
Таким образом, научный slop отражает слабости, уже учитываемые человеческими рецензентами, а не служит лишь сигналом ИИ‑авторства.
Последние тесты проверяли, может ли SciSlopHarness удалить slop, оставшийся после более общей доработки. Как показано ниже, harness достиг результата, наиболее близкого к среднему человеческому показателю по всем шести измерениям, тогда как общая доработка часто оставляла значительный slop, а прямая slop-aware revision иногда переусердствовала:

Результаты ревизии, сравнивающие SciSlopHarness с четырьмя базовыми методами по шести показателям slop. Значения, ближе к нулю, ближе к среднему показателю человеческой статьи, при этом SciSlopHarness обычно приближается к этому уровню, тогда как ревизия, учитывающая slop, часто превышает его.
Каждое предложенное изменение проверялось на соответствие научному обоснованию статьи и подтверждающим доказательствам, а неподдерживаемые правки отклонялись. По шести показателям оставшийся разрыв по сравнению с человеческими статьями был сокращён на 63 % относительно Claude Code, самого сильного базового метода ревизии.
Заключение
Было интересно, в процессе написания этой статьи, отметить не только то, насколько плохо эта статья оценивалась на собственном демонстрационном сайте, но и увидеть хотя бы один пример «ленивой» или «косметической» ссылк膆, которая в последнее время стала небольшим, но растущим проклятием в научных публикациях.
В подобных случаях, помимо этой конкретной статьи, исследователи, кажется, опираются на собственные знания, а не взаимодействуют осмысленно с существующей литературой. Тем не менее, будучи ограниченными условием «показать свою работу», ссылки часто предоставляются с тем, что выглядит как нетерпение, даже презрение к процессу, и, как правило, полагаются на то, что читатель примет обилие ссылок как достаточную «покровную» достоверность, хотя она не выдержит тщательной проверки.
Arxiv сопротивляется AI‑управляемой индустриализации подачи статей; будет ли введено аналогичное ограничение прямого участия ИИ в исследованиях, если не произойдёт соответствующая катастрофа достаточной масштабности, пока неизвестно.
* Акценты авторов, а не мои — но при необходимости я преобразовал встроенные ссылки авторов в гиперссылки.
† Авторы не утверждают, что в своей статье не использовали ИИ, и подробно описывают такое использование.
†† Возможно, читателю будет интересно узнать, что мне пришлось самостоятельно искать правильную ссылку для фреймворка NTS, потому что ссылка, предоставленная авторами, была нерелевантна — один из тех самых показателей, на которые опирается SciSlop!
Первоначально опубликовано в воскресенье, 4 октября 2026 г.












