Погляд Anderson

Боротьба зі схибом ШІ у наукових статтях

mm
Додайте Unite.AI до бажаних джерел у Google
Image 'A shelf filled with lots of bottles of liquid' by Evgeniy Smersh. Used under the Unsplash license. Source: https://unsplash.com/photos/a-shelf-filled-with-lots-of-bottles-of-liquid-aWnA944oXLE

ШІ робить усе в масштабі, від DOS-attack-level web scraping до створення чи дозволення такі величезні обсяги наукових дослідницьких подань, що результат стає як логістичною кризою, так і кризою якості, оскільки співвідношення сигнал‑шум продовжує ставати непрохідним.

Минулого тижня препринт‑сервер arXiv оголосив, що вводить нову політику обмеження швидкості подань для подавців, які тепер будуть обмежені двома поданнями на місяць. За словами оголошення, цей захід був прийнятий у відповідь на різке зростання швидкості подань за короткий проміжок часу:

Щомісячні подання у категорії cs.AI на arXiv з січня 2024 року по вересень 2026 року, що демонструє понад шестикратне збільшення за цей період. Джерело — https://blog.arxiv.org/2026/10/01/updated-rate-limit-policy/

Щомісячні подання у категорії cs.AI на arXiv з січня 2024 року по вересень 2026 року, що демонструє понад шестикратне збільшення за цей період. Джерело

У блозі Кет Боборіс, присвяченому цьому кроку, який отримав коментар на Hacker News у минулий четвер, зазначено, що arXiv отримав 40 363 подання у вересні 2026 року — майже вдвічі більше, ніж 20 569 у вересні 2024 року, і понад чотири рази більше, ніж 9 869 у вересні 2016 року.

Як зазначив Боборіс, подання за останній місяць також створили майже 9 000 запитів до служби підтримки для персоналу та модераторів arXiv:

‘Наші модератори спостерігають зростання кількості тонких статей вузького спектру, а також «салямі» статей, коли одна робота розбивається і подається як набір менших статей.

‘Також спостерігається значне зростання щільних, написаних ШІ статей. Інструменти ШІ полегшують авторам масове заповнення arXiv та інших репозиторіїв цими низькоцінними статтями.’

Вже у травні цього року arXiv вжила заходу щодо впровадження однорічної заборони для неперевіреного ШІ‑контенту; а у жовтні минулого року повідомила подавцям оглядових та позиційних статей (обидві можуть бути створені з меншими зусиллями, ніж повне академічне дослідження), що їм знадобиться підтримка колег для публікації на arXiv.

На даний момент часто обмежувальне обмеження http‑запитів доменом arXiv не є помітним, і можна лише сподіватися, що його дуже корисні RSS‑канали виживуть у цьому постійному скороченні. Минулого тижня Reddit оголосив довгоочікуване повне припинення своїх RSS‑каналів, що відбудеться з середини наступного місяця. Однак статус некомерційної організації arXiv означає, що мало подібного капіталу можна отримати, спонукаючи читачів до обов’язкових візитів на сайт або примусових входів — принаймні наразі.

Проти зростаючої хвилі

У відповідь на такі серйозні і зростаючі проблеми щодо негативного впливу використання ШІ в наукових дослідженнях – особливо щодо досліджень, пов’язаних із ШІ, які затмили усі інші категорії та піднялися з тіні, ставши політичним та економічним показником останнім часом – з’явилася гілка досліджень, що вивчає способи протидії падінню якості подань статей, пов’язаних із ШІ.

Останнє рішення проблеми представлено у формі співпраці між Сеульським національним університетом у Кореї та Університетом Міннесоти в США. Стаття, під назвою Science or Slop?: Benchmarking and Mitigating Scientific Slop in AI-Generated Papers, пропонує вимірювати «науковий схиб» через провали у зв’язках між твердженнями статті, доказами, цитатами та структурою:

З нової статті — огляд підходу роботи до «наукового схибу», який показує, як провали в структурі, аргументації та підтримуючих артефактах можуть виявити слабкі місця, які пропускають традиційні детектори ШІ‑тексту. Джерело — https://arxiv.org/pdf/2610.00531

З нової статті — огляд підходу роботи до «наукового схибу», який показує, як провали в структурі, аргументації та підтримуючих артефактах можуть виявити слабкі місця, які пропускають традиційні детектори ШІ‑тексту. Джерело

На відміну від попередніх підходів, нова система виходить за межі самого тексту, щоб оцінити, чи правильно підтримуються твердження статті її аргументами, доказами та цитатами. Автори зазначають*:

‘Кожна частина статті може виглядати правдоподібною в ізоляції, тому такі розриви невидимі для детекторів на рівні токенів і можуть бути виявлені чи виправлені лише на рівні всієї статті. Для оцінки та пом’якшення наукового схибу ця стаття розглядає три виклики.’

‘По-перше, метрики на рівні токенів не в змозі захопити, як наукове міркування пов’язується протягом статті. Розділи, твердження, цитати, докази та артефакти можуть виглядати правдоподібними, тоді як взаємозв’язки між ними руйнуються. Ми неодноразово спостерігаємо такі провали в скрізних статтях, згенерованих ШІ, і рецензенти ICLR вже карають їх навіть у роботах, написаних людьми.

‘По‑друге, виявлення цих шаблонів залишається незміреним. Існуючі тестові набори позначають лише текст, тому те, наскільки детектори, включаючи LLM, які читають всю статтю, виявляють ці шаблони, ніколи не вимірювалося.

‘Третє, ці шаблони важко надійно пом’якшити. У той час як сигнали на рівні токенів можна усунути шляхом перефразування, виправлення цих шаблонів вимагає відновлення відсутніх зв’язків без зміни фундаментальної науки.’

Новий бенчмарк авторів, названий SciSlopBench, був втілений у SciSlopHarness, фреймворк, створений для виявлення та виправлення помилок у науковому мисленні статті, при цьому зберігаючи підґрунтові наукові докази:

Приклади порівняння недолікових фрагментів з виправленнями, здійсненими SciSlopHarness. Непідтримувані додавання відхиляються, тоді як твердження переупорядковуються або переписуються за потреби, щоб краще відображати доступні в статті докази.

Приклади порівняння недолікових фрагментів з виправленнями, здійсненими SciSlopHarness. Непідтримувані додавання відхиляються, тоді як твердження переупорядковуються або переписуються за потреби, щоб краще відображати доступні в статті докази.

Бенчмарк SciSlopBench був створений на основі 390 статей, згенерованих ШІ, кожна з яких була зіставлена з статтею, написаною людиною, що розглядає подібну дослідницьку проблему та тип внеску.

У тестах SciSlopBench використовували для розрізнення 390 пар статей, де кожна пара складалася з вищезгаданої статті, згенерованої ШІ, та статті, написаної людиною, підбираної за дослідницькою проблемою та типом внеску. Бенчмарк правильно ідентифікував статтю, згенеровану ШІ, у 85,9 % цих порівнянь, суттєво перевершуючи традиційні детектори ШІ‑тексту.

Автори заявляють:

‘Хоча стандартні правки залишають залишковий slop і пряме підказування, орієнтоване на slop, викликає маніпуляції винагороди, SciSlopHarness зменшує залишкову різницю між ШІ та людиною на 63 % порівняно з найсильнішою базовою правкою, не вимагаючи людських референсних цілей.

‘Загалом ми демонструємо, що статті, згенеровані ШІ, залишають фундаментальні сліди у їх глобальному мисленні, і що відповідне пом’якшення вимагає строгого доказового обґрунтування, а не лише удосконалення прозовості.’

Крім внесків, зроблених самим документом, автори реалізували принципи своєї нової роботи у формі жива демонстрація, де користувачі можуть подавати наукові статті для аналізу кількості AI‑slop, яку вони містять.

Цікаво, що сама нова стаття, проаналізована демонстрацією, отримує «помірний» слоп‑бал 40/100†:

Нова стаття, проаналізована власним алгоритмом, позначає ділянки 'slop', виявлені новим процесом авторів. Source: https://yerimoh.github.io/scientific-slop-demo/r/75h2-yvx2-amhd

Нова стаття, проаналізована власним алгоритмом, отримує позначені ділянки ‘slop’ за новим процесом авторів. Джерело

Метод та підхід до даних

Колаборація 2025 Чому slop має значення описала ‘поверхневу компетентність’ як визначальну характеристику AI slop, коли очевидна якість приховує відсутність суті. Нове дослідження застосовує цю ідею більш конкретно до наукових статей, визначаючи ‘науковий slop’ як помилки, які ускладнюють розуміння того, як організовано дослідження; як підтримуються його твердження; і як можна дослідити його методи та докази, причому помилки згруповані за структурою; аргументом; та артефактами:

Правила вимірювання шести типів наукового slop, використаних у бенчмарці. Таблиця показує, що досліджується для кожного показника, як розраховується бал і що означає максимальний бал 1, при цьому вищі бали вказують на більш масштабні помилки.

Правила вимірювання шести типів наукового slop, використаних у бенчмарці. Таблиця показує, що досліджується для кожного показника, як розраховується бал і що означає максимальний бал 1, при цьому вищі бали вказують на більш масштабні помилки.

Шість показників наукового slop, визначених у статті, це посилання між розділами (чи розділи змістовно посилаються на матеріал в інших частинах статті); макро надмірність (чи пізніші розділи повторюють раніше викладений матеріал); граф аргументу (чи твердження належно підкріплені попереднім міркуванням); ізоляція цитат (чи цитати використані поверхнево, без пояснення їх зв’язку зі статтею чи між собою); експозиція рисунків (чи рисунки методів дійсно пояснюють метод); та пробіл у доказах (чи повідомлені результати підкріплені конкретними прикладами).

Бенчмарк був створений шляхом зіставлення статей, згенерованих ШІ, з порівнянними/еквівалентними статтями, написаними людьми; статті ШІ були відібрані з FARS та конкурсу 2025 Agents4Science.

Для кожної машинно‑згенерованої статті FARS дослідники переглянули її посилання, шукаючи статтю, написану людьми, того ж типу, яка була прийнята у провідному журналі, а потім вибрали найбільш схожу за темою дослідження, утворивши 143 пари. Статті Agents4Science також були зіставлені з людськими аналогами, утворивши ще 247 пар, що підняло загальну кількість до 390 пар ШІ‑людських. Статті охоплюють науки про життя, соціальні та природничі науки, хоча набір даних сильно зосереджений на інформатиці.

Для оцінки метрик продуктивність оцінювали за допомогою PairAcc, який вимірює, як часто людська стаття розташовується вище своєї ШІ‑версії; та AUROC, який вимірює загальну роздільність між людськими та ШІ‑статтями при різних порогах. Автори також повідомляють про результати виявлення при фіксованій частці хибнопозитивних результатів для людських статей у 5 %.

Тести

Початкові тести порівнювали SciSlop з AI‑текстовими детекторами Binoculars; DetectGPT; та NTS††, а також з автоматизованими системами AI Scientist рецензент та CycleReviewer.

Для пізніших тестів редагування було використано чотири базові підходи: базове підказування; Claude Code; удосконалення на основі рецензентів; та редагування з урахуванням slop. Перші три отримали лише загальні інструкції щодо покращення статті, тоді як редагування з урахуванням slop додатково отримало визначення та розташування виявленого slop. Усі порівнювалися з SciSlopHarness за однакових умов редагування.

Для реалізації текстові детектори отримували прозу статті, тоді як інші методи отримували вихідний код статті та, за потреби, доступ до її коду. Binoculars використав Falcon-7B базові та інструкційні моделі; DetectGPT використав T5-3B для створення 100 збурень; AI Scientist використав Qwen2.5-32B-Instruct; і CycleReviewer застосував випущений 8B чекпоінт. Для статей, що перевищують ліміт у 2 048 токенів Falcon, неперекриваючі вікна оцінювалися окремо та усереднювалися.

Початкові результати виявлення докладно наведено у двох таблицях нижче: SciSlop досяг 85,9 % PairAcc, у порівнянні з 68,7 % у Binoculars та 68,5 % у найсильнішого автоматизованого рецензента, скоротивши рівень помилок більш ніж удвічі:

Результати виявлення, що порівнюють SciSlop з AI‑текстовими детекторами та автоматизованими рецензентами, разом з результатами його шести окремих показників slop. SciSlop досягає найвищого загального PairAcc, тоді як крос‑секційні посилання забезпечують найсильніший індивідуальний результат.

Результати виявлення, що порівнюють SciSlop з AI‑текстовими детекторами та автоматизованими рецензентами, разом з результатами його шести окремих показників slop. SciSlop досягає найвищого загального PairAcc, тоді як крос‑секційні посилання забезпечують найсильніший індивідуальний результат.

Крос‑секційні посилання показали особливо високі результати самостійно, досягнувши 90,5 % PairAcc без потреби у моделі та виявивши 65 % статей, згенерованих ШІ, при рівні хибнопозитивних результатів 5 %, у порівнянні з 24 % у Binoculars.

Автори стверджують, що ці результати свідчать про те, що взаємозв’язки в межах статті забезпечують сильніший сигнал ШІ‑генерації, ніж традиційне детектування на рівні тексту в цьому наборі даних, і одночасно виявляють конкретні слабкі місця, які згодом можна буде виправляти.

Далі досліджувалося взаємозв’язок між науковим slop та оцінками якості статті, здійсненими людьми. Як показано у першому стовпці нижче, вищий рівень slop асоціювався з нижчими оцінками ICLR за загальну оцінку, достовірність, подання та внесок:

Порівняння SciSlop з AI‑текстовими детекторами та автоматизованими рецензентами за результатами рецензій ICLR. На лівій панелі показано схожість з ШІ у порівнянні з оцінками рецензій; у центрі порівнюються окремі виміри рецензій; праворуч демонструється ефективність у розрізненні відхилених та прийнятих статей протягом девяти років.

Порівняння SciSlop з AI‑текстовими детекторами та автоматизованими рецензентами за результатами рецензій ICLR. На лівій панелі показано схожість з ШІ у порівнянні з оцінками рецензій; у центрі порівнюються окремі виміри рецензій; праворуч демонструється ефективність у розрізненні відхилених та прийнятих статей протягом девяти років.

Відхилені та прийняті статті також були розрізнені вище випадковості протягом усіх дев’яти розглянутих років, тоді як традиційні детектори показали результати нижче випадковості у більшості порівнянь.

Отже, науковий slop виявився відображенням слабких місць, вже штрафованих людськими рецензентами, а не лише сигналом авторства ШІ.

Останні тести досліджували, чи може SciSlopHarness усунути slop, що залишився після більш загального редагування. Як показано нижче, harness завершив роботу найближче до середнього показника людей за всіма шістьма вимірами, тоді як загальне редагування часто залишало значний slop, а пряме редагування з урахуванням slop іноді перебільшувало корекцію:

Результати редагування, що порівнюють SciSlopHarness з чотирма базовими методами за шістьма показниками slop. Значення, ближчі до нуля, ближчі до середнього показника людської статті; SciSlopHarness зазвичай наближається до цього рівня, тоді як редагування з урахуванням slop часто перевищує його.

Результати ревізії, що порівнюють SciSlopHarness з чотирма базовими методами за шістьма показниками slop. Значення, ближчі до нуля, ближчі до середнього показника людських статей, при цьому SciSlopHarness, як правило, наближається до цього рівня, тоді як ревізія, орієнтована на slop, часто його перевищує.

Кожна запропонована зміна була перевірена щодо наукового обґрунтування статті та підтуючих доказів, а неподтримувані правки відхилено. За шістьма показниками залишкова різниця порівняно з людськими статтями була зменшена на 63 % у порівнянні з Claude Code, найсильнішою базовою ревізією.

Висновок

Цікаво, під час написання цієї статті, помітити не лише те, наскільки погано ця стаття оцінювалася на власному демонстраційному сайті, а й виявити принаймні один приклад «лінивої» або «косметичної» цитат膆, яка останнім часом стала невеликим, але зростаючим прокляттям у наукових статтях.

У таких випадках, поза межами цієї конкретної статті, дослідники, здається, спираються на власні знання, а не на змістовну взаємодію з існуючою літературою. Однак, будучи обмеженими конвенцією «показувати свою роботу», цитати часто подаються з виглядом нетерплячості, навіть презирства до процесу, і, здавалося б, покладаються на читача, який має прийняти надмірну кількість посилань як достатню «патину» походження, хоча така патина не витримає суворої перевірки.

Arxiv протистоїть індустріалізації подань, зумовленій ШІ; чи з’являться подібні обмеження щодо прямої участі ШІ в дослідженнях, за відсутності якоїсь достатньо великої катастрофи, залишиться питанням.

 

* Наголоси авторів, а не мої – але при необхідності я перетворив їхні вбудовані цитати у гіперпосилання.

† Автори не стверджують, що у їхній власній статті не використано ШІ, і деталізують таке використання.

†† Можливо, читача зацікавить те, що мені довелося самостійно шукати правильне посилання для NTS‑framework, оскільки посилання, надане авторами, було нерелевантним – один із тих показників, на які орієнтується SciSlop!

Перший раз опубліковано в неділю, 4 жовтня 2026 р.

Автор у галузі машинного навчання, фахівець у сфері синтезу зображень людей. Колишній керівник дослідницького контенту в Metaphysic.ai, до його злиття з Brahma.ai, що належить DNEG.
Веб‑сайт: martinanderson.ai
Контакт: martin@martinanderson.ai