Kąt Andersona
Walka z AI‑slopem w artykułach naukowych

AI robi wszystko w dużej skali, od web scrapingu na poziomie ataku DDoS po tworzenie, lub umożliwianie, tak ogromnych ilości zgłoszeń badań naukowych, że rezultat staje się zarówno kryzysem logistycznym, jak i kryzysem jakości, ponieważ stosunek sygnału do szumu staje się nieprzejściowy.
W zeszłym tygodniu serwer preprintów arXiv ogłosił, że wprowadzi nową politykę ograniczania tempa dla zgłaszających, którzy będą teraz ograniczeni do dwóch zgłoszeń miesięcznie. Według komunikatu, środek został podjęty w obliczu gwałtownego wzrostu liczby zgłoszeń w krótkim okresie:

Miesięczne zgłoszenia do kategorii cs.AI na arXiv od stycznia 2024 do września 2026, wykazujące ponad sześciokrotny wzrost w tym okresie. Źródło
Post na blogu Kat Boboris ogłaszający ten krok, który wywołał komentarz na Hacker News w zeszły czwartek, stwierdził, że arXiv otrzymał 40 363 zgłoszenia we wrześniu 2026 – prawie dwukrotnie więcej niż 20 569 w wrześniu 2024 i ponad czterokrotnie więcej niż 9 869 we wrześniu 2016.
Najbardziej aktualne miesięczne zgłoszenia, zauważył Boboris, wygenerowały również prawie 9 000 zgłoszeń wsparcia dla personelu i moderatorów arXiv:
‘Nasi moderatorzy obserwują wzrost liczby cienkich prac o wąskim zakresie, a także prac typu „salami”, gdzie pojedyncze dzieło jest rozdzielane i zgłaszane jako zestaw mniejszych prac.
‘Również odnotowano wyraźny wzrost liczby gęstych, napisanych przez AI prac. Narzędzia AI ułatwiają autorom zalewanie arXiv i innych repozytoriów tymi niskowartościowymi pracami.’
Już w maju tego roku arXiv wprowadził roczny zakaz dla niezweryfikowanych treści generowanych przez AI; a w październiku ubiegłego roku poinformował zgłaszających prace przeglądowe i stanowiskowe (obie mogą być wygenerowane przy mniejszym wysiłku niż pełne badanie akademickie), że będą potrzebować poparcia recenzentów, aby zostały opublikowane na arXiv.
Na razie częste ograniczenia liczby żądań http na domenie arXiv nie są zbyt widoczne i można jedynie mieć nadzieję, że bardzo przydatne kanały RSS przetrwają tę trwającą redukcję. W zeszłym tygodniu Reddit ogłosił długo obawianą całkowitą likwidację swoich kanałów RSS, co nastąpi od połowy przyszłego miesiąca. Jednak status non‑profit arXiv oznacza, że niewiele podobnego kapitału można uzyskać, zmuszając czytelników do obowiązkowych wizyt na stronie lub wymuszonych logowań – przynajmniej na razie.
Przeciw rosnącej fali
W obliczu takich poważnych i narastających problemów związanych ze negatywnym wpływem wykorzystania AI w badaniach naukowych – szczególnie w odniesieniu do badań związanych z AI, które przyćmiły wszystkie inne kategorie i z nieznanej pozycji stały się znacznikiem politycznym i ekonomicznym – pojawił się nurt badań analizujący sposoby przeciwdziałania spadkowi jakości zgłoszeń prac związanych z AI.
Najnowsze rozwiązanie problemu pojawia się w formie współpracy pomiędzy Seoul National University w Korei a University of Minnesota w USA. Artykuł, zatytułowany Science or Slop?: Benchmarking and Mitigating Scientific Slop in AI-Generated Papers, proponuje mierzenie „scientific slop” poprzez wykrywanie niepowodzeń w powiązaniach między roszczeniami, dowodami, cytatami i strukturą pracy:

Z nowego artykułu, przegląd podejścia pracy do „scientific slop”, pokazujący, jak niepowodzenia w strukturze, argumentacji i wspierających artefaktach mogą ujawnić słabości, które tradycyjne wykrywacze tekstu AI pomijają. Źródło
W przeciwieństwie do wcześniejszych podejść, nowy system patrzy poza sam tekst, aby ocenić, czy roszczenia w pracy są odpowiednio poparte argumentami, dowodami i cytatami. Autorzy stwierdzają*:
‘Każda część pracy może wydawać się wiarygodna w izolacji, więc takie niepowodzenia są niewidoczne dla wykrywarek na poziomie tokenów i mogą być zidentyfikowane lub naprawione jedynie na poziomie całej pracy. Aby ocenić i złagodzić scientific slop, ten artykuł podejmuje trzy wyzwania.
‘Po pierwsze, metryki na poziomie tokenów nie potrafią uchwycić, jak rozumowanie naukowe łączy się w całej pracy. Sekcje, roszczenia, cytaty, dowody i artefakty mogą wydawać się wiarygodne, podczas gdy relacje między nimi się rozpadają. Regularnie obserwujemy takie niepowodzenia w w pełni generowanych przez AI pracach, a recenzenci ICLR już je karzą, nawet w zgłoszeniach napisanych przez ludzi.
‘Po drugie, wykrywanie tych wzorców pozostaje niezmierzone. Istniejące zestawy testowe oznaczają tylko tekst, więc zakres, w jakim detektory, w tym modele językowe czytające cały artykuł, identyfikują te wzorce, nigdy nie został zmierzony.
‘Po trzecie, te wzorce są trudne do skutecznego złagodzenia. Podczas gdy sygnały na poziomie tokenów można usunąć poprzez parafrazowanie, naprawa tych wzorców wymaga przywrócenia brakujących relacji bez zmiany podstawowej nauki.’
Nowy benchmark autorów, nazwany SciSlopBench, został wprowadzony do SciSlopHarness, ramy zaprojektowanej do wykrywania i naprawiania błędów w naukowym rozumowaniu artykułu, przy jednoczesnym zachowaniu podstawowych dowodów naukowych:

Przykłady porównujące wadliwe fragmenty z poprawkami wprowadzonymi przez SciSlopHarness. Nieuzasadnione dodatki są odrzucane, podczas gdy roszczenia są przestawiane lub przepisywane w razie potrzeby, aby lepiej odzwierciedlały dostępne w artykule dowody.
Benchmark SciSlopBench został zbudowany na podstawie 390 artykułów generowanych przez SI, z których każdy sparowany został z artykułem napisanym przez człowieka, dotyczącego podobnego problemu badawczego i typu wkładu.
W testach SciSlopBench został użyty do odróżnienia 390 par artykułów, przy czym każda para składała się z wymienionego wyżej artykułu generowanego przez SI oraz artykułu napisanego przez człowieka dopasowanego pod względem problemu badawczego i typu wkładu. Benchmark poprawnie zidentyfikował artykuł generowany przez SI w 85,9 % tych porównań, znacznie przewyższając tradycyjne detektory tekstu SI.
Autorzy stwierdzają:
‘Podczas gdy standardowe poprawki pozostawiają resztkowy slop i bezpośrednie wywołania uwzględniające slop prowokują manipulację nagrodą, SciSlopHarness zmniejsza pozostałą lukę AI‑człowiek o 63 % w stosunku do najsilniejszej bazy poprawek, nie wymagając ludzkich odniesień referencyjnych.
‘Ogólnie wykazujemy, że artykuły naukowe generowane przez SI pozostawiają fundamentalne ślady w ich globalnym rozumowaniu, a odpowiedzialne łagodzenie wymaga ścisłego oparcia na dowodach, a nie jedynie na udoskonalaniu prozy.’
Oprócz wkładu samego artykułu, autorzy zrealizowali zasady swojej nowej pracy w formie demo na żywo, w którym użytkownicy mogą przesyłać artykuły naukowe do analizy ilości slopu SI, jaki zawierają.
Co ciekawe, sam nowy artykuł, przeanalizowany w demo, uzyskał ‘umiarkowany’ wynik slopu wynoszący 40/100†:

Nowy artykuł, przeanalizowany własnym algorytmem, oznacza obszary ‘slopu’ wskazane przez nowy proces autorów. Źródło
Metoda i podejście do danych
Współpraca z 2025 roku Dlaczego slop ma znaczenie opisała ‘powierzchowną kompetencję’ jako cechę definiującą slop SI, gdzie pozorna jakość ukrywa brak treści. Nowa praca stosuje tę ideę bardziej konkretnie do artykułów naukowych, definiując ‘slop naukowy’ jako niepowodzenia, które utrudniają śledzenie, jak badanie jest zorganizowane; jak jego twierdzenia są poparte; oraz jak jego metody i dowody mogą być badane, przy czym niepowodzenia są podzielone na strukturę; argumentację; oraz artefakty:

Zasady pomiaru sześciu typów slopu naukowego używanych w benchmarku. Tabela pokazuje, co jest badane dla każdego pomiaru, jak obliczany jest wynik oraz co oznacza maksymalny wynik 1, przy czym wyższe wyniki wskazują na bardziej rozległe niepowodzenia.
Sześć miar slopu naukowego zdefiniowanych w artykule to odwołania między sekcjami (czy sekcje odwołują się znacząco do materiału w innym miejscu artykułu); makro redundancja (czy późniejsze sekcje powtarzają wcześniejszy materiał); graf argumentów (czy roszczenia są właściwie poparte wcześniejszym rozumowaniem); izolacja cytowań (czy cytowania są używane powierzchownie, bez wyjaśnienia, jak cytowane prace odnoszą się do artykułu lub do siebie nawzajem); ekspozycja rysunków (czy rysunki metod rzeczywiście wyjaśniają metodę); oraz luka dowodowa (czy zgłoszone wyniki są poparte konkretnymi przykładami).
Benchmark został skonstruowany poprzez sparowanie artykułów generowanych przez SI z porównywalnymi/równoważnymi artykułami napisanymi przez ludzi, przy czym artykuły SI zostały wyselekcjonowane z FARS oraz konkursu 2025 Agents4Science.
Dla każdego automatycznie wygenerowanego artykułu FARS badacze przeszukali jego cytowania w poszukiwaniu artykułu napisanego przez człowieka tego samego typu, który został przyjęty na prestiżowe forum, a następnie wybrali najbliższe dopasowanie pod względem tematu badawczego, uzyskując 143 pary. Artykuły Agents4Science również sparowano z odpowiednikami napisanymi przez ludzi, co dało kolejne 247 par, podnosząc łączną liczbę par AI‑człowiek do 390. Publikacje obejmują nauki przyrodnicze, społeczne i naturalne, choć zestaw danych jest silnie zdominowany przez informatykę.
Do oceny metryk wydajność była mierzona przy użyciu PairAcc, który określa, jak często artykuł ludzki jest klasyfikowany wyżej niż jego odpowiednik AI; oraz AUROC, który mierzy ogólne rozróżnienie między artykułami ludzkimi a AI przy różnych progach. Autorzy podają także wyniki wykrywania przy stałym współczynniku fałszywych alarmów dla artykułów ludzkich równym 5 %.
Testy
Wstępne testy porównały SciSlop z detektorami tekstu AI Binoculars; DetectGPT; oraz NTS††, a także z automatycznymi systemami recenzji AI Scientist Reviewer oraz CycleReviewer.
W późniejszych testach rewizji użyto czterech bazowych metod: base prompting; Claude Code; reviewer-based refinement; oraz slop-aware revision. Pierwsze trzy otrzymały jedynie ogólne instrukcje poprawy artykułu, natomiast slop-aware revision dodatkowo otrzymało definicje i lokalizacje wykrytego slopu. Wszystkie porównano z SciSlopHarness w równoważnych warunkach rewizji.
Do implementacji detektory tekstu otrzymały treść artykułu, natomiast pozostałe metody dostały kod źródłowy artykułu i, w razie potrzeby, dostęp do jego kodu. Binoculars używał Falcon-7B jako modeli bazowych i instrukcyjnych; DetectGPT wykorzystał T5-3B do wygenerowania 100 perturbacji; AI Scientist zastosował Qwen2.5-32B-Instruct; a CycleReviewer użył udostępnionego checkpointu 8 B. W przypadku artykułów przekraczających limit 2 048 tokenów modelu Falcon, niepokrywające się okna były oceniane osobno i uśredniane.
Początkowe wyniki wykrywania przedstawiono w dwóch tabelach poniżej: SciSlop osiągnął 85,9 % PairAcc, w porównaniu do 68,7 % dla Binoculars i 68,5 % dla najskuteczniejszego automatycznego recenzenta, redukując współczynnik błędów o ponad połowę:

Wyniki wykrywania porównujące SciSlop z detektorami tekstu AI i automatycznymi recenzentami, wraz z wynikami dla jego sześciu poszczególnych miar slopu. SciSlop uzyskuje najwyższy łączny PairAcc, podczas gdy odniesienia przekrojowe dają najsilniejszy wynik indywidualny.
Odniesienia przekrojowe wykazały się szczególnie wysoką skutecznością samodzielnie, osiągając 90,5 % PairAcc bez potrzeby użycia modelu oraz wykrywając 65 % artykułów generowanych przez AI przy współczynniku fałszywych alarmów 5 %, w porównaniu do 24 % dla Binoculars.
Autorzy twierdzą, że wyniki te wskazują, iż zależności w całym artykule dostarczają silniejszego sygnału generacji AI niż tradycyjne wykrywanie na poziomie tekstu w tym zestawie danych, jednocześnie identyfikując konkretne słabości, które można później skierować do rewizji.
Następnie zbadano zależność między naukowym slopem a ludzką oceną jakości artykułu. Jak pokazano w pierwszej kolumnie poniżej, wyższy slop wiązał się z niższymi wynikami ICLR w zakresie ogólnej oceny, rzetelności, prezentacji i wkładu:

Porównanie SciSlop z detektorami tekstu AI i automatycznymi recenzentami w odniesieniu do wyników recenzji ICLR. Lewy panel przedstawia podobieństwo do AI w stosunku do ocen recenzji; środkowy porównuje poszczególne wymiary recenzji; prawy pokazuje skuteczność w odróżnianiu odrzuconych od przyjętych artykułów na przestrzeni dziewięciu lat.
Odrzucone i przyjęte artykuły również były odróżniane powyżej poziomu losowego we wszystkich dziewięciu badanych latach, podczas gdy tradycyjne detektory wypadały poniżej poziomu losowego w większości porównań.
Stwierdzono więc, że naukowy slop odzwierciedla słabości już karane przez recenzentów ludzkich, a nie działa wyłącznie jako sygnał autorstwa AI.
Ostatnie testy sprawdziły, czy SciSlopHarness może usunąć slop, który pozostał po bardziej ogólnej rewizji. Jak pokazano poniżej, harness uzyskał wynik najbliższy średniej ludzkiej we wszystkich sześciu miarach, podczas gdy ogólna rewizja często pozostawiała znaczny slop, a bezpośrednia slop-aware revision czasami nadmiernie korygowała:

Wyniki rewizji porównujące SciSlopHarness z czterema metodami bazowymi w sześciu miarach slopu. Wartości bliższe zeru są bliższe średniej papierów ludzkich, przy czym SciSlopHarness zazwyczaj zbliża się do tego poziomu, podczas gdy rewizja uwzględniająca slop często go przekracza.
Każda proponowana zmiana została sprawdzona pod kątem naukowego uzasadnienia artykułu i dowodów wspierających, a nieuzasadnione edycje odrzucono. Wśród sześciu miar, pozostała różnica w stosunku do artykułów napisanych przez ludzi została zmniejszona o 63 % w porównaniu z Claude Code, najsilniejszą bazą rewizji.
Wnioski
Było interesujące, w trakcie pisania tego tekstu, zauważyć nie tylko, jak słabo ten artykuł oceniono na jego własnej stronie demonstracyjnej, ale także dostrzec przynajmniej jeden przykład „leniwej” lub „kosmetycznej” cytacji††, która ostatnio stała się małym, lecz rosnącym przekleństwem w publikacjach naukowych.
W takich przypadkach, poza tym konkretnym artykułem, badacze zdają się korzystać z własnej wiedzy zamiast w znaczący sposób angażować się w istniejącą literaturę. Jednak, ograniczeni konwencją „pokazywania swojej pracy”, cytowania są często podawane z tym, co wydaje się niecierpliwością, a nawet pogardą wobec procesu, i często polegają na czytelniku, który ma zaakceptować natłok odniesień jako wystarczającą „powłokę” pochodzenia, choć nie przetrwałaby ona dokładnej weryfikacji.
Arxiv przeciwstawia się przemysłowej industrializacji zgłoszeń napędzanej przez SI; czy pojawią się podobne ograniczenia dotyczące bezpośredniego udziału SI w badaniach, w przypadku braku odpowiedniej katastrofy, pozostaje do zobaczenia.
* Akcenty autorów, nie moje – ale moje przekształcenie, gdzie to konieczne, cytowań w tekście autorów na hiperłącza.
† Autorzy nie twierdzą, że w swoim artykule nie użyto żadnej SI, i szczegółowo opisują takie użycie.
†† Czytelnik może być zainteresowany faktem, że musiałem samodzielnie poszukać prawidłowego linku do frameworka NTS, ponieważ podany przez autorów link był nieodpowiedni – jedna z kluczowych metryk, na których opiera się SciSlop!
Pierwsze publikacja: niedziela, 4 października 2026












