Andersonův úhel

Boje proti AI slopu ve vědeckých článcích

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
Image 'A shelf filled with lots of bottles of liquid' by Evgeniy Smersh. Used under the Unsplash license. Source: https://unsplash.com/photos/a-shelf-filled-with-lots-of-bottles-of-liquid-aWnA944oXLE

AI dělá vše ve velkém měřítku, od webového škrabání na úrovni DDoS útoku po vytváření či umožňování takových obrovských objemů vědeckých podání výzkumu, takže výsledek se stává jak logistickou krizí, tak krizi kvality, protože poměr signál-šum se stále více stává neprocházetelným.

Minulý týden preprintový server arXiv oznámil, že zavádí novou politiku omezení rychlosti pro odesílatele, kteří nyní budou omezeni na dva příspěvky za měsíc. Toto opatření bylo přijato, naznačuje oznámení, tváří v tvář vertiginálnímu nárůstu rychlosti podání během krátkého časového období:

Měsíční podání do kategorie cs.AI na arXivu od ledna 2024 do září 2026, ukazující více než šestinásobný nárůst během tohoto období. Zdroj - https://blog.arxiv.org/2026/10/01/updated-rate-limit-policy/

Měsíční podání do kategorie cs.AI na arXivu od ledna 2024 do září 2026, ukazující více než šestinásobný nárůst během tohoto období. Zdroj

Blogový příspěvek Kat Boboris oznamující tento krok, který vyvolal komentář na Hacker News minulý čtvrtek, uvedl, že arXiv obdržel 40 363 podání v září 2026 – téměř dvojnásobek 20 569 podaných v září 2024 a více než čtyřnásobek 9 869 podaných v září 2016.

Boboris pozoroval, že podání v posledním měsíci také vygenerovaly téměř 9 000 tiketů podpory pro personál a moderátory arXivu:

‘Naši moderátoři pozorují nárůst tenkých článků úzkého rozsahu, stejně jako „salami“ článků, kde je jedna práce rozčleněna a podána jako sada menších článků.

‘Také dochází k výraznému nárůstu hustých, AI-pisaných článků. AI nástroje usnadňují autorům zaplavit arXiv a další repozitáře těmito nízkohodnotnými články.’

Již v květnu tohoto roku arXiv přijal opatření zavedení jednoročního zákazu pro neověřený AI obsah; a v říjnu loňského roku oznámil odesílatelům průzkumných a pozičních článků (které lze vytvořit s menší námahou než plná akademická studie), že budou potřebovat podporu recenzentů, aby mohly být publikovány na arXivu.

V tuto chvíli není časté omezování http požadavků na doméně arXiv příliš patrné a lze jen doufat, že jeho velmi užitečné RSS kanály přežijí tuto probíhající úspornou politiku. Minulý týden Reddit oznámil dlouho obávané úplné zrušení svých RSS kanálů, což nastane od poloviny příštího měsíce. Nicméně neziskový status arXivu znamená, že je zde málo podobného kapitálu, který by šel získat přivedením čtenářů k povinným návštěvám stránek, nebo vynuceným přihlášením – alespoň prozatím.

Proti rostoucí vlně

Tváří v tvář takovým závažným a rostoucím problémům ohledně negativního dopadu využití AI ve vědeckém výzkumu – zejména v souvislosti s výzkumem souvisejícím s AI, který převyšuje všechny ostatní kategorie a z neznáma se stal politickým a ekonomickým signátorem, v poslední době – se objevila větev výzkumu zkoumající způsoby, jak proti úpadku kvality AI‑souvisejících podání článků bojovat.

Nejnovější přístup k řešení problému přichází ve formě spolupráce mezi Korejskou Sejongskou univerzitou (Seoul National University) a University of Minnesota v USA. článek, nazvaný Science or Slop?: Benchmarking and Mitigating Scientific Slop in AI-Generated Papers, navrhuje měřit „vědecký slop“ prostřednictvím selhání v propojeních mezi tvrzeními, důkazy, citacemi a strukturou článku:

Z nového článku přehled přístupu práce k „vědeckému slopu“, ukazující, jak selhání ve struktuře, argumentaci a podpůrných artefaktech mohou odhalit slabiny, které konvenční detektory AI‑textu přehlížejí. Zdroj - https://arxiv.org/pdf/2610.00531

Z nového článku přehled přístupu práce k „vědeckému slopu“, ukazující, jak selhání ve struktuře, argumentaci a podpůrných artefaktech mohou odhalit slabiny, které konvenční detektory AI‑textu přehlížejí. Zdroj

Na rozdíl od předchozích přístupů nový systém hledí za samotný text, aby posoudil, zda jsou tvrzení článku řádně podpořena jeho argumenty, důkazy a citacemi. Autoři uvádějí*:

‘Každá část článku může v izolaci vypadat věrohodně, takže taková selhání jsou neviditelná pro token‑úrovňové detektory a lze je identifikovat či opravit jen na úrovni celého článku. K měření a zmírnění vědeckého slopu tento článek řeší tři výzvy.

‘Nejprve token‑úrovňové metriky nezachycují, jak vědecké uvažování spojuje jednotlivé části článku‘. Sekce, tvrzení, citace, důkazy a artefakty mohou každé vypadat věrohodně, zatímco vztahy mezi nimi selhávají. Opakovaně pozorujeme taková selhání v end‑to‑end AI‑generovaných článcích a recenzenti ICLR je již trestají i v lidsky psaných příspěvcích.

‘Za druhé, detekce těchto vzorů zůstává nevyhodnocena. Stávající testovací sady označují pouze text, takže rozsah, v jakém detektory, včetně LLM, které čtou celý článek, tyto vzory identifikují, nebyl nikdy změřen.

‘Třetí, tyto vzory je obtížné spolehlivě zmírnit. Zatímco signály na úrovni tokenů lze odstranit parafrázováním, oprava těchto vzorů vyžaduje obnovení chybějících vztahů bez změny základní vědy.’

Nový benchmark autorů, nazvaný SciSlopBench, byl začleněn do SciSlopHarness, rámce navrženého k detekci a opravě selhání ve vědeckém uvažování článku, přičemž zachovává základní vědecké důkazy:

Příklady porovnávající chybné úryvky s revizemi provedenými SciSlopHarness. Nepodporované doplňky jsou odmítnuty, zatímco tvrzení jsou přeuspořádána nebo přepsána tam, kde je to potřeba, aby lépe odrážela dostupné důkazy v článku.

Příklady porovnávající chybné úryvky s revizemi provedenými SciSlopHarness. Nepodporované doplňky jsou odmítnuty, zatímco tvrzení jsou přeuspořádána nebo přepsána tam, kde je to potřeba, aby lépe odrážela dostupné důkazy v článku.

Benchmark SciSlopBench byl sám postaven na 390 AI-generovaných článcích, z nichž každý byl spárován s lidsky napsaným článkem řešícím podobný výzkumný problém a typ příspěvku.

V testech byl SciSlopBench použit k rozlišení 390 dvojic článků, přičemž každá dvojice se skládala z výše zmíněného AI-generovaného článku a lidsky napsaného článku spárovaného podle výzkumného problému a typu příspěvku. Benchmark správně identifikoval AI-generovaný článek v 85,9 % těchto srovnání, což výrazně převyšuje konvenční detektory AI‑textu.

Autoři uvádějí:

‘Zatímco standardní revize zanechávají zbytkový slop a přímé výzvy citlivé na slop spouštějí manipulaci s odměnami, SciSlopHarness snižuje zbývající rozdíl AI–human o 63 % oproti nejsilnějšímu reviznímu základu, aniž by vyžadoval lidské referenční cíle.

‘Celkově ukazujeme, že AI‑generované vědecké články zanechávají základní stopy ve svém globálním uvažování a že odpovědná mitigace vyžaduje přísné zakotvení v důkazech spíše než pouhé vylepšování textu.’

Kromě příspěvků samotného článku autoři operacionalizovali principy své nové práce ve formě živé ukázky, kde uživatelé mohou odesílat vědecké články k analýze množství AI slopu, který obsahují.

Zajímavě, samotný nový článek, analyzovaný demem, dosahuje středního skóre slopu 40/100†:

Nový článek, analyzovaný jeho vlastním algoritmem, označuje oblasti 'slopu' identifikované novým procesem autorů. Zdroj: https://yerimoh.github.io/scientific-slop-demo/r/75h2-yvx2-amhd

Nový článek, analyzovaný jeho vlastním algoritmem, označuje oblasti ‘slopu’ novým procesem autorů. Zdroj

Metoda a datový přístup

Spolupráce z roku 2025 Proč je slop důležitý popisovala ‘povrchní kompetenci’ jako definující charakteristiku AI slopu, kde se zdánlivá kvalita skrývá za nedostatkem podstaty. Nová práce aplikuje tento pojem konkrétněji na vědecké články, definujíc ‘vědecký slop’ jako selhání, která ztěžují sledování, jak je studie uspořádána; jak jsou tvrzení podložena; a jak lze zkoumat metody a důkazy, přičemž selhání jsou rozdělena do struktury; argumentu; a artefaktů:

Měřicí pravidla pro šest typů vědeckého slopu používaných v benchmarku. Tabulka ukazuje, co se zkoumá u každého měření, jak je skóre vypočítáno a co představuje maximální hodnota 1, přičemž vyšší skóre naznačuje rozsáhlejší selhání.

Měřicí pravidla pro šest typů vědeckého slopu používaných v benchmarku. Tabulka ukazuje, co se zkoumá u každého měření, jak je skóre vypočítáno a co představuje maximální hodnota 1, přičemž vyšší skóre naznačuje rozsáhlejší selhání.

Šest měřítek vědeckého slopu definovaných v článku jsou odkazy napříč sekcemi (zda sekce smysluplně odkazují na materiál jinde v článku); makro redundance (zda pozdější sekce opakují dřívější materiál); argumentový graf (zda jsou tvrzení řádně podložena předchozím uvažováním); izolace citací (zda jsou citace použity povrchně, aniž by se vysvětlilo, jak se citované práce vztahují k článku nebo k sobě navzájem); expozice obrázků (zda obrázky metod skutečně vysvětlují metodu); a mezera v důkazech (zda jsou nahlášené výsledky podpořeny konkrétními příklady).

Benchmark byl vytvořen spárováním AI-generovaných článků s porovnatelnými/ekvivalentními lidsky psanými články, přičemž AI články byly vybrány z FARS a z 2025 Agents4Science soutěže.

Pro každý strojově generovaný FARS článek výzkumníci prohledali jeho citace a hledali lidsky napsaný článek stejného typu, který byl přijat na špičkovém vědeckém fóru, a poté vybrali nejbližší shodu podle výzkumného tématu, čímž vzniklo 143 párů. Články z Agents4Science byly podobně spárovány s lidskými protějšky, což přidalo dalších 247 párů a benchmark tak dosáhl celkem 390 AI‑lidských párů. Články pokrývají životní, sociální a přírodní vědy, ačkoli datová sada je silně zatížena směrem k informatice.

Pro metriky byla výkonnost hodnocena pomocí PairAcc, která měří, jak často je lidský článek umístěn nad svým AI protějškem; a AUROC, která měří celkové oddělení mezi lidskými a AI články napříč různými prahy. Autoři také uvádějí výkonnost detekce při fixní míře falešně pozitivních u lidských článků 5 %.

Testy

Počáteční testy porovnávaly SciSlop s AI‑textovými detektory Binoculars; DetectGPT; a NTS††, stejně jako s automatizovanými recenzními systémy AI Scientist recenzent a CycleReviewer.

Pro pozdější testy revize byly použity čtyři základní metody: základní výzva; Claude Code; vylepšení založené na recenzentovi; a revize s ohledem na slop. První tři obdržely pouze obecné instrukce ke zlepšení článku, zatímco revize s ohledem na slop dostala navíc definice a umístění detekovaného slopu. Vše bylo porovnáno se SciSlopHarness za stejných podmínek revize.

Pro implementaci byly textové detektory nasazeny na text článku, zatímco ostatní metody dostaly zdrojový kód článku a v případě potřeby i přístup k jeho kódu. Binoculars použil Falcon-7B základní a instrukční modely; DetectGPT použil T5-3B k vygenerování 100 perturbací; AI Scientist použil Qwen2.5-32B-Instruct; a CycleReviewer použil svůj vydaný 8B checkpoint. U článků, které překročily limit 2 048 tokenů u Falconu, byly neprotínající se okna hodnocena samostatně a průměrována.

Počáteční výsledky detekce jsou podrobně uvedeny v následujících dvou tabulkách: SciSlop dosáhl 85,9 % PairAcc, ve srovnání s 68,7 % u Binoculars a 68,5 % u nejsilnějšího automatizovaného recenzenta, čímž snížil chybovost o více než polovinu:

Výsledky detekce porovnávající SciSlop s AI‑textovými detektory a automatizovanými recenzenty, spolu s výsledky pro jeho šest individuálních slop měřítek. SciSlop dosahuje nejvyšší celkové hodnoty PairAcc, zatímco odkazy napříč sekcemi poskytují nejsilnější individuální výsledek.

Výsledky detekce porovnávající SciSlop s AI‑textovými detektory a automatizovanými recenzenty, spolu s výsledky pro jeho šest individuálních slop měřítek. SciSlop dosahuje nejvyšší celkové hodnoty PairAcc, zatímco odkazy napříč sekcemi poskytují nejsilnější individuální výsledek.

Odkazy napříč sekcemi si samy o sobě vedly mimořádně dobře, dosáhly 90,5 % PairAcc bez potřeby modelu a detekovaly 65 % AI‑generovaných článků při 5 % míře falešně pozitivních, ve srovnání s 24 % u Binoculars.

Autoři tvrdí, že tyto výsledky naznačují, že vztahy napříč článkem poskytují silnější signál AI generace než konvenční detekce na úrovni textu v této datové sadě, a zároveň identifikují konkrétní slabiny, které by mohly být následně cíleně opraveny.

Následně byl zkoumán vztah mezi vědeckým slopem a lidským hodnocením kvality článku. Jak ukazuje první sloupec níže, vyšší slop byl spojen s nižšími ICLR skóre v celkovém hodnocení, solidnosti, prezentaci a přínosu:

Srovnání SciSlop s AI‑textovými detektory a automatizovanými recenzenty vůči výsledkům recenzí ICLR. Levý panel ukazuje míru AI‑podobnosti oproti recenzním skóre; střední panel porovnává jednotlivé recenzní dimenze; pravý panel zobrazuje výkonnost při rozlišování odmítnutých a přijatých článků během devíti let.

Srovnání SciSlop s AI‑textovými detektory a automatizovanými recenzenty vůči výsledkům recenzí ICLR. Levý panel ukazuje míru AI‑podobnosti oproti recenzním skóre; střední panel porovnává jednotlivé recenzní dimenze; pravý panel zobrazuje výkonnost při rozlišování odmítnutých a přijatých článků během devíti let.

Odmítnuté i přijaté články byly také rozlišeny nad náhodou ve všech devíti zkoumaných letech, zatímco konvenční detektory v většině srovnání podstatně pod náhodou.

Vědecký slop byl tedy zjištěn jako odraz slabin, které již lidské recenzenti penalizují, místo aby fungoval jen jako signál AI autorství.

Poslední testy zkoumaly, zda SciSlopHarness dokáže odstranit slop, který zůstal po obecnější revizi. Jak je ukázáno níže, harness skončil nejblíže lidskému průměru ve všech šesti měřeních, zatímco obecná revize často zanechala značný slop a přímá revize s ohledem na slop někdy přeúpravy přeháněla:

Výsledky revize porovnávající SciSlopHarness se čtyřmi základními metodami napříč šesti slop měřeními. Hodnoty blíže k nule jsou blíže lidskému průměru článku, přičemž SciSlopHarness se obecně posouvá k této úrovni, zatímco revize s ohledem na slop ji často překračuje.

Výsledky revize porovnávající SciSlopHarness se čtyřmi základními metodami napříč šesti měřítky slopu. Hodnoty blíže k nule jsou blíže průměru lidských článků, přičemž SciSlopHarness se obecně posouvá k této úrovni, zatímco revize se slopem často tuto úroveň překračuje.

Každá navržená změna byla ověřena vůči vědeckému odůvodnění článku a podpůrným důkazům, přičemž nepodložené úpravy byly odmítnuty. Napříč šesti měřítky se zbývající mezera oproti lidským článkům snížila o 63 % ve srovnání s Claude Code, nejsilnějším revizním základem.

Závěr

Bylo zajímavé, během psaní tohoto textu, zaznamenat nejen to, jak špatně tento článek skóroval na své vlastní demo stránce, ale také pozorovat alespoň jeden příklad „líné“ nebo „kosmetické“ citace††, která se v poslední době stala menší, ale rostoucí kletbou ve výzkumných pracích.

V takových případech, mimo tento konkrétní článek, se zdá, že výzkumníci čerpají spíše ze své vlastní znalosti než aby se smysluplně zapojili do existující literatury. Přestože jsou konvencí omezeni na „ukázat svou práci“, citace jsou často dodávány s tím, co působí jako netrpělivost, dokonce pohrdání procesem, a často zjevně spoléhají na čtenáře, aby přijal přemíru odkazů jako dostatečnou „patinu“ původu, ačkoliv by taková patina nepřežila důkladnou kontrolu.

Arxiv se brání proti AI‑poháněné industrializaci podání; zda se objeví podobná omezení přímé účasti AI ve výzkumu, pokud nedojde k nějaké dostatečně velké katastrofě, zatím zůstává nejasné.

 

* Důrazy autorů, ne mé – ale moje konverze autorových inline citací na hypertextové odkazy, kde to bylo nutné.

† Autoři neuvádějí nulové využití AI ve své vlastní práci a podrobně takové využití.

†† Může čtenáře zajímat, že jsem musel sám najít správný odkaz na NTS framework, protože odkaz poskytnutý autory nebyl relevantní – jeden z velmi metrik, na které SciSlop klade důraz!

Poprvé publikováno neděli 4. října 2026

Spisovatel v oblasti strojového učení, odborník na syntézu lidských obrazů. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího sloučení do Brahma.ai společnosti DNEG.
Webová stránka: martinanderson.ai
Kontakt: martin@martinanderson.ai