Andersons Blickwinkel
Bekämpfung von KI‑Müll in wissenschaftlichen Arbeiten

KI erledigt alles im großen Maßstab, von Webscraping auf DOS‑Angriff‑Niveau bis hin zur Erstellung oder Ermöglichung solch enormer Mengen wissenschaftlicher Forschungseinreichungen, sodass das Ergebnis sowohl zu einer logistischen Krise als auch zu einer Qualitätskrise wird, da das Signal‑zu‑Rausch‑Verhältnis weiterhin unüberschaubar wird.
Letzte Woche hat der Preprint‑Server arXiv ankündigte, dass er eine neue Ratenbegrenzungs‑Richtlinie für Einreichende einführen wird, die nun auf zwei Einreichungen pro Monat begrenzt sind. Die Maßnahme wurde, so die Ankündigung, angesichts eines schwindelerregenden Anstiegs der Einreichungsraten über einen kurzen Zeitraum ergriffen:

Monatliche Einreichungen in der cs.AI‑Kategorie von arXiv von Januar 2024 bis September 2026, die über den Zeitraum einen mehr als sechsmaligen Anstieg zeigen. Quelle
Kat Boboris’ Blogbeitrag, der die Maßnahme ankündigte und Kommentare hervorrief bei Hacker News letzten Donnerstag, stellte fest, dass arXiv im September 2026 40,363 Einreichungen erhielt – fast das Doppelte der 20,569 im September 2024 und mehr als das Vierfache der 9,869 im September 2016.
Die Einreichungen des letzten Monats, beobachtete Boboris, erzeugten ebenfalls fast 9,000 Support‑Tickets für das arXiv‑Personal und die Moderatoren:
‘Unsere Moderatoren beobachten einen Anstieg dünner Arbeiten mit engem Umfang sowie „Salami“-Papiere, bei denen ein einzelnes Werk zerpflückt und als Reihe kleinerer Arbeiten eingereicht wird.
‘Es gibt auch einen deutlichen Anstieg dichter, KI‑geschriebener Arbeiten. KI‑Werkzeuge erleichtern es Autoren, arXiv und andere Repositorien mit diesen wenig wertvollen Arbeiten zu überfluten.’
Bereits im Mai dieses Jahres hatte arXiv die Maßnahme ergriffen, ein einjähriges Verbot für ungeprüfte KI‑Inhalte einzuführen; und im Oktober des letzten Jahres hatte es den Einreichenden von Übersichtsarbeiten und Positionspapieren (die beide mit weniger Aufwand als eine vollständige akademische Studie erzeugt werden können) dass sie eine Begutachtung durch Fachkollegen benötigen, um bei arXiv veröffentlicht zu werden.
Im Moment ist die oft hinderliche Begrenzung von HTTP‑Anfragen durch die arXiv‑Domain nicht stark ausgeprägt, und man kann nur hoffen, dass seine sehr nützlichen RSS‑Feeds diesem anhaltenden Rückzug standhalten. Letzte Woche hat Reddit ankündigte die seit langem befürchtete vollständige Abschaltung seiner RSS‑Feeds, die ab Mitte des nächsten Monats erfolgen wird. Allerdings bedeutet der gemeinnützige Status von arXiv, dass nur wenig ähnliches Kapital durch das Lenken von Lesern zu verpflichtenden Seitenbesuchen oder erzwungenen Anmeldungen gewonnen werden kann – zumindest vorerst.
Gegen die steigende Flut
Angesichts solcher schweren und wachsenden Probleme bezüglich der negativen Auswirkungen des KI‑Einsatzes in der wissenschaftlichen Forschung – insbesondere im Hinblick auf KI‑bezogene Forschung, die alle anderen Kategorien überlagert hat und aus der Unbekanntheit zu einem politischen und wirtschaftlichen Signifikanten geworden ist – ist ein Forschungszweig entstanden, der Wege untersucht, dem Qualitätsverfall von KI‑bezogenen Paper‑Einreichungen entgegenzuwirken.
Die jüngste Initiative zur Bewältigung des Problems kommt in Form einer Zusammenarbeit zwischen der Seoul National University in Korea und der University of Minnesota in den USA. Das Paper, mit dem Titel Science or Slop?: Benchmarking and Mitigating Scientific Slop in AI-Generated Papers, schlägt vor, „wissenschaftlichen Slop“ anhand von Fehlfunktionen in den Verbindungen zwischen den Behauptungen, Belegen, Zitaten und der Struktur eines Papers zu messen:

Aus dem neuen Paper, ein Überblick über den Ansatz des Werks zum ‘wissenschaftlichen Slop’, der zeigt, wie Fehlfunktionen in Struktur, Argumentation und unterstützenden Artefakten Schwächen offenbaren können, die herkömmliche KI‑Textdetektoren übersehen. Quelle
Im Gegensatz zu früheren Ansätzen blickt das neue System über den reinen Text hinaus, um zu beurteilen, ob die Behauptungen des Papers angemessen durch Argumente, Belege und Zitate gestützt werden. Die Autoren stellen fest*:
‘Jeder Teil eines Papers kann isoliert plausibel erscheinen, sodass solche Fehlfunktionen für Token‑Level‑Detektoren unsichtbar bleiben und nur auf Ebene des gesamten Papers identifiziert oder behoben werden können. Um wissenschaftlichen Slop zu benchmarken und zu mindern, behandelt dieses Paper drei Herausforderungen.’
‘Erstens erfassen Token‑Level‑Metriken nicht, wie wissenschaftliches Denken über ein Paper hinweg verknüpft ist. Abschnitte, Behauptungen, Zitate, Belege und Artefakte können jeweils plausibel erscheinen, während die Beziehungen zwischen ihnen zusammenbrechen. Wir beobachten wiederholt solche Fehlfunktionen in End‑to‑End‑KI‑generierten Papers, und ICLR‑Gutachter bestrafen sie bereits sogar in von Menschen verfassten Einreichungen.
‘Zweitens bleibt die Erkennung dieser Muster ungemessen. Bestehende Testsets kennzeichnen nur den Text, sodass das Ausmaß, in dem Detektoren, einschließlich LLMs, die das gesamte Papier lesen, diese Muster identifizieren, nie gemessen wurde.
‘Drittens sind diese Muster schwer zuverlässig zu mindern. Während tokenbasierte Signale durch Paraphrasieren entfernt werden können, erfordert die Reparatur dieser Muster die Wiederherstellung der fehlenden Beziehungen, ohne die zugrunde liegende Wissenschaft zu verändern.’
Der neue Benchmark der Autoren, genannt SciSlopBench, wurde in SciSlopHarness implementiert, ein Rahmenwerk, das darauf ausgelegt ist, Fehler im wissenschaftlichen Schließen eines Papers zu erkennen und zu beheben, während die zugrunde liegenden wissenschaftlichen Belege erhalten bleiben:

Beispiele, die fehlerhafte Passagen mit von SciSlopHarness vorgenommenen Überarbeitungen vergleichen. Nicht unterstützte Ergänzungen werden verworfen, während Behauptungen bei Bedarf neu geordnet oder umformuliert werden, um die im Paper verfügbaren Belege besser widerzuspiegeln.
Der SciSlopBench-Benchmark selbst wurde aus 390 KI-generierten Papers erstellt, von denen jedes mit einem von Menschen verfassten Paper zu einem ähnlichen Forschungsproblem und Beitragstyp gepaart wurde.
In Tests wurde SciSlopBench eingesetzt, um zwischen 390 Paper-Paaren zu unterscheiden, wobei jedes Paar aus dem genannten KI-generierten Paper und einem von Menschen verfassten Paper bestand, das hinsichtlich Forschungsproblem und Beitragstyp abgestimmt war. Der Benchmark identifizierte das KI-generierte Paper in 85,9 % dieser Vergleiche korrekt und übertraf konventionelle KI-Textdetektoren deutlich.
Die Autoren erklären:
‘Während Standardüberarbeitungen Restslop hinterlassen und direkte, slop‑bewusste Prompting‑Trigger Reward‑Hacking auslösen, reduziert SciSlopHarness die verbleibende KI‑Mensch-Lücke um 63 % gegenüber der stärksten Überarbeitungsbasis, ohne menschliche Referenzziele zu benötigen.
‘Insgesamt zeigen wir, dass KI‑generierte wissenschaftliche Papers grundlegende Spuren in ihrem globalen Schließen hinterlassen und dass verantwortungsvolle Minderung eine strenge evidenzbasierte Fundierung erfordert, nicht nur eine bloße Textverfeinerung.’
Zusätzlich zu den Beiträgen des Papers selbst haben die Autoren die Prinzipien ihrer neuen Arbeit in Form einer Live‑Demo operationalisiert, in der Nutzer wissenschaftliche Papers einreichen können, um den Anteil an KI‑Slop zu analysieren, den sie enthalten.
Interessanterweise erzielt das neue Papier selbst, das von der Demo analysiert wurde, eine „moderate“ Slop‑Score von 40/100†:

Das neue Paper, analysiert von seinem eigenen Algorithmus, markiert ‘Slop’-Bereiche, die durch den neuen Prozess der Autoren identifiziert wurden. Quelle
Methode und Datenansatz
Die 2025‑Zusammenarbeit Why Slop Matters beschrieb ‘oberflächliche Kompetenz’ als ein definierendes Merkmal von KI‑Slop, bei dem scheinbare Qualität einen Mangel an Substanz verbirgt. Die neue Arbeit wendet diese Idee spezifischer auf wissenschaftliche Papers an und definiert ‘wissenschaftlichen Slop’ als Fehler, die es erschweren, nachzuvollziehen, wie eine Studie strukturiert ist; wie ihre Behauptungen gestützt werden; und wie ihre Methoden und Belege geprüft werden können, wobei die Fehler in Struktur; Argumentation; und Artefakte gruppiert werden:

Messregeln für die sechs Arten von wissenschaftlichem Slop, die im Benchmark verwendet werden. Die Tabelle zeigt, was für jede Messgröße untersucht wird, wie der Score berechnet wird und was der Maximalwert von 1 bedeutet, wobei höhere Werte auf umfangreichere Fehler hinweisen.
Die sechs im Paper definierten Messgrößen für wissenschaftlichen Slop sind Querverweis-Referenzen (ob Abschnitte sinnvoll auf Material an anderer Stelle im Paper verweisen); makro Redundanz (ob spätere Abschnitte früheres Material wiederholen); Argumentationsgraph (ob Behauptungen durch vorherige Argumentation angemessen gestützt werden); Zitationsisolierung (ob Zitate oberflächlich verwendet werden, ohne zu erklären, wie die zitierten Arbeiten zum Paper oder zueinander in Beziehung stehen); Abbildungsdarstellung (ob Methodendarstellungen tatsächlich die Methode erklären); und Beweislücke (ob berichtete Ergebnisse durch konkrete Beispiele gestützt werden).
Der Benchmark wurde erstellt, indem KI‑generierte Papers mit vergleichbaren/äquivalenten von Menschen geschriebenen Papers gepaart wurden, wobei die KI‑Papers aus FARS und dem 2025 Agents4Science-Wettbewerb zusammengestellt wurden.
Für jedes maschinell erzeugte FARS-Papier suchten die Forschenden in dessen Zitaten nach einem von Menschen verfassten Papier desselben Typs, das an einem Top‑Tier‑Verlag angenommen worden war, und wählten dann das thematisch am nächsten liegende Werk aus, wodurch 143 Paare entstanden. Die Agents4Science-Papiere wurden analog mit menschlichen Gegenstücken gepaart, was weitere 247 Paare ergab und den Benchmark auf insgesamt 390 KI‑Mensch‑Paare brachte. Die Arbeiten decken die Lebens‑, Sozial‑ und Naturwissenschaften ab, wobei der Datensatz stark zugunsten der Informatik gewichtet ist.
Für die Metriken wurde die Leistung mit PairAcc bewertet, das misst, wie häufig das menschliche Papier über seinem KI‑Gegenstück rangiert; und mit AUROC, das die Gesamtabtrennung zwischen menschlichen und KI‑Papieren über verschiedene Schwellen hinweg misst. Die Autoren berichten zudem die Detektionsleistung, wenn die Fehlalarmrate für menschliche Papiere auf 5 % festgelegt wird.
Tests
Erste Tests verglichen SciSlop mit den KI‑Textdetektoren Binoculars; DetectGPT; und NTS†† sowie mit den automatisierten Review‑Systemen AI Scientist Reviewer und CycleReviewer.
Für die späteren Revisionstests wurden vier Baselines verwendet: Basis‑Prompting; Claude Code; reviewer‑basierte Verfeinerung; und slop‑bewusste Revision. Die ersten drei erhielten lediglich allgemeine Anweisungen zur Verbesserung des Papiers, während der slop‑bewussten Revision zusätzlich die Definitionen und Positionen des erkannten Slops übermittelt wurden. Alle wurden unter gleichen Revisionsbedingungen mit SciSlopHarness verglichen.
Für die Implementierung erhielten die Textdetektoren den Fließtext des Papiers, während die anderen Methoden den Quellcode des Papiers und, falls nötig, Zugriff auf dessen Code bekamen. Binoculars nutzte Falcon-7B Basis‑ und Instruktionsmodelle; DetectGPT verwendete T5-3B, um 100 Perturbationen zu erzeugen; AI Scientist nutzte Qwen2.5-32B-Instruct; und CycleReviewer setzte sein veröffentlichtes 8B‑Checkpoint ein. Für Papiere, die das 2.048‑Token‑Limit von Falcon überschreiten, wurden nicht‑überlappende Fenster separat bewertet und gemittelt.
Die anfänglichen Detektionsergebnisse sind in den beiden untenstehenden Tabellen detailliert dargestellt: SciSlop erreichte 85,9 % PairAcc, verglichen mit 68,7 % für Binoculars und 68,5 % für den stärksten automatisierten Reviewer, wodurch die Fehlerrate um mehr als die Hälfte gesenkt wurde:

Detektionsergebnisse im Vergleich von SciSlop mit KI‑Textdetektoren und automatisierten Reviewern sowie Ergebnisse für seine sechs einzelnen Slop‑Maße. SciSlop erzielt das höchste Gesamte‑PairAcc, während Querschnitts‑Referenzen das stärkste Einzelresultat liefern.
Querschnitts‑Referenzen erzielten besonders stark eigenständig, erreichten 90,5 % PairAcc ohne ein Modell zu benötigen und erkannten 65 % der KI‑generierten Papiere bei einer Fehlalarmrate von 5 %, verglichen mit 24 % für Binoculars.
Die Autoren argumentieren, dass diese Ergebnisse zeigen, dass Beziehungen im gesamten Papier ein stärkeres Signal für KI‑Generierung liefern als herkömmliche textbasierte Detektion in diesem Datensatz, während gleichzeitig spezifische Schwächen identifiziert werden, die anschließend gezielt überarbeitet werden könnten.
Die Beziehung zwischen wissenschaftlichem Slop und menschlichen Bewertungen der Papierqualität wurde anschließend untersucht. Wie in der ersten Spalte unten gezeigt, war höherer Slop mit niedrigeren ICLR‑Scores für Gesamtbewertung, Solidität, Präsentation und Beitrag verbunden:

Vergleich von SciSlop mit KI‑Textdetektoren und automatisierten Reviewern hinsichtlich ICLR‑Review‑Ergebnissen. Das linke Panel zeigt KI‑Ähnlichkeit gegenüber Review‑Scores; die Mitte vergleicht einzelne Review‑Dimensionen; das rechte Panel zeigt die Leistung beim Unterscheiden von abgelehnten und angenommenen Papieren über neun Jahre.
Abgelehnte und angenommene Papiere wurden über alle neun untersuchten Jahre hinweg ebenfalls über Zufall hinaus unterschieden, während konventionelle Detektoren in den meisten Vergleichen unter Zufall lagen.
Wissenschaftlicher Slop spiegelte demnach Schwächen wider, die bereits von menschlichen Reviewern bestraft wurden, anstatt ausschließlich als Hinweis auf KI‑Autorschaft zu fungieren.
Die abschließenden Tests untersuchten, ob SciSlopHarness Slop entfernen kann, das nach einer allgemeineren Revision verblieb. Wie unten gezeigt, lag das Harness bei allen sechs Maßen am nächsten am menschlichen Durchschnitt, während allgemeine Revisionen häufig erheblichen Slop zurückließen und die direkte slop‑bewusste Revision manchmal überkorrektierte:

Revisionsergebnisse, die SciSlopHarness mit vier Basisverfahren über die sechs Slop‑Maßnahmen vergleichen. Werte, die näher bei null liegen, nähern sich dem Durchschnitt menschlicher Fachartikel, wobei SciSlopHarness im Allgemeinen zu diesem Niveau tendiert, während slop‑bewusste Revisionen häufig darüber hinausgehen.
Jede vorgeschlagene Änderung wurde anhand der wissenschaftlichen Argumentation und der unterstützenden Evidenz des Artikels geprüft, wobei nicht unterstützte Änderungen abgelehnt wurden. Über die sechs Messgrößen hinweg wurde die verbleibende Lücke zu von Menschen geschriebenen Artikeln im Vergleich zu Claude Code, dem stärksten Revisions‑Benchmark, um 63 % reduziert.
Fazit
Es war interessant, beim Verfassen dieses Artikels nicht nur zu bemerken, wie schlecht dieser Beitrag auf seiner eigenen Demo‑Seite bewertet wurde, sondern auch mindestens ein Beispiel für ein „faules“ oder „kosmetisches“ Zitat†† zu beobachten, das in letzter Zeit zu einem kleinen, aber wachsenden Fluch in Forschungsarbeiten geworden ist.
In solchen Fällen, über diesen speziellen Artikel hinaus, scheinen Forschende ihr eigenes Wissen zu nutzen, anstatt sich sinnvoll mit der bestehenden Literatur auseinanderzusetzen. Doch, durch die Konvention, „ihre Arbeit zu zeigen“, werden Zitate oft mit einer scheinbaren Ungeduld, sogar Verachtung für den Prozess, geliefert und scheinen häufig darauf zu vertrauen, dass der Leser eine Flut von Referenzen als ausreichende „Patina“ der Herkunft akzeptiert, obwohl diese einer intensiven Prüfung nicht standhalten würde.
Arxiv wehrt sich gegen die KI‑gesteuerte Industrialisierung von Einreichungen; ob es ähnliche Beschränkungen für die direkte Einbindung von KI in die Forschung geben wird, sofern kein entsprechendes, ausreichend großes Unglück eintritt, bleibt abzuwarten.
* Die Schwerpunkte der Autoren, nicht meine – aber meine Umwandlung, wo nötig, der Inline‑Zitate der Autoren in Hyperlinks.
† Die Autoren behaupten nicht, dass in ihrem eigenen Papier keinerlei KI‑Einsatz stattgefunden hat, und erläutern einen solchen Einsatz.
†† Es könnte den Leser interessieren zu wissen, dass ich selbst einen korrekten Link für das NTS‑Framework finden musste, weil der von den Autoren bereitgestellte Link nicht relevant war – eines der genauesten Messkriterien, auf das SciSlop abzielt!
Erstmals veröffentlicht Sonntag, 4. Oktober 2026












