Andersons Blickwinkel
KI zitiert immer wieder dieselben Arbeiten – genau wie Menschen

ChatGPT und andere KI‑Schreibwerkzeuge könnten stillschweigend die Wissenschaft in einen Beliebtheitswettbewerb verwandeln, indem sie Forschende immer wieder zu denselben Arbeiten lenken und dabei neue, innovative Beiträge übersehen, die das Feld tatsächlich voranbringen könnten.
Monokultur, im Hinblick auf Häufigkeit und Statistik, bedeutet, dass dieselbe begrenzte Menge an Quellen oder Ressourcen immer wieder auftaucht und neuartige Stimmen sowie frische Perspektiven erstickt: dieselbe begrenzte Auswahl an Liedern in der Radioplanung; dieselbe große Gruppe von Autoren und Büchern in Flughafenregalen; und dieselbe eingeschränkte Auswahl an Obst und Gemüse in Supermärkten:

Ja, wir haben diese Bananen – und nur diese Bananen. Die Homogenität von Obst und Gemüse in westlichen Lebensmittelketten ignoriert die hunderten anderen Artenmöglichkeiten in jedem Fall, weil die verschiedenen Erzeugungs‑ und Transportketten zu teuer sind, um für diverse Obst‑ oder Gemüsesorten industrialisiert zu werden. Quelle
Dies geschieht auch bei den Zitaten, die in neuer wissenschaftlicher Forschung auftauchen, wobei Forschende, vielleicht aus Bequemlichkeit, standardmäßig auf einen ‚zuverlässigen‘ Quellensatz zurückgreifen, der an Schwung gewinnt, bis er beginnt, Forschungszweige zu dominieren.
Dies ist als der Matthew‑Effekt bekannt – eine soziologische Theorie, die besagt, dass Incumbents werden immer profitieren; das Syndrom wurde mit dem Versprechen aus Matthäus 13:12 verglichen, das lautet „Wer hat, dem wird mehr gegeben, und er wird im Überfluss haben. Wer nicht hat, dem wird sogar das, was er hat, genommen werden“.
Die Insider
Einer der großen Hoffnungen der KI‑unterstützten Forschung war, dass neue Methoden des maschinellen Lernens den Matthew‑Effekt – auch bekannt als Popularitätsbias – und beginnen könnten, weniger bekannte Arbeiten zu zitieren, die möglicherweise pointierter oder besser passend zum Argument eines Artikels sind.
Allerdings gab es basierend auf der Art und Weise, wie KI‑Trainingsroutinen Datensätze interpretieren, nie einen guten Grund für diesen Optimismus; und es wurde wiederholt festgestellt, dass wenn KI nicht Zitate erfindet – ein chronisches Problem bis heute – sie tatsächlich verstärkt den Matthew‑Effekt, genau wie Menschen – wenn auch möglicherweise aus anderen Gründen.
Während des Trainings lernt ein Modell, die am häufigsten zitierten (oder ‚am häufigsten wiederholten‘) Arbeiten in einem Trainingssatz hoch zu gewichten, weil die Trainingsroutinen darauf ausgelegt sind, sinnvolle Muster zu erkennen, und Ausreißer als ‚Rauschen‘ bzw. statistische Anomalien abzuwerten.
Unter diesem Regime würde das Äquivalent zu Einsteins Relativitätstheorie niemals die Aufmerksamkeit der Maschine erhalten, die, einmal trainiert, das Gefühl hat, bereits ihre Prinzipien und Referenzen gefunden zu haben und diesen Standpunkt nur leicht anpassen kann, indem sie über RAG auf neuere Publikationen zugreift oder andere Mittel nutzt, die die Reichweite des Modells über seine trainierte Matrix hinaus erweitern.
Das Problem ist, dass es solche neuen Arbeiten nicht auf dieselbe Weise anerkennt wie die ‚alten Favoriten‘, die es bereits kannte, oder überhaupt nicht, weil seine statistischen Verzerrungen inzwischen stark verankert sind.
Somit beobachtet und imitiert KI nicht wirklich das menschliche Verhalten, wenn sie den Matthew‑Effekt perpetuiert – sie zählt lediglich, wie oft Forschende aus Bequemlichkeit dieselben alten Arbeiten auswählen und diese dann hoch bewerten. In dieser Hinsicht steht das Problem der Zitierrepetition in Zusammenhang mit der Herausforderung, ein wirklich interessantes Wissenschaftspapier auszuwählen aus dem stetig wachsenden Schneesturm an KI‑Forschungs‑publikationen, wobei die stärksten Arbeiten häufig das schwächste Signal aufweisen.
Diagnose von Monokultur
Dieses Problem wird in einem interessanten neuen Artikel aus den USA mit dem Titel When AI Writes, Who Gets Cited? Evidence of Citation Monoculture Across Language Models behandelt. Die neue Arbeit – eine Zusammenarbeit zwischen der University of Texas at Austin, dem Stevens Institute of Technology, der Washington University at St Louis, der Rice University und der University of Notre Dame – versucht, die Existenz einer Zitations‑Monokultur im maschinellen Lernen eindeutig nachzuweisen, sodass ihre Variablen künftig direkt angegangen werden können, zusammen mit dem Problem selbst.
In Tests stellten die Autoren fest, dass elf Modelle von OpenAI, Google und Anthropic wiederholt dieselbe kleine Gruppe von Arbeiten bevorzugten – selbst nachdem offensichtliche Popularitätssignale entfernt worden waren.
Um dies zu testen, wurden 120 echte Arbeiten von Zitierzahlen und Publikationsorten befreit, während Autorennamen ersetzt und Publikationsjahre zufällig neu zugeordnet wurden. Zufällige Sätze von dreißig Arbeiten wurden anschließend jedem Modell gezeigt, das höchstens zehn zitieren durfte.
Acht menschliche Expert*innen in den relevanten Bereichen erhielten dieselben verblindeten Arbeiten, kamen jedoch nicht zu denselben Favoriten wie die KIs, was darauf hindeutet, dass die Verzerrung speziell auf die KI‑Modelle und nicht auf die Arbeiten selbst zurückzuführen ist:

Aus dem neuen Papier: Testergebnisse, die die Zitierentscheidungen von KI‑Modellen und menschlichen Expert*innen vergleichen. Bei allen elf Modellen konzentrierten sich die Zitate auf eine kleinere Gruppe von Arbeiten, während einige Arbeiten vollständig übergangen wurden. Menschliche Expert*innen zeigten keine derartigen Tendenzen. Source – https://arxiv.org/pdf/2608.19230 Quelle
Die gleichen Arbeiten blieben beliebt, selbst wenn die Modelle lediglich aufgefordert wurden, Referenzen auszuwählen, was zeigt, dass das Verfassen der Rezension selbst die Verzerrung nicht verursachte.
Das Experiment wurde anschließend über elf Runden hinweg erweitert, wobei nach jeder Runde 120 KI‑geschriebene Arbeiten hinzugefügt wurden, um zu testen, was geschieht, wenn diese gemeinsamen Präferenzen in einem wachsenden Pool von KI‑generierter Forschung wirken.
Als mehr KI‑geschriebene Arbeiten hinzugefügt wurden, konzentrierten die Modelle ihre Zitate zunehmend auf eine immer kleiner werdende Anzahl der ursprünglichen menschlichen Arbeiten.
‘Wenn Sprachmodelle vom Verfassen von Prosa zu Literatur‑Such‑Agenten mit Werkzeugaufrufen übergehen, werden erfundene Referenzen leichter zu erfassen und zu begrenzen sein.’
‘Der schwierigere Fehler beginnt, sobald jeder Kandidat real ist: verschiedene Modelle können dennoch dieselbe enge Teilmenge auswählen und so eine Zitations‑Monokultur erzeugen, ohne dass irgendeine einzelne Zitation falsch ist.’
Zur Behebung des Problems argumentiert das Papier, dass das bloße Kombinieren von Modellen verschiedener Anbieter oder das gleichmäßige Aussetzen von Arbeiten nicht ausreichen wird, da ein Großteil der Präferenz über Modelle hinweg geteilt wird. Stattdessen müsste die zugrundeliegende Präferenz für bestimmte Arbeiten geändert werden – möglicherweise durch die gezielte stärkere Sichtbarkeit vernachlässigter Arbeiten. Die Autoren betonen jedoch, dass dieser Ansatz bislang nicht getestet wurde.
Testansätze
Der Benchmark wurde aus 120 echten Knowledge‑Distillation‑Arbeiten erstellt, die von arXiv gesammelt und zwischen 2015 und 2022 veröffentlicht wurden. Jede hatte zum Zeitpunkt der Sammlung zwischen 50 und 500 Zitationen, ein Bereich, der gewählt wurde, um sowohl obskure als auch außergewöhnlich einflussreiche Arbeiten auszuschließen.
Das Experiment begann damit, zufällig dreißig Arbeiten aus der verfügbaren Sammlung zu ziehen, wobei Autorennamen, Publikationsjahre und Zitierzahlen verborgen wurden. Jedes Modell erstellte eine kurze Rezension oder Positionsschrift, die höchstens zehn Arbeiten zitierte, und diese Entscheidungen wurden mit zufälligen Auswahlen aus demselben Material verglichen:

Verfahren zur Prüfung von Zitationspräferenzen. Dreißig zufällig ausgewählte Arbeiten wurden einem Modell mit versteckten Identifikationsinformationen gezeigt, woraufhin es bis zu zehn zitieren konnte. Seine Entscheidungen wurden mit einer Zufallsauswahl verglichen, während jede Runde 120 KI‑geschriebene Arbeiten zur Sammlung der nächsten Runde hinzufügte.
Im erweiterten Experiment traten nach jeder Runde 120 neu generierte Arbeiten in die Sammlung ein, wodurch der Anteil KI‑geschriebener Forschung allmählich zunahm.
In Vorversuchen neigten die Modelle dazu, die meisten ihnen gezeigten Arbeiten zu zitieren, typischerweise wählten sie 22 bis 27 von 30 aus. Die Forschenden setzten daher für das Hauptexperiment ein Maximum von zehn Zitaten fest, um die Modelle zu selektiveren Entscheidungen zu zwingen.
Im Folgenden sehen wir eine Zusammenfassung des resultierenden Versuchsaufbaus:

Versuchsaufbau zur Prüfung von Zitationspräferenzen. Die Studie begann mit 120 echten Arbeiten und testete elf Modelle von drei Anbietern, wobei randomisierte Sätze von 30 Arbeiten und ein Maximum von zehn Zitaten verwendet wurden. Spätere Runden fügten KI‑generierte Arbeiten hinzu und erweiterten die Sammlung auf 1.440 Arbeiten.
Das Anfangsexperiment nutzte elf Modelle der drei großen Anbieter: OpenAI war vertreten durch GPT-5, GPT-5 mini, GPT-4.1 und GPT-4.1 mini; Google durch Gemini 2.5 Pro, Gemini 2.5 Flash, Gemini 3.1 Pro und Gemini 3.1 Flash‑Lite; und Anthropic durch Claude Opus 4.8, Claude Sonnet 4.6 und Claude Haiku 4.5.
In den unten gezeigten Testergebnissen sehen wir, wie stark jedes Modell seine Zitate auf eine kleine Gruppe von Arbeiten konzentrierte; wie viele Arbeiten es vollständig ignorierte; und wie konsistent es dieselben Entscheidungen traf, wenn das Experiment wiederholt wurde:

Testergebnisse, die zeigen, wie stark jedes Modell seine Zitate auf bestimmte Arbeiten konzentrierte und wie viele Arbeiten es vollständig ignorierte. Der ‚Top‑10 %‑Anteil‘ zeigt, wie viele Zitate auf die 12 am meisten favorisierten Arbeiten entfielen, während ‚HHI‘ misst, wie konzentriert die Zitate insgesamt waren. ‚Reliability‘ zeigt, wie konsistent jedes Modell dieselben Arbeiten über Tests hinweg favorisierte, und ρ zeigt, wie ähnlich diese Präferenzen über Modelle hinweg waren. Die Zeile ‚Matched null‘ gibt an, was zu erwarten wäre, wenn Arbeiten zufällig gewählt würden.
Wofür favorisieren die Modelle tatsächlich?
Die Präferenz wurde überwältigend durch den Inhalt der Arbeiten selbst bestimmt. Beispielsweise war bei GPT‑5 mini etwa 90 % der Variation, welche Arbeiten bevorzugt wurden, auf den Inhalt zurückzuführen, nicht auf Faktoren wie Listenreihenfolge, Generierungsrauschen oder die erfundenen Metadaten, die jeder Arbeit beigefügt waren. Der gleiche ‚dominante Inhalts‘‑Effekt wurde bei GPT‑4.1 mini reproduziert.
Die Präferenzkarte (siehe unten) änderte sich kaum, wenn Titel und Abstracts wesentlich umgeschrieben wurden, während ihre Bedeutung erhalten blieb. In vier erfolgreichen Paraphrasierungstests wurden Korrelationen von 0,95–0,99 erzielt, obwohl für die Umschreibung Modelle von drei Anbietern verwendet wurden.
Veränderungen der Präferenzkarte wurden nur beobachtet, wenn die zugrundeliegende Bedeutung messbar verändert wurde:

Testergebnisse, die die Zitationspräferenzen über die elf Modelle hinweg vergleichen. Die Zahlen zeigen, wie stark jedes Modellpaar dieselben Arbeiten favorisierte, wobei höhere Werte eine größere Übereinstimmung anzeigen. Trotz Unterschieden zwischen Modellen und Anbietern wurden im gesamten Kollektiv weitgehend ähnliche Präferenzen festgestellt.
Die Modelle scheinen also primär auf semantischen Inhalt und nicht auf bestimmte Formulierungen zu reagieren. Der Grund für ihre starke Übereinstimmung konnte jedoch nicht eindeutig bestimmt werden.
Die Autoren vermuten, dass ein gemeinsamer Zitationskonsens während des Trainings aufgenommen worden sein könnte. Eine alternative Möglichkeit ist, dass ähnliche Einschätzungen darüber, was eine ‚zitierfähige‘ Arbeit ausmacht, unabhängig voneinander getroffen werden.
Daher wurde das Vorhandensein der geteilten Präferenz festgestellt, doch ihr endgültiger Ursprung bleibt unbekannt.
Die Autoren schlagen vor, dass die weit verbreitete Nutzung von KI in der Forschung das Spektrum der beachteten Arbeiten einschränken könnte, weil verschiedene Modelle viele derselben Arbeiten favorisieren; und mit zunehmender Menge KI‑generierter Literatur könnten diese geteilten Präferenzen durch wiederholte Zitation weiter verstärkt werden, sodass weniger favorisierte Forschung zunehmend schwerer zu entdecken ist. Zitationsvielfalt und die Überwachung der Zitationskonzentration werden daher als mögliche Schutzmaßnahmen vorgeschlagen.
Der Benchmark der Studie für rekursive Zitationskonzentration ist jetzt auf GitHub verfügbar.
Fazit
Meinung Als jemand, der wöchentlich eine übermäßige Anzahl von KI‑Forschungsarbeiten liest, habe ich ‘Zitationswellen’ kommen und gehen sehen. Ein beständiger Klassiker ist Googles Attention Is All You Need, das ursprüngliche Transformers‑Paper, das inzwischen wohl fest in Einreichungsvorlagen verankert ist.
Ein weiterer wiederkehrender Verursacher war lange Zeit das 2014 erschienene Generative Adversarial Networks, das jedoch schließlich in seiner Häufigkeit von Denoising Diffusion Probabilistic Models und anderen diffusionsbasierten Leitstudien abgelöst wurde.
In fast allen Fällen sind diese ‚wiederkehrenden‘ Zitationen nicht per se falsch; sie sind jedoch oft zu breit gefasst, um eine nützliche Unterstützung für das Papier zu sein, in dem sie zitiert werden; und in diesem Sinne stellen sie so etwas wie ein ‚Zitations‑Waschen‘ dar – die Einbindung von ‚zuverlässigen‘, aber hauptsächlich dekorativen Quellzitaten, um mit geringem Aufwand den Anschein von Glaubwürdigkeit zu erwecken.
Erstmals veröffentlicht am Montag, 24. August 2026. Ergänzt am 23:07 EET, um fehlende Pluralformen hinzuzufügen.












