Andersonův úhel
AI cituje stejné články znovu a znovu – stejně jako lidé

ChatGPT a další nástroje pro psaní AI mohou tiše proměňovat vědu v soutěž o popularitu, opakovaně nasměrovávají výzkumníky k těm samým článkům a přehlížejí nové a originální práce, které by skutečně mohly posunout obor vpřed.
Monokultura, v rámci četnosti a statistik, je stav, kdy se stejná omezená sada zdrojů nebo aktiv opakovaně objevuje, utlačujíc nové hlasy a čerstvé pohledy: stejná omezená sada písní v rozvrhu rozhlasových stanic; stejný soubor autorů a knih v letištních regálech; a stejný omezený výběr ovoce a zeleniny v supermarketech:

Ano, máme tyto banány – a jen tyto banány. Homogenita ovoce a zeleniny v západních potravinových řetězcích ignoruje stovky dalších možných druhů v každém případě, protože různé výrobní a dopravní řetězce jsou příliš drahé na industrializaci rozmanitých typů ovoce či zeleniny. Zdroj
Toto se také objevuje v citacích, které se objevují v nových vědeckých studiích, kde výzkumníci, možná lenivě, defaultně používají „spolehlivou“ sadu zdrojů, která získává hybnost, dokud nezačne dominovat jednotlivým oblastem výzkumu.
Tento jev je známý jako Matthewův efekt – sociologická teorie, která naznačuje, že incumbenti budou vždy profitovat; syndrom byl srovnáván s příslibem v Matoušovi 13:12, kde stojí „Kdo má, bude mít více, a bude mít hojnost. Kdo nemá, i to, co má, mu bude odebráno.“
V davu
Jedním z větších nadějí výzkumu podporovaného AI bylo, že nové metody strojového učení by mohly překonat Matthewův efekt – také známý jako bias popularity – a začít citovat méně známé práce, které by mohly být ostřejší nebo vhodnější k argumentu v článku.
Nicméně na základě toho, jak tréninkové rutiny AI interpretují datové sady, nikdy pro tuto optimistiku neexistoval žádný dobrý důvod; a opakovaně se zjistilo, že když AI nepřímo vymýšlí citace – chronický problém až dosud – skutečně prodloužuje Matthewův efekt, stejně jako lidé – i když možná ne ze stejného důvodu.
Během tréninku se model naučí vysoko hodnotit nejcitovanější (nebo „nejčastěji opakované“) články v tréninkové sadě, protože tréninkové rutiny jsou navrženy tak, aby vyvolávaly smysluplné vzorce, a aby odpočítávaly odlehlé hodnoty jako „šum“ či statistické anomálie.
V tomto režimu by ekvivalent Einsteinovy teorie relativity nikdy nedostal pozornost od stroje, který po natrénování má pocit, že již našel své principy a odkazy, a může jen mírně upravit tento postoj tím, že se obrátí na novější publikace prostřednictvím RAG, nebo jinými způsoby, které rozšiřují dosah modelu mimo jeho natrénovanou matici.
Problém je, že takové nové práce neocení stejným způsobem jako „staré favority“, které již znalo, nebo je vůbec neocení, protože jeho statistické zkreslení je nyní poměrně zakořeněné.
Takže AI ve skutečnosti nepozoruje a neimituje lidské chování, když prodlužuje Matthewův efekt – jen počítá, kolikrát výzkumníci lenivě sáhnou po stejných starých článcích, a podobně je hodnotí vysoko. V tomto ohledu je problém opakování citací spojen s výzvou vybrat skutečně zajímavý vědecký článek z neustále rostoucího sněhového víru publikací AI výzkumu, přičemž nejsilnější práce často má nejmenší signál.
Diagnostika monokultury
Tento problém je řešen v zajímavém novém článku z USA s názvem When AI Writes, Who Gets Cited? Evidence of Citation Monoculture Across Language Models. Nová práce – spolupráce mezi University of Texas at Austin, Stevens Institute of Technology, Washington University at St Louis, Rice University a University of Notre Dame – usiluje o jednoznačné prokázání existence citací monokultury ve strojovém učení, aby její proměnné mohly být v budoucnu přímo řešeny, spolu s problémem samotným.
V testech autoři zjistili, že jedenáct modelů od OpenAI, Google a Anthropic opakovaně upřednostňovalo stejnou malou skupinu článků – i po odstranění zřejmých signálů popularity.
Pro testování bylo 120 skutečných článků zbaveno počtu citací a míst publikace, přičemž jména autorů byla nahrazena a roky vydání náhodně přiděleny. Náhodné sady třiceti článků byly následně předloženy každému modelu, který mohl citovat maximálně deset.
Osm lidských odborníků v příslušných oborech dostalo stejné zaslepené články, ale ne dospělo ke stejným favoritem jako AI, což naznačuje, že zkreslení bylo specifické pro modely AI spíše než pro samotné články:

Z nového článku, výsledky testu porovnávající výběr citací modely AI a lidskými odborníky. U všech jedenácti modelů byly citace soustředěny na menší skupinu článků, zatímco některé články byly opakovaně zcela přehlíženy. Lidské odborníky tato tendence neprojevili. Zdroj
Stejné články zůstaly populární i když byly modely požádány pouze o výběr referencí, což ukazuje, že samotné psaní recenze ne způsobovalo zkreslení.
Experiment byl následně rozšířen na jedenáct kol, přičemž po každém kole bylo přidáno 120 AI‑psaných článků, aby se otestovalo, co se stane, když tyto sdílené preference fungují v rostoucím fondu AI‑generovaného výzkumu.
Jak bylo přidáváno více AI‑psaných článků, modely stále častěji soustředily své citace na ubývající počet původních lidských článků.
‘Jak jazykové modely přecházejí od psaní textu k provozování agentů pro vyhledávání literatury s voláním nástrojů, jsou vytvořené reference snadněji zachytitelné a omezitelné.
‘Závažnější selhání nastává po tom, co je každý kandidát reálný: různé modely mohou i nadále vybírat stejnou úzkou podmnožinu, což vede k citací monokultuře, aniž by byla jakákoli jednotlivá citace špatná.’
Jako prostředek k nápravě problému článek tvrdí, že pouhé míchání modelů od různých poskytovatelů nebo rovnoměrné vystavení článků nebude stačit, protože velká část preference je sdílena mezi modely. Spíše by se musela změnit základní preference pro konkrétní články – možná vědomým zvýšením viditelnosti opomíjených prací. Autoři však zdůrazňují, že tento přístup zatím nebyl otestován.
Testovací přístupy
Benchmark byl vytvořen z 120 skutečných článků o destilaci znalostí, shromážděných z arXivu a publikovaných mezi lety 2015 a 2022. Každý měl v době sběru mezi 50 a 500 citacemi, což bylo zvoleno tak, aby vyloučilo jak málo známé, tak výjimečně vlivné práce.
Experiment začal náhodným výběrem třiceti článků z dostupné sbírky, přičemž jména autorů, roky vydání a počty citací byly skryté. Každý model vytvořil krátkou recenzi nebo pozicový text, který citoval maximálně deset článků, a tyto volby byly porovnány s náhodnými výběry ze stejného materiálu:

Schéma metody použité k testování preferencí citací. Třicet náhodně vybraných článků bylo předloženo modelu s skrytými identifikačními informacemi, po čemž mohl citovat až deset. Jeho volby byly porovnány s náhodným výběrem, zatímco každé kolo přidalo 120 AI‑psaných článků do sbírky dalšího kola.
V rozšířeném experimentu vstoupilo po každém kole do sbírky 120 nově generovaných článků, čímž se postupně zvyšoval podíl AI‑psaného výzkumu.
V předběžném testování modely tendovaly citovat většinu předložených článků, obvykle vybraly 22 až 27 ze 30. Výzkumníci proto stanovili maximální počet citací na deset pro hlavní experiment, aby modely musely učinit výběr selektivnější.
Níže vidíme souhrn výsledného experimentálního designu:

Experimentální nastavení použité k testování preferencí citací. Studie začala 120 skutečnými články a testovala jedenáct modelů od tří poskytovatelů, používajících náhodné sady 30 článků a maximální počet deseti citací. Pozdější kola přidala AI‑generované články, čímž se sbírka rozšířila na 1 440 článků.
Počáteční experiment použil jedenáct modelů od tří hlavních poskytovatelů: OpenAI byl zastoupen GPT-5, GPT-5 mini, GPT-4.1 a GPT-4.1 mini; Google Gemini 2.5 Pro, Gemini 2.5 Flash, Gemini 3.1 Pro a Gemini 3.1 Flash-Lite; a Anthropic Claude Opus 4.8, Claude Sonnet 4.6 a Claude Haiku 4.5.
Ve výsledcích testu uvedených níže vidíme, do jaké míry každý model soustředil své citace na malou skupinu článků; kolik článků zcela ignoroval; a jak konzistentně dělal stejné volby při opakování experimentu:

Výsledky testu ukazující, jak silně každý model soustředil své citace na konkrétní články a kolik článků zcela ignoroval. ‘Podíl top‑10 %’ ukazuje, kolik citací směřovalo k 12 nejpreferovanějším článkům, zatímco ‘HHI’ měří, jak jsou citace celkově koncentrovány. ‘Spolehlivost’ ukazuje, jak konzistentně každý model upřednostňoval stejné články napříč testy, aρ ukazuje, jak podobné byly tyto preference napříč modely. Řádek ‘Matched null’ naznačuje, co by se očekávalo, kdyby byly články vybírány náhodně.
Co modely ve skutečnosti upřednostňují?
Preferenční tendence byla zjištěna jako převážně řízena obsahem samotných článků. Například u GPT-5 mini bylo přibližně 90 % variability v tom, které články byly upřednostňovány, přičemž to bylo způsobeno obsahem, nikoli faktory jako pořadí v seznamu, šum generování nebo vymyšlená metadata připojená ke každému článku. Stejný efekt „dominantního obsahu“ byl reprodukován u GPT-4.1 mini.
Mapa preferencí (viz níže) se také téměř nezměnila, když byly tituly a abstrakty podstatně přepsány při zachování jejich významu. Ve čtyřech úspěšných testech parafrázování byly získány korelace 0,95–0,99, přestože pro přepisování byly použity různé modely od tří poskytovatelů.
Změny v mapě preferencí byly pozorovány pouze tehdy, když byl základní význam měřitelně změněn:

Výsledky testu porovnávající preference citací napříč jedenácti modely. Čísla ukazují, jak úzce každá dvojice modelů upřednostňovala stejné články, přičemž vyšší hodnoty naznačují větší shodu. Navzdory rozdílům mezi modely a poskytovateli byly v celé skupině zjištěny obecně podobné preference.
Modely se tedy zdají reagovat především na sémantický obsah, nikoli na konkrétní formulaci. Důvod jejich silné shody však nebyl jednoznačně určen.
Je možné, jak autoři uvádějí, že během tréninku byl absorbován společný konsensus citací. Alternativní možností je, že podobné úsudky o tom, co představuje „citovatelný“ článek, mohou být dosaženy nezávisle.
Takže existence sdílené preference byla prokázána, ale její konečný původ zůstává neznámý.
Autoři naznačují, že rozšířené používání AI ve výzkumu by mohlo zúžit spektrum prací získávajících pozornost, protože různé modely mají tendenci upřednostňovat mnoho stejných článků; a jak se AI‑generovaná literatura hromadí, mohou být tyto sdílené preference dále posilovány opakovanými citacemi, což činí méně preferovaný výzkum postupně těžší objevit. Diverzita citací a sledování koncentrace citací jsou proto navrhovány jako možné záruky.
Benchmark studie pro rekurzivní koncentraci citací je nyní k dispozici na GitHubu.
Závěr
Názor Jako osoba, která týdně čte neúměrné množství AI výzkumných článků, jsem viděl „vlny citací“, které přicházejí a odcházejí. Jedním z trvalých pilířů je Googleův Attention Is All You Need, originální článek o Transformerech, který je nyní pravděpodobně zakódován v šablonách pro podání.
Dalším opakovaným pachatelem po dlouhou dobu byla nabídka z roku 2014 Generative Adversarial Networks, ačkoliv byla nakonec v četnosti nahrazena Denoising Diffusion Probabilistic Models a dalšími studiemi založenými na difúzích.
Ve většině případů tyto „opakující se“ citace nejsou špatné jako takové; ale často jsou příliš široce zaměřené na to, aby byly užitečnou podporou pro článek, ve kterém jsou citovány; a v tomto smyslu představují něco podobného „čištění citací“ – zahrnutí „spolehlivých“, ale převážně dekorativních zdrojových citací pro vytvoření dojmu důvěryhodnosti s minimálním úsilím.
Poprvé publikováno v pondělí 24. srpna 2026. Opraveno 23:07 EET, aby byl doplněn chybějící množný číslo.












