Kąt Andersona
AI cytuje te same artykuły w kółko – tak jak ludzie

ChatGPT i inne narzędzia do pisania AI mogą po cichu zamieniać naukę w konkurs popularności, wielokrotnie kierując badaczy do tych samych artykułów, jednocześnie pomijając nowe i nowatorskie prace, które mogłyby rzeczywiście posunąć dziedzinę naprzód.
Monokultura, w kontekście częstotliwości i statystyki, to sytuacja, w której ten sam ograniczony zestaw źródeł lub zasobów powtarza się w kółko, zagłuszając nowe głosy i świeże perspektywy: ten sam ograniczony zestaw piosenek w planowaniu radia; ten sam zbiór autorów i książek w kioskach na lotniskach; oraz ta sama ograniczona oferta owoców i warzyw w supermarketach:

Tak, mamy te banany – i tylko te banany. Jednorodność owoców i warzyw w zachodnich łańcuchach żywnościowych pomija setki innych możliwych gatunków, ponieważ różne łańcuchy produkcji i transportu są zbyt kosztowne, aby je przemysłowo wytwarzać dla różnorodnych rodzajów owoców i warzyw. Źródło
Dzieje się to również w cytowaniach, które pojawiają się w nowych badaniach naukowych, gdzie badacze, być może leniwie, domyślnie sięgają po „wiarygodny” zestaw źródeł, który zyskuje impet, aż zaczyna dominować w gałęziach badań.
To jest znane jako Efekt Mateusza – teoria socjologiczna sugerująca, że incumbenci zawsze będą korzystać; syndrom ten porównywano do obietnicy z Mateusza 13:12, którą stwierdza „Kto ma, temu będzie dane jeszcze więcej, i będzie miał obfitość. Kto nie ma, nawet to, co ma, zostanie mu odebrane”.
Wśród wybranych
Jedną z wielkich nadziei badań wspomaganych AI było to, że nowe metody uczenia maszynowego mogą przełamać efekt Mateusza – znany również jako bias popularności – i zacząć cytować mniej znane prace, które mogą być bardziej trafne lub bardziej adekwatne do argumentu przedstawianego w artykule.
Jednak, biorąc pod uwagę sposób, w jaki procedury treningowe AI interpretują zestawy danych, nigdy nie było uzasadnienia dla tego optymizmu; wielokrotnie stwierdzono, że gdy AI nie tworzy cytowań wprost – przewlekły problem do tej pory – rzeczywiście podtrzymuje efekt Mateusza, tak jak ludzie – choć być może nie z tego samego powodu.
Podczas treningu model nauczy się wysoko oceniać najczęściej cytowane (lub „najczęściej powtarzane”) artykuły w zestawie treningowym, ponieważ procedury treningowe mają na celu wyodrębnić znaczące wzorce i pomijać wartości odstające jako „szum” lub anomalie statystyczne.
W takim reżimie równoważnik teorii względności Einsteina nigdy nie przyciągnąłby uwagi maszyny, która po przeszkoleniu uważa, że już znalazła swoje zasady i odniesienia, i może jedynie lekko dostosować to stanowisko, sięgając po nowsze publikacje poprzez RAG, lub innymi metodami, które rozszerzają zasięg modelu poza jego wytrenowaną macierz.
Problem polega na tym, że nie przyzna takiego uznania nowym pracom w taki sam sposób jak „starym ulubionym”, które już znało, a nawet wcale ich nie uwzględni, ponieważ jego statystyczne uprzedzenia są już mocno zakorzenione.
Tak więc AI nie obserwuje i nie naśladuje rzeczywiście ludzkiego zachowania, gdy podtrzymuje efekt Mateusza – po prostu liczy, ile razy badacze leniwie sięgają po te same stare artykuły i podobnie wysoko je oceniają. W tym kontekście problem powtarzalności cytowań jest powiązany z wyzwaniem wyboru naprawdę interesującego artykułu naukowego spośród nieustannie rosnącej lawiny publikacji AI, ponieważ najsilniejsze prace często mają najsłabszy sygnał.
Diagnozowanie monokultury
Problem ten poruszono w interesującym nowym artykule z USA zatytułowanym When AI Writes, Who Gets Cited? Evidence of Citation Monoculture Across Language Models. Nowe opracowanie – współpraca między University of Texas at Austin, Stevens Institute of Technology, Washington University at St Louis, Rice University i University of Notre Dame – ma na celu jednoznaczne wykazanie istnienia monokultury cytowań w uczeniu maszynowym, aby jej zmienne mogły być potencjalnie bezpośrednio rozwiązane w przyszłości, wraz z samym problemem.
W testach autorzy odkryli, że jedenaście modeli od OpenAI, Google i Anthropic konsekwentnie preferowało tę samą małą grupę artykułów – nawet po usunięciu oczywistych sygnałów popularności.
Aby to przetestować, 120 rzeczywistych artykułów pozbawiono liczby cytowań i miejsc publikacji, zastąpiono nazwiska autorów i losowo przypisano lata publikacji. Losowe zestawy po trzydzieści artykułów przedstawiono każdemu modelowi, który mógł cytować nie więcej niż dziesięć.
Ośmiu ekspertom‑ludziom w odpowiednich dziedzinach przekazano te same ocenzurowane artykuły, ale nie zgodzili się co do tych samych ulubionych jak AI, co wskazuje, że uprzedzenie było specyficzne dla modeli AI, a nie dla samych artykułów:

Z nowego artykułu, wyniki testu porównującego wybory cytowań przez modele AI i ekspertów ludzkich. We wszystkich jedenastu modelach cytowania koncentrowały się na mniejszej grupie artykułów, podczas gdy niektóre artykuły były wielokrotnie całkowicie pomijane. Eksperci ludzcy nie wykazali takiej tendencji. Źródło
Te same artykuły pozostawały popularne, nawet gdy modele proszono jedynie o wybór referencji, co pokazuje, że samo pisanie recenzji nie powodowało uprzedzenie.
Eksperyment został następnie rozszerzony na jedenaście rund, przy czym po każdej rundzie dodawano 120 artykułów napisanych przez AI, aby sprawdzić, co się dzieje, gdy te wspólne preferencje działają w rosnącym zbiorze badań generowanych przez AI.
W miarę dodawania kolejnych artykułów generowanych przez AI, modele coraz bardziej koncentrowały swoje cytowania na malejącej liczbie pierwotnych ludzkich prac.
Autorzy stwierdzają:
‘Gdy modele językowe przechodzą od redagowania tekstu do uruchamiania agentów przeszukujących literaturę przy użyciu wywołań narzędzi, sfałszowane odniesienia stają się łatwiejsze do wykrycia i ograniczenia.
‘Trudniejszy problem pojawia się po tym, jak każdy kandydat jest rzeczywisty: różne modele mogą nadal wybierać tę samą wąską podgrupę, tworząc monokulturę cytowań, bez że jakiekolwiek pojedyncze cytowanie byłoby błędne.’
W celu naprawy problemu, artykuł argumentuje, że samo mieszanie modeli od różnych dostawców lub równomierne eksponowanie artykułów nie wystarczy, ponieważ duża część preferencji jest wspólna dla modeli. Raczej podstawowa preferencja dla konkretnych artykułów musiałaby ulec zmianie – potencjalnie poprzez celowe nadanie pomijanym pracom większej widoczności. Autorzy podkreślają jednak, że takie podejście pozostaje nieprzetestowane.
Podejścia testowe
Benchmark został zbudowany z 120 rzeczywistych artykułów o destylacji wiedzy zebranych z arXiv i opublikowanych w latach 2015–2022. Każdy miał od 50 do 500 cytowań w momencie zbierania, co wybrano, aby wykluczyć zarówno mało znane, jak i wyjątkowo wpływowe prace.
Eksperyment rozpoczęto od losowego wybrania trzydziestu artykułów z dostępnej kolekcji, przy czym ukryto nazwiska autorów, lata publikacji i liczbę cytowań. Każdy model wygenerował krótką recenzję lub opracowanie, cytując nie więcej niż dziesięć artykułów, a te wybory porównano z losowymi wyborami z tego samego materiału:

Schemat metody użytej do testowania preferencji cytowań. Trzydzieści losowo wybranych artykułów przedstawiono modelowi z ukrytymi informacjami identyfikacyjnymi, po czym mógł cytować maksymalnie dziesięć. Jego wybory porównano z losowym wyborem, podczas gdy w każdej rundzie do kolejnej kolekcji dodawano 120 artykułów napisanych przez AI.
W rozszerzonym eksperymencie po każdej rundzie do kolekcji wprowadzano 120 nowo wygenerowanych artykułów, stopniowo zwiększając udział badań generowanych przez AI.
W wstępnych testach modele wykazywały tendencję do cytowania większości przedstawionych im artykułów, zazwyczaj wybierając od 22 do 27 z 30. Badacze dlatego ustalili maksymalny limit dziesięciu cytowań dla głównego eksperymentu, zmuszając modele do bardziej selektywnych wyborów.
Poniżej przedstawiamy podsumowanie uzyskanego projektu eksperymentalnego:

Ustawienie eksperymentalne użyte do testowania preferencji cytowań. Badanie rozpoczęto od 120 rzeczywistych artykułów i przetestowano jedenaście modeli od trzech dostawców, używając losowych zestawów po 30 artykułów i maksymalnie dziesięciu cytowań. Późniejsze rundy dodały artykuły generowane przez AI, zwiększając kolekcję do 1 440 artykułów.
Początkowy eksperyment wykorzystał jedenaście modeli od trzech głównych dostawców: OpenAI reprezentowało GPT-5, GPT-5 mini, GPT-4.1 i GPT-4.1 mini; Google – Gemini 2.5 Pro, Gemini 2.5 Flash, Gemini 3.1 Pro i Gemini 3.1 Flash-Lite; oraz Anthropic – Claude Opus 4.8, Claude Sonnet 4.6 i Claude Haiku 4.5.
W wynikach testów przedstawionych poniżej widzimy, jak bardzo każdy model koncentrował swoje cytowania w małej grupie artykułów; ile artykułów całkowicie pomijał; oraz jak konsekwentnie dokonywał tych samych wyborów przy powtórzeniu eksperymentu:

Wyniki testu pokazujące, jak silnie każdy model koncentrował swoje cytowania na konkretnych artykułach oraz ile artykułów całkowicie pomijał. „Udział Top‑10 %” wskazuje, ile cytowań trafiło do 12 najpreferowanych artykułów, natomiast „HHI” mierzy, jak skoncentrowane były cytowania ogółem. „Niezawodność” pokazuje, jak konsekwentnie każdy model preferował te same artykuły w kolejnych testach, a ρ wskazuje, jak podobne były te preferencje między modelami. Wiersz „Matched null” wskazuje, czego można by oczekiwać, gdyby artykuły wybierano losowo.
Co właściwie preferują modele?
Stwierdzono, że preferencja była w przeważającej mierze napędzana zawartością samych artykułów. Na przykład w przypadku GPT-5 mini około 90 % zmienności w tym, które artykuły były preferowane, wynikało z treści, a nie z czynników takich jak kolejność na liście, szum generacji czy sfałszowane metadane dołączone do każdego artykułu. Ten sam efekt „dominującej treści” odtworzono w GPT-4.1 mini.
Mapa preferencji (patrz poniżej) zmieniła się jedynie nieznacznie, gdy tytuły i streszczenia zostały znacząco przepisane przy zachowaniu ich znaczenia. W czterech udanych testach parafrazy uzyskano korelacje w przedziale 0,95–0,99, pomimo użycia różnych modeli od trzech dostawców do przepisania.
Zmiany w mapie preferencji zaobserwowano wyłącznie wtedy, gdy podstawowe znaczenie zostało zauważalnie zmienione:

Wyniki testu porównujące preferencje cytowań wśród jedenaście modeli. Liczby pokazują, jak blisko każda para modeli preferowała te same artykuły, przy czym wyższe wartości wskazują na większą zgodność. Pomimo różnic między modelami i dostawcami, w grupie stwierdzono ogólnie podobne preferencje.
Modele wydają się więc reagować przede wszystkim na treść semantyczną, a nie na konkretne sformułowania. Jednak przyczyny ich silnej zgodności nie udało się jednoznacznie ustalić.
Autorzy twierdzą, że możliwe jest, iż wspólny konsensus cytowań został przyswojony w trakcie treningu. Alternatywnie, podobne oceny tego, co stanowi „cytowalny” artykuł, mogą być osiągane niezależnie.
W związku z tym ustalono istnienie wspólnej preferencji, ale jej ostateczne pochodzenie pozostaje nieznane.
Autorzy sugerują, że powszechne stosowanie AI w badaniach może ograniczyć zakres prac przyciągających uwagę, ponieważ różne modele mają tendencję do preferowania wielu tych samych artykułów; a wraz ze wzrostem literatury generowanej przez AI, te wspólne preferencje mogą być dodatkowo wzmacniane poprzez powtarzające się cytowania, co utrudnia odkrywanie mniej preferowanych badań. Dlatego proponuje się różnorodność cytowań oraz monitorowanie koncentracji cytowań jako potencjalne środki ochronne.
Benchmark badania dotyczący rekurencyjnej koncentracji cytowań jest teraz dostępny na GitHubie.
Wnioski
Opinia Jako osoba, która cotygodniowo czyta ogromną liczbę artykułów badawczych o AI, widziałem „fale cytowań”, które pojawiają się i znikają. Jednym z niezmiennych filarów jest artykuł Google „Attention Is All You Need”, oryginalny artykuł o Transformerach, który już teraz prawdopodobnie jest zakodowany na stałe w szablonach zgłoszeń.
Innym powtarzającym się przestępstwem, przez długi czas, było wydanie z 2014 roku Generative Adversarial Networks, które ostatecznie zostało przyćmione pod względem częstotliwości przez Denoising Diffusion Probabilistic Models oraz inne badania oparte na dyfuzji.
W prawie wszystkich przypadkach te „powtarzające się” cytowania nie są złe per se; jednak często są zbyt szerokie, aby stanowiły użyteczne wsparcie dla artykułu, w którym są cytowane; w tym sensie przypominają „pranie cytowań” – włączenie „wiarygodnych”, lecz głównie dekoracyjnych cytatów źródłowych, aby nadać pracy pozory wiarygodności przy niewielkim wysiłku.
Po raz pierwszy opublikowano w poniedziałek, 24 sierpnia 2026. Zmieniono 23:07 EET, aby dodać brakującą liczbę mnogą.












