Kąt Andersona

AI cytuje te same artykuły w kółko – tak jak ludzie

mm
Dodaj Unite.AI do preferowanych źródeł w Google
AI-generated article image (GPT Image 2): an industrial humanoid robot sits with its feet raised, reading Popular Mechanics beside a turntable playing a record and a partially filled metal record rack. A cat sleeps on otherwise empty shelving behind it. A yellow-and-black border reads ‘AI FANTASY INSIDE’ and ‘REALITY OUTSIDE’.

ChatGPT i inne narzędzia do pisania AI mogą po cichu zamieniać naukę w konkurs popularności, wielokrotnie kierując badaczy do tych samych artykułów, jednocześnie pomijając nowe i nowatorskie prace, które mogłyby rzeczywiście posunąć dziedzinę naprzód.

 

Monokultura, w kontekście częstotliwości i statystyki, to sytuacja, w której ten sam ograniczony zestaw źródeł lub zasobów powtarza się w kółko, zagłuszając nowe głosy i świeże perspektywy: ten sam ograniczony zestaw piosenek w planowaniu radia; ten sam zbiór autorów i książek w kioskach na lotniskach; oraz ta sama ograniczona oferta owoców i warzyw w supermarketach:

Yes, we have these bananas, and only these bananas. Source - https://www.thaitissues.com/en/post/a-deep-dive-into-the-grand-naine-banana-the-king-of-the-global-banana-market-and-its-crossroads-f

Tak, mamy te banany – i tylko te banany. Jednorodność owoców i warzyw w zachodnich łańcuchach żywnościowych pomija setki innych możliwych gatunków, ponieważ różne łańcuchy produkcji i transportu są zbyt kosztowne, aby je przemysłowo wytwarzać dla różnorodnych rodzajów owoców i warzyw.  Źródło

Dzieje się to również w cytowaniach, które pojawiają się w nowych badaniach naukowych, gdzie badacze, być może leniwie, domyślnie sięgają po „wiarygodny” zestaw źródeł, który zyskuje impet, aż zaczyna dominować w gałęziach badań.

To jest znane jako Efekt Mateusza – teoria socjologiczna sugerująca, że incumbenci zawsze będą korzystać; syndrom ten porównywano do obietnicy z Mateusza 13:12, którą stwierdza „Kto ma, temu będzie dane jeszcze więcej, i będzie miał obfitość. Kto nie ma, nawet to, co ma, zostanie mu odebrane”.

Wśród wybranych

Jedną z wielkich nadziei badań wspomaganych AI było to, że nowe metody uczenia maszynowego mogą przełamać efekt Mateusza – znany również jako bias popularności – i zacząć cytować mniej znane prace, które mogą być bardziej trafne lub bardziej adekwatne do argumentu przedstawianego w artykule.

Jednak, biorąc pod uwagę sposób, w jaki procedury treningowe AI interpretują zestawy danych, nigdy nie było uzasadnienia dla tego optymizmu; wielokrotnie stwierdzono, że gdy AI nie tworzy cytowań wprost – przewlekły problem do tej pory – rzeczywiście podtrzymuje efekt Mateusza, tak jak ludzie – choć być może nie z tego samego powodu.

Podczas treningu model nauczy się wysoko oceniać najczęściej cytowane (lub „najczęściej powtarzane”) artykuły w zestawie treningowym, ponieważ procedury treningowe mają na celu wyodrębnić znaczące wzorce i pomijać wartości odstające jako „szum” lub anomalie statystyczne.

W takim reżimie równoważnik teorii względności Einsteina nigdy nie przyciągnąłby uwagi maszyny, która po przeszkoleniu uważa, że już znalazła swoje zasady i odniesienia, i może jedynie lekko dostosować to stanowisko, sięgając po nowsze publikacje poprzez RAG, lub innymi metodami, które rozszerzają zasięg modelu poza jego wytrenowaną macierz.

Problem polega na tym, że nie przyzna takiego uznania nowym pracom w taki sam sposób jak „starym ulubionym”, które już znało, a nawet wcale ich nie uwzględni, ponieważ jego statystyczne uprzedzenia są już mocno zakorzenione.

Tak więc AI nie obserwuje i nie naśladuje rzeczywiście ludzkiego zachowania, gdy podtrzymuje efekt Mateusza – po prostu liczy, ile razy badacze leniwie sięgają po te same stare artykuły i podobnie wysoko je oceniają. W tym kontekście problem powtarzalności cytowań jest powiązany z wyzwaniem wyboru naprawdę interesującego artykułu naukowego spośród nieustannie rosnącej lawiny publikacji AI, ponieważ najsilniejsze prace często mają najsłabszy sygnał.

Diagnozowanie monokultury

Problem ten poruszono w interesującym nowym artykule z USA zatytułowanym When AI Writes, Who Gets Cited? Evidence of Citation Monoculture Across Language Models. Nowe opracowanie – współpraca między University of Texas at Austin, Stevens Institute of Technology, Washington University at St Louis, Rice University i University of Notre Dame – ma na celu jednoznaczne wykazanie istnienia monokultury cytowań w uczeniu maszynowym, aby jej zmienne mogły być potencjalnie bezpośrednio rozwiązane w przyszłości, wraz z samym problemem.

W testach autorzy odkryli, że jedenaście modeli od OpenAI, Google i Anthropic konsekwentnie preferowało tę samą małą grupę artykułów – nawet po usunięciu oczywistych sygnałów popularności.

Aby to przetestować, 120 rzeczywistych artykułów pozbawiono liczby cytowań i miejsc publikacji, zastąpiono nazwiska autorów i losowo przypisano lata publikacji. Losowe zestawy po trzydzieści artykułów przedstawiono każdemu modelowi, który mógł cytować nie więcej niż dziesięć.

Ośmiu ekspertom‑ludziom w odpowiednich dziedzinach przekazano te same ocenzurowane artykuły, ale nie zgodzili się co do tych samych ulubionych jak AI, co wskazuje, że uprzedzenie było specyficzne dla modeli AI, a nie dla samych artykułów:

From the new paper, test results comparing citation choices by AI models and human experts. Across all eleven models, citations were concentrated on a smaller group of papers, while some papers were repeatedly passed over entirely. Human experts showed neither tendency. Source - https://arxiv.org/pdf/2608.19230

Z nowego artykułu, wyniki testu porównującego wybory cytowań przez modele AI i ekspertów ludzkich. We wszystkich jedenastu modelach cytowania koncentrowały się na mniejszej grupie artykułów, podczas gdy niektóre artykuły były wielokrotnie całkowicie pomijane. Eksperci ludzcy nie wykazali takiej tendencji. Źródło

Te same artykuły pozostawały popularne, nawet gdy modele proszono jedynie o wybór referencji, co pokazuje, że samo pisanie recenzji nie powodowało uprzedzenie.

Eksperyment został następnie rozszerzony na jedenaście rund, przy czym po każdej rundzie dodawano 120 artykułów napisanych przez AI, aby sprawdzić, co się dzieje, gdy te wspólne preferencje działają w rosnącym zbiorze badań generowanych przez AI.

W miarę dodawania kolejnych artykułów generowanych przez AI, modele coraz bardziej koncentrowały swoje cytowania na malejącej liczbie pierwotnych ludzkich prac.

Autorzy stwierdzają:

‘Gdy modele językowe przechodzą od redagowania tekstu do uruchamiania agentów przeszukujących literaturę przy użyciu wywołań narzędzi, sfałszowane odniesienia stają się łatwiejsze do wykrycia i ograniczenia.

‘Trudniejszy problem pojawia się po tym, jak każdy kandydat jest rzeczywisty: różne modele mogą nadal wybierać tę samą wąską podgrupę, tworząc monokulturę cytowań, bez że jakiekolwiek pojedyncze cytowanie byłoby błędne.’

W celu naprawy problemu, artykuł argumentuje, że samo mieszanie modeli od różnych dostawców lub równomierne eksponowanie artykułów nie wystarczy, ponieważ duża część preferencji jest wspólna dla modeli. Raczej podstawowa preferencja dla konkretnych artykułów musiałaby ulec zmianie – potencjalnie poprzez celowe nadanie pomijanym pracom większej widoczności. Autorzy podkreślają jednak, że takie podejście pozostaje nieprzetestowane.

Podejścia testowe

Benchmark został zbudowany z 120 rzeczywistych artykułów o destylacji wiedzy zebranych z arXiv i opublikowanych w latach 2015–2022. Każdy miał od 50 do 500 cytowań w momencie zbierania, co wybrano, aby wykluczyć zarówno mało znane, jak i wyjątkowo wpływowe prace.

Eksperyment rozpoczęto od losowego wybrania trzydziestu artykułów z dostępnej kolekcji, przy czym ukryto nazwiska autorów, lata publikacji i liczbę cytowań. Każdy model wygenerował krótką recenzję lub opracowanie, cytując nie więcej niż dziesięć artykułów, a te wybory porównano z losowymi wyborami z tego samego materiału:

Method used to test citation preferences. Thirty randomly selected papers were shown to a model with identifying information hidden, after which it could cite up to ten. Its choices were compared with random selection, while each round added 120 AI-written papers to the next round's collection.

Schemat metody użytej do testowania preferencji cytowań. Trzydzieści losowo wybranych artykułów przedstawiono modelowi z ukrytymi informacjami identyfikacyjnymi, po czym mógł cytować maksymalnie dziesięć. Jego wybory porównano z losowym wyborem, podczas gdy w każdej rundzie do kolejnej kolekcji dodawano 120 artykułów napisanych przez AI.

W rozszerzonym eksperymencie po każdej rundzie do kolekcji wprowadzano 120 nowo wygenerowanych artykułów, stopniowo zwiększając udział badań generowanych przez AI.

W wstępnych testach modele wykazywały tendencję do cytowania większości przedstawionych im artykułów, zazwyczaj wybierając od 22 do 27 z 30. Badacze dlatego ustalili maksymalny limit dziesięciu cytowań dla głównego eksperymentu, zmuszając modele do bardziej selektywnych wyborów.

Poniżej przedstawiamy podsumowanie uzyskanego projektu eksperymentalnego:

Experimental setup used to test citation preferences. The study began with 120 real papers and tested eleven models from three vendors, using randomized sets of 30 papers and a maximum of ten citations. Later rounds added AI-generated papers, expanding the collection to 1,440 papers.

Ustawienie eksperymentalne użyte do testowania preferencji cytowań. Badanie rozpoczęto od 120 rzeczywistych artykułów i przetestowano jedenaście modeli od trzech dostawców, używając losowych zestawów po 30 artykułów i maksymalnie dziesięciu cytowań. Późniejsze rundy dodały artykuły generowane przez AI, zwiększając kolekcję do 1 440 artykułów.

Początkowy eksperyment wykorzystał jedenaście modeli od trzech głównych dostawców: OpenAI reprezentowało GPT-5, GPT-5 mini, GPT-4.1 i GPT-4.1 mini; Google – Gemini 2.5 Pro, Gemini 2.5 Flash, Gemini 3.1 Pro i Gemini 3.1 Flash-Lite; oraz Anthropic – Claude Opus 4.8, Claude Sonnet 4.6 i Claude Haiku 4.5.

W wynikach testów przedstawionych poniżej widzimy, jak bardzo każdy model koncentrował swoje cytowania w małej grupie artykułów; ile artykułów całkowicie pomijał; oraz jak konsekwentnie dokonywał tych samych wyborów przy powtórzeniu eksperymentu:

Test results showing how strongly each model concentrated its citations on particular papers and how many papers it ignored entirely. 'Top-10% share' shows how many citations went to the 12 most-favored papers, while 'HHI' measures how concentrated citations were overall. 'Reliability' shows how consistently each model favored the same papers across tests, and ρ shows how similar those preferences were across models. The 'Matched null' row indicates what would be expected if papers were chosen at random.

Wyniki testu pokazujące, jak silnie każdy model koncentrował swoje cytowania na konkretnych artykułach oraz ile artykułów całkowicie pomijał. „Udział Top‑10 %” wskazuje, ile cytowań trafiło do 12 najpreferowanych artykułów, natomiast „HHI” mierzy, jak skoncentrowane były cytowania ogółem. „Niezawodność” pokazuje, jak konsekwentnie każdy model preferował te same artykuły w kolejnych testach, a ρ wskazuje, jak podobne były te preferencje między modelami. Wiersz „Matched null” wskazuje, czego można by oczekiwać, gdyby artykuły wybierano losowo.

Co właściwie preferują modele?

Stwierdzono, że preferencja była w przeważającej mierze napędzana zawartością samych artykułów. Na przykład w przypadku GPT-5 mini około 90 % zmienności w tym, które artykuły były preferowane, wynikało z treści, a nie z czynników takich jak kolejność na liście, szum generacji czy sfałszowane metadane dołączone do każdego artykułu. Ten sam efekt „dominującej treści” odtworzono w GPT-4.1 mini.

Mapa preferencji (patrz poniżej) zmieniła się jedynie nieznacznie, gdy tytuły i streszczenia zostały znacząco przepisane przy zachowaniu ich znaczenia. W czterech udanych testach parafrazy uzyskano korelacje w przedziale 0,95–0,99, pomimo użycia różnych modeli od trzech dostawców do przepisania.

Zmiany w mapie preferencji zaobserwowano wyłącznie wtedy, gdy podstawowe znaczenie zostało zauważalnie zmienione:

Test results comparing citation preferences across the eleven models. The numbers show how closely each pair of models favored the same papers, with higher values indicating greater agreement. Despite differences between models and vendors, broadly similar preferences were found across the group

Wyniki testu porównujące preferencje cytowań wśród jedenaście modeli. Liczby pokazują, jak blisko każda para modeli preferowała te same artykuły, przy czym wyższe wartości wskazują na większą zgodność. Pomimo różnic między modelami i dostawcami, w grupie stwierdzono ogólnie podobne preferencje.

Modele wydają się więc reagować przede wszystkim na treść semantyczną, a nie na konkretne sformułowania. Jednak przyczyny ich silnej zgodności nie udało się jednoznacznie ustalić.

Autorzy twierdzą, że możliwe jest, iż wspólny konsensus cytowań został przyswojony w trakcie treningu. Alternatywnie, podobne oceny tego, co stanowi „cytowalny” artykuł, mogą być osiągane niezależnie.

W związku z tym ustalono istnienie wspólnej preferencji, ale jej ostateczne pochodzenie pozostaje nieznane.

Autorzy sugerują, że powszechne stosowanie AI w badaniach może ograniczyć zakres prac przyciągających uwagę, ponieważ różne modele mają tendencję do preferowania wielu tych samych artykułów; a wraz ze wzrostem literatury generowanej przez AI, te wspólne preferencje mogą być dodatkowo wzmacniane poprzez powtarzające się cytowania, co utrudnia odkrywanie mniej preferowanych badań. Dlatego proponuje się różnorodność cytowań oraz monitorowanie koncentracji cytowań jako potencjalne środki ochronne.

Benchmark badania dotyczący rekurencyjnej koncentracji cytowań jest teraz dostępny na GitHubie.

Wnioski

Opinia Jako osoba, która cotygodniowo czyta ogromną liczbę artykułów badawczych o AI, widziałem „fale cytowań”, które pojawiają się i znikają. Jednym z niezmiennych filarów jest artykuł Google „Attention Is All You Need”, oryginalny artykuł o Transformerach, który już teraz prawdopodobnie jest zakodowany na stałe w szablonach zgłoszeń.

Innym powtarzającym się przestępstwem, przez długi czas, było wydanie z 2014 roku Generative Adversarial Networks, które ostatecznie zostało przyćmione pod względem częstotliwości przez Denoising Diffusion Probabilistic Models oraz inne badania oparte na dyfuzji.

W prawie wszystkich przypadkach te „powtarzające się” cytowania nie są złe per se; jednak często są zbyt szerokie, aby stanowiły użyteczne wsparcie dla artykułu, w którym są cytowane; w tym sensie przypominają „pranie cytowań” – włączenie „wiarygodnych”, lecz głównie dekoracyjnych cytatów źródłowych, aby nadać pracy pozory wiarygodności przy niewielkim wysiłku.

 

Po raz pierwszy opublikowano w poniedziałek, 24 sierpnia 2026. Zmieniono 23:07 EET, aby dodać brakującą liczbę mnogą.

Pisarz zajmujący się uczeniem maszynowym, specjalista w dziedzinie syntezy ludzkich obrazów. Były szef ds. treści badawczych w Metaphysic.ai, aż do jej rozwiązania w Brahma.ai firmy DNEG.
Strona internetowa: martinanderson.ai
Kontakt: martin@martinanderson.ai