Unghiul lui Anderson
AI citează aceleași lucrări în mod repetat – Exact ca oamenii

ChatGPT și alte instrumente de scriere AI ar putea transforma în tăcere știința într-un concurs de popularitate, direcționând în mod repetat cercetătorii spre aceleași lucrări, în timp ce ignoră lucrări noi și inovatoare care ar putea cu adevărat să avanseze domeniul.
Monocultura, în termeni de frecvență și statistici, reprezintă situația în care același set limitat de surse sau resurse reapare în mod repetat, cufundând vocile noi și perspectivele proaspete: același set limitat de melodii în programarea radioului; același grup de autori și cărți în rafturile aeroporturilor; și aceeași selecție restrânsă de fructe și legume în supermarketuri:

Da, avem aceste banane – și numai aceste banane. Omogenitatea fructelor și legumelor în lanțurile alimentare occidentale ignoră sute de alte specii posibile în fiecare caz, deoarece lanțurile de producție și transport sunt prea costisitoare pentru a fi industrializate pentru tipuri diverse de fructe sau legume. Sursă
Acest fenomen apare și în citările care apar în noile cercetări științifice, unde cercetătorii, poate din lene, recurg la un set „fiabil” de surse care capătă avânt până încep să domine ramurile de cercetare.
Acest fenomen este cunoscut sub denumirea de Efectul Matthew – o teorie sociologică care sugerează că cei deja stabiliți vor beneficia întotdeauna; sindromul a fost comparat cu promisiunea din Matei 13:12, care spune „Cui are, i se va da mai mult și va avea belșug. Cui nu are, chiar și ceea ce are i se va lua”.
Cei din grup
Una dintre marile speranțe ale cercetării augmentate de AI a fost că noile metode de învățare automată ar putea depăși Efectul Matthew – cunoscut și sub denumirea de bias de popularitate – și ar începe să citeze lucrări mai puțin cunoscute, care ar putea fi mai incisive sau mai potrivite pentru ideea exprimată într-un articol.
Totuși, pe baza modului în care rutinele de antrenament ale AI interpretează seturile de date, nu a existat niciodată un motiv solid pentru acest optimism; și s-a constatat în mod repetat că, atunci când AI nu inventează citări în mod deschis – o problemă cronică până în prezent – ea perpetuează, de fapt, Efectul Matthew, la fel ca oamenii – deși poate nu din același motiv.
În timpul antrenamentului, un model învață să acorde un rang înalt lucrărilor cele mai citate (sau „cele mai frecvent repetate”) dintr-un set de antrenament, deoarece rutinele de antrenament sunt concepute să evidențieze modele semnificative și să elimine valorile aberante ca „zgomot” sau anomalii statistice.
În acest regim, echivalentul teoriei relativității a lui Einstein nu ar primi niciodată atenție din partea mașinii, care, odată antrenată, consideră că și-a găsit deja principiile și referințele și poate ajusta doar ușor această perspectivă accesând publicații mai noi prin RAG sau prin alte mijloace care extind raza de acțiune a modelului dincolo de matricea sa antrenată.
Problema este că nu va recunoaște astfel de lucrări noi în același mod ca „favoritele” vechi pe care le cunoștea deja, sau deloc, deoarece părtinirile statistice sunt acum profund înrădăcinate.
Astfel, AI nu observă și imită cu adevărat comportamentul uman atunci când perpetuează Efectul Matthew – pur și simplu numără de câte ori cercetătorii, din lene, recurg la aceleași lucrări vechi și le acordă un rang înalt. În acest sens, problema repetării citărilor este legată de provocarea de a alege un articol științific cu adevărat interesant din avalanșa tot mai mare de publicații AI, deoarece lucrările cele mai solide vor avea adesea cel mai slab semnal.
Diagnosticarea monoculturii
Această problemă este abordată într-un articol nou și interesant din SUA, intitulat „When AI Writes, Who Gets Cited? Evidence of Citation Monoculture Across Language Models”. Lucrarea nouă – o colaborare între Universitatea Texas din Austin, Institutul Stevens de Tehnologie, Universitatea Washington din St. Louis, Universitatea Rice și Universitatea Notre Dame – urmărește să demonstreze în mod definitiv existența monoculturii citărilor în învățarea automată, astfel încât variabilele sale să poată fi abordate direct în viitor, împreună cu problema în sine.
În teste, autorii au constatat că unsprezece modele de la OpenAI, Google și Anthropic favorizau în mod repetat același grup restrâns de lucrări – chiar și după ce semnalele evidente de popularitate au fost eliminate.
Pentru a testa acest lucru, 120 de lucrări reale au fost dezlipite de numărul de citări și de locurile de publicare, în timp ce numele autorilor au fost înlocuite, iar anii de publicare reasignați aleatoriu. Seturi aleatorii de treizeci de lucrări au fost apoi prezentate fiecărui model, căruia i s-a permis să citeze nu mai mult de zece.
Opt experți umani din domeniile relevante au primit aceleași lucrări anonimizate, dar nu au convergit asupra acelorași favorite ca AI‑urile, semnalând că părtinirea era specifică modelelor AI, nu lucrărilor în sine:

Din noul articol, rezultate ale testelor comparând alegerile de citare ale modelelor AI și ale experților umani. În toate cele unsprezece modele, citările s-au concentrat pe un grup mai mic de lucrări, în timp ce unele lucrări au fost trecute complet cu vederea în mod repetat. Experții umani nu au prezentat niciuna dintre tendințe. Sursă
Aceleași lucrări au rămas populare chiar și atunci când modelele au fost solicitate să aleagă doar referințe, arătând că redactarea recenziei în sine nu a cauzat părtinirea.
Experimentul a fost apoi extins pe unsprezece runde, cu 120 de lucrări scrise de AI adăugate după fiecare rundă, pentru a testa ce se întâmplă când aceste preferințe comune operează într-un bazin în creștere de cercetări generate de AI.
Pe măsură ce au fost adăugate tot mai multe lucrări scrise de AI, modelele și-au concentrat din ce în ce mai mult citările pe un număr tot mai mic de lucrări umane originale.
„Pe măsură ce modelele lingvistice trec de la redactarea de texte la rularea de agenți de căutare în literatură cu apeluri de instrumente, referințele fabricate devin mai ușor de detectat și de limitat.”
„Eșecul mai grav începe după ce fiecare candidat este real: diferite modele pot totuși să selecteze același subset restrâns, producând o monocultură a citărilor fără ca vreo citare individuală să fie greșită.”
Ca remediere a problemei, articolul susține că simpla combinare a modelelor de la furnizori diferiți sau acordarea unei expuneri egale lucrărilor nu va fi suficientă, deoarece o mare parte a preferinței este comună între modele. În schimb, preferința de bază pentru anumite lucrări ar trebui să se schimbe – posibil prin acordarea deliberată unei vizibilități mai mari lucrărilor neglijate. Totuși, autorii subliniază că această abordare rămâne netestată.
Abordări de testare
Benchmark-ul a fost construit din 120 de lucrări reale de distilare a cunoștințelor colectate de pe arXiv și publicate între 2015 și 2022. Fiecare avea între 50 și 500 de citări în momentul colectării, un interval ales pentru a exclude atât lucrări obscure, cât și lucrări extrem de influente.
Experimentul a început prin selectarea aleatorie a treizeci de lucrări din colecția disponibilă, cu numele autorilor, anii de publicare și numărul de citări ascunse. Fiecare model a produs o recenzie scurtă sau un articol de poziție citând nu mai mult de zece lucrări, iar aceste alegeri au fost comparate cu selecții aleatorii din același material:

Schema pentru metoda utilizată în testarea preferințelor de citare. Treizeci de lucrări selectate aleatoriu au fost prezentate unui model cu informațiile de identificare ascunse, după care a putut cita până la zece. Alegerile sale au fost comparate cu selecția aleatorie, în timp ce fiecare rundă a adăugat 120 de lucrări scrise de AI la colecția rundei următoare.
În experimentul extins, 120 de lucrări nou generate au intrat în colecție după fiecare rundă, crescând treptat proporția cercetărilor scrise de AI.
În testele preliminare, modelele tindeau să citeze majoritatea lucrărilor prezentate, selectând de obicei între 22 și 27 din cele 30. Cercetătorii au stabilit astfel un maxim de zece citări pentru experimentul principal, obligând modelele să facă alegeri mai selective.
Mai jos vedem un rezumat al designului experimental rezultat:

Configurarea experimentală utilizată pentru a testa preferințele de citare. Studiul a început cu 120 de lucrări reale și a testat unsprezece modele de la trei furnizori, utilizând seturi aleatorii de 30 de lucrări și un maxim de zece citări. Rondele ulterioare au adăugat lucrări generate de AI, extinzând colecția la 1.440 de lucrări.
Experimentul inițial a folosit unsprezece modele de la cei trei furnizori principali: OpenAI a fost reprezentat de GPT-5, GPT-5 mini, GPT-4.1 și GPT-4.1 mini; Google de Gemini 2.5 Pro, Gemini 2.5 Flash, Gemini 3.1 Pro și Gemini 3.1 Flash-Lite; și Anthropic de Claude Opus 4.8, Claude Sonnet 4.6 și Claude Haiku 4.5.
În rezultatele testului prezentate mai jos, observăm cât de mult fiecare model și-a concentrat citările pe un grup restrâns de lucrări; câte lucrări a ignorat complet; și cât de consecvent a făcut aceleași alegeri când experimentul a fost repetat:

Rezultatele testului care arată cât de puternic fiecare model și-a concentrat citările pe anumite lucrări și câte lucrări a ignorat complet. „Top-10% share” arată câte citări au mers la cele 12 lucrări cele mai favorizate, în timp ce „HHI” măsoară cât de concentrate au fost citările în ansamblu. „Reliability” arată cât de consecvent fiecare model a favorizat aceleași lucrări în diferite teste, iar ρ arată cât de similare au fost acele preferințe între modele. Rândul „Matched null” indică ce s-ar aștepta dacă lucrările ar fi alese aleatoriu.
Ce favorizează cu adevărat modelele?
Preferința s-a dovedit a fi dominată în mare măsură de conținutul propriu al lucrărilor. De exemplu, pentru GPT-5 mini, aproximativ 90% din variația lucrărilor favorizate se datora conținutului, mai degrabă decât unor factori precum ordinea în listă, zgomotul de generare sau metadatele fabricate atașate fiecărei lucrări. Același efect de „conținut dominant” a fost reprodus cu GPT-4.1 mini.
Harta preferințelor (vezi mai jos) a rămas practic neschimbată când titlurile și rezumatele au fost rescrise substanțial, menținându-și sensul. În cele patru teste de parafrazare reușite, s-au obținut corelații de 0,95–0,99, în ciuda utilizării de modele diferite de la trei furnizori pentru rescriere.
Modificări ale hărții preferințelor au fost observate doar atunci când sensul de bază a fost modificat în mod semnificativ:

Rezultatele testului care compară preferințele de citare între cele unsprezece modele. Valorile arată cât de apropiat fiecare pereche de modele a favorizat aceleași lucrări, valorile mai mari indicând un acord mai mare. În ciuda diferențelor dintre modele și furnizori, s-au constatat preferințe în general similare în grup.
Prin urmare, modelele par să răspundă în principal la conținutul semantic, mai degrabă decât la formularea exactă. Totuși, motivul acordului lor puternic nu a putut fi determinat în mod concludent.
Este posibil, susțin autorii, ca un consens comun de citare să fi fost absorbit în timpul antrenamentului. O altă posibilitate este ca judecăți similare privind ce constituie o lucrare „citabilă” să fie ajunse independent.
Prin urmare, existența preferinței comune a fost demonstrată, dar originea sa finală rămâne necunoscută.
Autorii sugerează că utilizarea pe scară largă a AI în cercetare ar putea restrânge gama de lucrări care primesc atenție, deoarece diferite modele tind să favorizeze multe dintre aceleași lucrări; și pe măsură ce literatura generată de AI se acumulează, aceste preferințe comune pot fi consolidate prin citări repetate, făcând cercetarea mai puțin favorizată din ce în ce mai greu de descoperit. Diversitatea citărilor și monitorizarea concentrării citărilor sunt, prin urmare, propuse ca posibile măsuri de siguranță.
Benchmark-ul studiului pentru concentrarea recursivă a citărilor este acum disponibil pe GitHub.
Concluzie
Opinia Ca persoană care citește săptămânal un număr disproporționat de lucrări de cercetare AI, am observat că „valurile de citări” vin și pleacă. Un pilon peren este lucrarea „Attention Is All You Need” de la Google, lucrarea originală a Transformer‑ilor, care probabil este acum integrată în codurile șabloanelor de trimitere.
Un alt infractor recurent, pentru o perioadă lungă, a fost lucrarea din 2014 „Generative Adversarial Networks”, deși în cele din urmă a fost înlocuită în frecvență de „Denoising Diffusion Probabilistic Models” și alte studii de referință bazate pe difuzie.
În aproape toate cazurile, aceste citări „recente” nu sunt greșite, per se; dar sunt adesea prea largi în scop pentru a reprezenta un sprijin util pentru lucrarea în care sunt citate; și în acest sens, ele reprezintă ceva asemănător cu „spălarea citărilor” – includerea de citate „fiabile”, dar în principal decorative, pentru a conferi o aparență de credibilitate cu efort redus.
Publicat prima dată luni, 24 august 2026. Modificat la 23:07 EET pentru a adăuga pluralul lipsă.
Sursele articolului original: archive.is [1] · publishersweekly.com [2] · projects.research-and-innovation.ec.europa.eu [3] · unite.ai [4] · web.archive.org [5] · biblehub.com [6] · link.springer.com [7] · unite.ai [8] · unite.ai [9] · unite.ai [10] · pubmed.ncbi.nlm.nih.gov [11] · unite.ai [12] · unite.ai [13] · unite.ai [14] · unite.ai [15] · arxiv.org [16] · arxiv.org [17] · arxiv.org [18]












