Angolo di Anderson

AI cita gli stessi articoli più e più volte – Proprio come gli esseri umani

mm
Aggiungi Unite.AI alle tue fonti preferite su Google
AI-generated article image (GPT Image 2): an industrial humanoid robot sits with its feet raised, reading Popular Mechanics beside a turntable playing a record and a partially filled metal record rack. A cat sleeps on otherwise empty shelving behind it. A yellow-and-black border reads ‘AI FANTASY INSIDE’ and ‘REALITY OUTSIDE’.

ChatGPT e altri strumenti di scrittura AI potrebbero trasformare silenziosamente la scienza in una gara di popolarità, indirizzando ripetutamente i ricercatori verso gli stessi articoli mentre trascurano lavori nuovi e innovativi che potrebbero realmente far progredire il settore.

 

Monocultura, in termini di frequenza e statistiche, è quando lo stesso insieme limitato di fonti o risorse si ripete più e più volte, soffocando voci nuove e prospettive fresche: lo stesso insieme limitato di canzoni nella programmazione radiofonica; lo stesso gruppo di autori e libri nelle scaffalature degli aeroporti; e la stessa selezione ristretta di frutta e verdura nei supermercati:

Yes, we have these bananas, and only these bananas. Source - https://www.thaitissues.com/en/post/a-deep-dive-into-the-grand-naine-banana-the-king-of-the-global-banana-market-and-its-crossroads-f

Sì, abbiamo queste banane – e solo queste banane. L’omogeneità di frutta e verdura nelle catene alimentari occidentali ignora le centinaia di altre possibilità di specie in ogni caso, perché le varie catene di generazione e trasporto sono troppo costose da industrializzare per tipi diversi di frutta o verdura.  Fonte

Ciò avviene anche nelle citazioni che compaiono nelle nuove ricerche scientifiche, dove i ricercatori, forse per pigrizia, ricorrono a un insieme ‘affidabile’ di fonti che guadagna slancio finché non inizia a dominare i filoni di ricerca.

Questo è noto come Matthew Effect – una teoria sociologica che suggerisce che i incumbenti trarranno sempre beneficio; la sindrome è stata paragonata alla promessa contenuta in Matteo 13:12, che affermano ‘Chi ha, gli sarà dato di più, e avrà abbondanza. Chi non ha, anche ciò che ha gli sarà tolto’.

Il gruppo di élite

Una delle grandi speranze della ricerca potenziata dall’AI è che i nuovi metodi di apprendimento automatico possano rompere l’effetto Matthew – noto anche come bias di popolarità – e iniziare a citare lavori meno conosciuti che potrebbero essere più incisivi o più pertinenti al punto che si vuole dimostrare in un articolo.

Tuttavia, in base al modo in cui le routine di addestramento dell’AI interpretano i dataset, non c’è mai stato un valido motivo per questo ottimismo; e si è scoperto ripetutamente che quando l’AI non inventa citazioni apertamente – un problema cronico fino ad oggi – perpetua effettivamente l’effetto Matthew, proprio come fanno gli esseri umani – sebbene forse non per la stessa ragione.

Durante l’addestramento, un modello impara a classificare in alto i lavori più citati (o ‘più spesso ripetuti’) in un set di addestramento, poiché le routine sono progettate per estrarre schemi significativi e per scontare gli outlier come ‘rumore’ o anomalie statistiche.

In questo regime, l’equivalente della teoria della relatività di Einstein non riceverebbe mai attenzione dalla macchina, che, una volta addestrata, ritiene di aver già trovato i suoi principi e riferimenti, e può solo modificare leggermente quella prospettiva accedendo a pubblicazioni più recenti tramite RAG o altri mezzi che estendono la portata del modello oltre la sua matrice di addestramento.

Il problema è che non riconoscerà tali nuovi lavori nello stesso modo dei ‘vecchi preferiti’ che già conosceva, o addirittura non li riconoscerà affatto, poiché i suoi bias statistici sono ormai ben radicati.

Quindi l’AI non sta realmente osservando e imitandone il comportamento umano quando perpetua l’effetto Matthew – sta semplicemente contando il numero di volte in cui i ricercatori, per pigrizia, ricorrono agli stessi vecchi articoli, e li classifica allo stesso modo. In questo senso, il problema della ripetizione delle citazioni è correlato alla sfida di scegliere un articolo scientifico davvero interessante tra il infinito vortice di pubblicazioni di ricerca AI, poiché il lavoro più solido avrà spesso il segnale più debole.

Diagnosticare la Monocultura

Questo problema è affrontato in un interessante nuovo articolo proveniente dagli Stati Uniti intitolato When AI Writes, Who Gets Cited? Evidence of Citation Monoculture Across Language Models. Il nuovo lavoro – una collaborazione tra l’University of Texas at Austin, Stevens Institute of Technology, Washington University at St Louis, Rice University e l’University of Notre Dame – cerca di dimostrare definitivamente l’esistenza della monocultura delle citazioni nell’apprendimento automatico, in modo che le sue variabili possano eventualmente essere affrontate direttamente in futuro, insieme al problema stesso.

Nei test, gli autori hanno scoperto che undici modelli di OpenAI, Google e Anthropic favorivano ripetutamente lo stesso piccolo gruppo di articoli – anche dopo che i evidenti segnali di popolarità erano stati rimossi.

Per testare ciò, 120 articoli reali sono stati privati dei conteggi di citazioni e dei luoghi di pubblicazione, mentre i nomi degli autori sono stati sostituiti e gli anni di pubblicazione riassegnati casualmente. Insieme a gruppi casuali di trenta articoli sono stati poi mostrati a ciascun modello, al quale è stato permesso di citare non più di dieci.

Otto esperti umani nei campi pertinenti hanno ricevuto gli stessi articoli ciechi, ma non hanno convergito sugli stessi preferiti degli AI, indicando che il bias era specifico dei modelli AI piuttosto che degli articoli stessi:

From the new paper, test results comparing citation choices by AI models and human experts. Across all eleven models, citations were concentrated on a smaller group of papers, while some papers were repeatedly passed over entirely. Human experts showed neither tendency. Source - https://arxiv.org/pdf/2608.19230

Dal nuovo articolo, risultati dei test che confrontano le scelte di citazione dei modelli AI e degli esperti umani. In tutti gli undici modelli, le citazioni si sono concentrate su un piccolo gruppo di articoli, mentre alcuni articoli sono stati ripetutamente esclusi del tutto. Gli esperti umani non hanno mostrato alcuna tendenza. Fonte

Gli stessi articoli sono rimasti popolari anche quando ai modelli è stato chiesto solo di scegliere riferimenti, dimostrando che la redazione della recensione stessa non era la causa del bias.

L’esperimento è stato poi esteso per undici turni, aggiungendo 120 articoli scritti dall’AI dopo ogni turno, per testare cosa accade quando queste preferenze condivise operano in un pool crescente di ricerche generate dall’AI.

Man mano che venivano aggiunti più articoli scritti dall’AI, i modelli hanno concentrato sempre più le loro citazioni su un numero sempre più ridotto di articoli umani originali.

Gli autori affermano:

‘Man mano che i modelli linguistici passano dalla stesura di testi all’esecuzione di agenti di ricerca bibliografica con chiamate di strumenti, i riferimenti fabbricati stanno diventando più facili da individuare e contenere.

‘Il fallimento più difficile inizia dopo che ogni candidato è reale: modelli diversi possono comunque selezionare lo stesso ristretto sottoinsieme, producendo una monocultura delle citazioni senza che alcuna singola citazione sia errata.’

Come rimedio al problema, l’articolo sostiene che semplicemente mescolare modelli di fornitori diversi o dare ai lavori un’esposizione pari non sarà sufficiente, poiché gran parte della preferenza è condivisa tra i modelli. Piuttosto, la preferenza di base per particolari articoli dovrebbe cambiare – potenzialmente dando deliberatamente maggiore visibilità ai lavori trascurati. Tuttavia, gli autori sottolineano che questo approccio rimane non testato.

Approcci di test

Il benchmark è stato costruito a partire da 120 veri articoli di distillazione della conoscenza raccolti da arXiv e pubblicati tra il 2015 e il 2022. Ognuno presentava tra 50 e 500 citazioni al momento della raccolta, una gamma scelta per escludere sia lavori oscuri sia lavori eccezionalmente influenti.

L’esperimento è iniziato estraendo casualmente trenta articoli dalla collezione disponibile, nascondendo i nomi degli autori, gli anni di pubblicazione e i conteggi delle citazioni. Ogni modello ha prodotto una breve recensione o un pezzo di posizione citando non più di dieci articoli, e queste scelte sono state confrontate con selezioni casuali dello stesso materiale:

Method used to test citation preferences. Thirty randomly selected papers were shown to a model with identifying information hidden, after which it could cite up to ten. Its choices were compared with random selection, while each round added 120 AI-written papers to the next round's collection.

Schema del metodo utilizzato per testare le preferenze di citazione. Trenta articoli selezionati casualmente sono stati mostrati a un modello con le informazioni identificative nascoste, dopodiché poteva citare fino a dieci. Le sue scelte sono state confrontate con una selezione casuale, mentre ogni turno aggiungeva 120 articoli scritti dall’AI alla collezione del turno successivo.

Nell’esperimento esteso, 120 nuovi articoli generati sono entrati nella collezione dopo ogni turno, aumentando gradualmente la proporzione di ricerche scritte dall’AI.

Nei test preliminari, i modelli tendevano a citare la maggior parte degli articoli mostrati, tipicamente selezionando tra 22 e 27 su 30. I ricercatori hanno quindi fissato un massimo di dieci citazioni per l’esperimento principale, costringendo i modelli a fare scelte più selettive.

Di seguito vediamo un riepilogo del disegno sperimentale risultante:

Experimental setup used to test citation preferences. The study began with 120 real papers and tested eleven models from three vendors, using randomized sets of 30 papers and a maximum of ten citations. Later rounds added AI-generated papers, expanding the collection to 1,440 papers.

Configurazione sperimentale utilizzata per testare le preferenze di citazione. Lo studio è iniziato con 120 articoli reali e ha testato undici modelli di tre fornitori, usando set casuali di 30 articoli e un massimo di dieci citazioni. I turni successivi hanno aggiunto articoli generati dall’AI, espandendo la collezione a 1.440 articoli.

L’esperimento iniziale ha utilizzato undici modelli dei tre principali fornitori: OpenAI è rappresentata da GPT-5, GPT-5 mini, GPT-4.1 e GPT-4.1 mini; Google da Gemini 2.5 Pro, Gemini 2.5 Flash, Gemini 3.1 Pro e Gemini 3.1 Flash-Lite; e Anthropic da Claude Opus 4.8, Claude Sonnet 4.6 e Claude Haiku 4.5.

Nei risultati dei test mostrati di seguito, vediamo quanto ogni modello abbia concentrato le sue citazioni su un piccolo gruppo di articoli; quanti articoli abbia ignorato del tutto; e quanto costantemente abbia effettuato le stesse scelte quando l’esperimento è stato ripetuto:

Test results showing how strongly each model concentrated its citations on particular papers and how many papers it ignored entirely. 'Top-10% share' shows how many citations went to the 12 most-favored papers, while 'HHI' measures how concentrated citations were overall. 'Reliability' shows how consistently each model favored the same papers across tests, and ρ shows how similar those preferences were across models. The 'Matched null' row indicates what would be expected if papers were chosen at random.

Risultati dei test che mostrano quanto ciascun modello abbia concentrato le sue citazioni su particolari articoli e quanti articoli abbia ignorato del tutto. La voce ‘Top-10% share’ indica quante citazioni sono andate ai 12 articoli più favoriti, mentre ‘HHI’ misura quanto le citazioni siano concentrate complessivamente. ‘Reliability’ mostra quanto costantemente ogni modello abbia favorito gli stessi articoli nei test, e ρ indica quanto simili fossero tali preferenze tra i modelli. La riga ‘Matched null’ indica ciò che ci si attenderebbe se gli articoli fossero scelti a caso.

Cosa stanno realmente favorendo i modelli?

La preferenza è risultata essere prevalentemente guidata dal contenuto stesso degli articoli. Per esempio, per GPT-5 mini, circa il 90% della variazione nei paper favoriti era attribuibile al contenuto, piuttosto che a fattori come l’ordine della lista, il rumore di generazione o i metadati fabbricati associati a ciascun articolo. Lo stesso effetto di ‘contenuto dominante’ è stato riprodotto con GPT-4.1 mini.

La mappa delle preferenze (vedi sotto) è cambiata poco anche quando titoli e abstract sono stati riscritti in modo sostanziale mantenendo intatto il significato. In quattro test di parafrasi riusciti, sono state ottenute correlazioni tra 0,95 e 0,99, nonostante fossero utilizzati modelli diversi di tre fornitori per la riscrittura.

Modifiche nella mappa delle preferenze sono state osservate solo quando il significato di base è stato alterato in modo misurabile:

Test results comparing citation preferences across the eleven models. The numbers show how closely each pair of models favored the same papers, with higher values indicating greater agreement. Despite differences between models and vendors, broadly similar preferences were found across the group

Risultati dei test che confrontano le preferenze di citazione tra gli undici modelli. I numeri mostrano quanto ciascuna coppia di modelli abbia favorito gli stessi articoli, con valori più alti che indicano maggiore accordo. Nonostante le differenze tra modelli e fornitori, sono state riscontrate preferenze ampiamente simili all’interno del gruppo.

I modelli sembrano quindi rispondere principalmente al contenuto semantico piuttosto che a una formulazione specifica. Tuttavia, la ragione del loro forte accordo non è stata determinata in modo conclusivo.

È possibile, affermano gli autori, che un consenso comune sulle citazioni sia stato assorbito durante l’addestramento. Un’alternativa è che giudizi simili su ciò che costituisce un articolo ‘citabile’ possano essere raggiunti in modo indipendente.

Pertanto è stata stabilita l’esistenza della preferenza condivisa, ma la sua origine ultima rimane sconosciuta.

Gli autori suggeriscono che l’uso diffuso dell’AI nella ricerca potrebbe restringere la gamma di lavori che ricevono attenzione, poiché diversi modelli tendono a favorire molti degli stessi articoli; e man mano che la letteratura generata dall’AI si accumula, queste preferenze condivise potrebbero essere ulteriormente rafforzate attraverso citazioni ripetute, rendendo la ricerca meno favorita progressivamente più difficile da scoprire. La diversità delle citazioni e il monitoraggio della concentrazione delle citazioni sono quindi proposti come possibili salvaguardie.

Il benchmark dello studio per la concentrazione ricorsiva delle citazioni è ora disponibile su GitHub.

Conclusione

Opinione Come qualcuno che legge un numero sproporzionato di articoli di ricerca AI ogni settimana, ho visto ‘onde di citazioni’ andare e venire. Un punto fermo perenne è il documento originale di Google Attention Is All You Need, il paper sui Transformers, che ormai deve essere codificato nei template di sottomissione.

Un altro trasgressore ricorrente, per molto tempo, è stato il lavoro del 2014 Generative Adversarial Networks, sebbene alla fine sia stato superato in frequenza da Denoising Diffusion Probabilistic Models e da altri studi di punta basati sulla diffusione.

In quasi tutti i casi, queste citazioni ‘ricorrenti’ non sono sbagliate, di per sé; ma sono spesso troppo ampie per essere un supporto utile al documento in cui vengono citate; e in questo senso, rappresentano qualcosa di simile al ‘citation-washing’ – l’inclusione di citazioni ‘affidabili’ ma principalmente decorative, per conferire un’aria di credibilità a basso sforzo.

 

Pubblicato per la prima volta lunedì 24 agosto 2026. Modificato 23:07 EET per aggiungere il plurale mancante.

Fonti dell’articolo originale: pubmed.ncbi.nlm.nih.gov [1]

Scrittore di apprendimento automatico, specialista di dominio nella sintesi di immagini umane. Ex responsabile dei contenuti di ricerca presso Metaphysic.ai, fino alla sua fusione nella Brahma.ai di DNEG.
Sito web: martinanderson.ai
Contatto: martin@martinanderson.ai