Angolo di Anderson

Combattere il “slop” dell’IA nei documenti scientifici

mm
Aggiungi Unite.AI alle tue fonti preferite su Google
Image 'A shelf filled with lots of bottles of liquid' by Evgeniy Smersh. Used under the Unsplash license. Source: https://unsplash.com/photos/a-shelf-filled-with-lots-of-bottles-of-liquid-aWnA944oXLE

L’IA fa tutto su larga scala, dall’estrazione di dati a livello di attacco DOS alla produzione, o abilitazione, volumi così enormi di sottomissioni di ricerca scientifica che il risultato sta diventando sia una crisi logistica sia una crisi della qualità, poiché il rapporto segnale‑rumore continua a diventare impraticabile.

La scorsa settimana, il server di preprint arXiv annunciato che introdurrà una nuova politica di limitazione della velocità per i soggetti che inviano, i quali ora saranno limitati a due sottomissioni al mese. La misura è stata adottata, suggerisce l’annuncio, di fronte a un vertiginoso aumento dei tassi di sottomissione in un breve periodo di tempo:

Sottomissioni mensili alla categoria cs.AI di arXiv da gennaio 2024 a settembre 2026, mostrando un aumento di oltre sei volte nel periodo. Fonte - https://blog.arxiv.org/2026/10/01/updated-rate-limit-policy/

Sottomissioni mensili alla categoria cs.AI di arXiv da gennaio 2024 a settembre 2026, mostrando un aumento di oltre sei volte nel periodo. Fonte

Il post sul blog di Kat Boboris che annuncia la mossa, il quale ha suscitato commenti su Hacker News giovedì scorso, ha dichiarato che arXiv ha ricevuto 40,363 sottomissioni a settembre 2026 – quasi il doppio delle 20,569 ricevute a settembre 2024, e più di quattro volte le 9,869 ricevute a settembre 2016.

Le sottomissioni dell’ultimo mese, ha osservato Boboris, hanno anche generato quasi 9,000 ticket di supporto per lo staff e i moderatori di arXiv:

‘I nostri moderatori stanno osservando un aumento di paper sottili di ambito ristretto, così come paper “salami”, dove un unico lavoro è suddiviso e inviato come un insieme di paper più piccoli.’

‘C’è anche un notevole aumento di paper densi, scritti dall’IA. Gli strumenti di IA stanno facilitando gli autori a inondare arXiv e altri repository con questi paper di scarso valore.’

Già, a maggio di quest’anno, arXiv ha adottato la misura di implementare un divieto di un anno per contenuti IA non verificati; e a ottobre dello scorso anno, ha comunicato ai soggetti che inviano paper di indagine e paper di posizione (entrambi i quali possono essere generati con meno sforzo rispetto a uno studio accademico completo) che avrebbero bisogno di una revisione tra pari per essere pubblicati su arXiv.

Per il momento, il limitatore spesso ostacolante delle richieste http del dominio arXiv non è molto evidente, e si può solo sperare che i suoi feed RSS molto utili sopravvivano a questo continuo ritiro. La scorsa settimana Reddit annunciato l’eliminazione totale temuta da tempo dei suoi feed RSS, che avverrà a partire dalla metà del prossimo mese. Tuttavia, lo status non profit di arXiv significa che c’è poco capitale simile da guadagnare guidando i lettori verso visite obbligatorie al sito, o login obbligatori – almeno per il momento.

Contro l’onda crescente

In presenza di problemi gravi e in crescita riguardo l’effetto negativo dell’uso dell’IA nella ricerca scientifica – soprattutto per la ricerca correlata all’IA, che ha eclissato tutte le altre categorie, e passata dall’oscurità a diventare un segnale politico ed economico, di recente – è emersa una linea di ricerca che esamina i modi per contrastare il declino della qualità delle sottomissioni di paper correlati all’IA.

L’ultima a affrontare il problema arriva sotto forma di una collaborazione tra la Seoul National University della Corea e l’University of Minnesota negli Stati Uniti. Il articolo, intitolato Science or Slop?: Benchmarking and Mitigating Scientific Slop in AI-Generated Papers, propone di misurare il ‘slop’ scientifico attraverso i fallimenti nelle connessioni tra le affermazioni, le evidenze, le citazioni e la struttura di un articolo:

Dal nuovo articolo, una panoramica dell'approccio del lavoro al 'slop' scientifico, mostrando come i fallimenti nella struttura, nell'argomentazione e negli artefatti di supporto possano rivelare debolezze che i tradizionali rilevatori di testo IA non colgono. Fonte - https://arxiv.org/pdf/2610.00531

Dal nuovo articolo, una panoramica dell’approccio del lavoro al ‘slop’ scientifico, mostrando come i fallimenti nella struttura, nell’argomentazione e negli artefatti di supporto possano rivelare debolezze che i tradizionali rilevatori di testo IA non colgono. Fonte

A differenza degli approcci precedenti, il nuovo sistema guarda oltre il testo stesso per valutare se le affermazioni dell’articolo sono adeguatamente supportate dalle sue argomentazioni, evidenze e citazioni. Gli autori affermano*:

‘Ogni parte di un articolo può apparire plausibile isolatamente, quindi tali rotture sono invisibili ai rilevatori a livello di token e possono essere identificate o corrette solo a livello dell’intero articolo. Per valutare e mitigare il slop scientifico, questo articolo affronta tre sfide.’

‘In primo luogo, le metriche a livello di token non riescono a catturare come il ragionamento scientifico si collega attraverso un articolo. Le sezioni, le affermazioni, le citazioni, le evidenze e gli artefatti possono ciascuno apparire plausibili mentre le relazioni tra di essi si deteriorano. Osserviamo ripetutamente tali fallimenti nei paper generati end-to-end dall’IA, e i revisori di ICLR li penalizzano già anche nelle sottomissioni scritte da umani.

‘In secondo luogo, la rilevazione di questi schemi rimane non misurata. I set di test esistenti etichettano solo il testo, quindi l’entità con cui i rilevatori, inclusi i LLM che leggono l’intero articolo, identificano questi schemi non è mai stata misurata.

‘In terzo luogo, questi schemi sono difficili da mitigare in modo affidabile. Mentre i segnali a livello di token possono essere rimossi mediante parafrasi, la riparazione di questi schemi richiede il ripristino delle relazioni mancanti senza modificare la scienza di base.’

Il nuovo benchmark degli autori, denominato SciSlopBench, è stato incorporato in SciSlopHarness, un framework progettato per rilevare e correggere i fallimenti nel ragionamento scientifico di un articolo, preservando le evidenze scientifiche di base:

Esempi che confrontano passaggi difettosi con revisioni effettuate da SciSlopHarness. Le aggiunte non supportate vengono rifiutate, mentre le affermazioni sono riordinate o riscritte dove necessario per riflettere meglio le evidenze disponibili nell'articolo.

Esempi che confrontano passaggi difettosi con le revisioni apportate da SciSlopHarness. Le aggiunte non supportate vengono respinte, mentre le affermazioni vengono riorganizzate o riscritte, se necessario, per riflettere meglio le prove disponibili nel documento.

Il benchmark SciSlopBench è stato costruito a partire da 390 articoli generati da IA, ciascuno accoppiato con un articolo scritto da un umano che affronta un problema di ricerca e un tipo di contributo simili.

Nei test, SciSlopBench è stato utilizzato per distinguere tra 390 coppie di articoli, con ogni coppia composta dall’articolo generato da IA sopra citato e da un articolo scritto da un umano abbinato per problema di ricerca e tipo di contributo. Il benchmark ha identificato correttamente l’articolo generato da IA nell’85.9% di questi confronti, superando di gran lunga i tradizionali rilevatori di testo IA.

Gli autori affermano:

Mentre le revisioni standard lasciano slop residuo e i prompt consapevoli di slop attivano il reward hacking, SciSlopHarness riduce il divario residuo AI‑umano del 63% rispetto al miglior baseline di revisione senza richiedere target di riferimento umani.

In sintesi, dimostriamo che gli articoli scientifici generati da IA lasciano tracce fondamentali nel loro ragionamento globale, e che una mitigazione responsabile richiede una solida base probatoria piuttosto che una semplice raffinazione della prosa.

Oltre ai contributi forniti dal documento stesso, gli autori hanno messo in pratica i principi del loro nuovo lavoro sotto forma di una dimostrazione dal vivo in cui gli utenti possono inviare articoli scientifici per l’analisi della quantità di slop IA che contengono.

Curiosamente, il nuovo articolo stesso, analizzato dalla demo, ottiene un punteggio di ‘slop’ moderato di 40/100†:

Il nuovo articolo, analizzato dal proprio algoritmo, segnala le aree di 'slop' identificate dal nuovo processo degli autori. Fonte: https://yerimoh.github.io/scientific-slop-demo/r/75h2-yvx2-amhd

Il nuovo articolo, analizzato dal proprio algoritmo, ottiene le aree di ‘slop’ segnalate dal nuovo processo degli autori. Fonte

Metodo e Approccio ai Dati

La collaborazione 2025 Why Slop Matters ha descritto la ‘competenza superficiale’ come una caratteristica distintiva dello slop IA, dove la qualità apparente nasconde una mancanza di sostanza. Il nuovo lavoro applica questa idea più specificamente agli articoli scientifici, definendo lo ‘slop scientifico’ come fallimenti che rendono difficile seguire come è organizzato uno studio; come le sue affermazioni sono supportate; e come i suoi metodi e le evidenze possono essere esaminati, con i fallimenti raggruppati in struttura; argomento; e artefatti:

Regole di misurazione per i sei tipi di slop scientifico utilizzati nel benchmark. La tabella mostra cosa viene esaminato per ciascuna misura, come viene calcolato il punteggio e cosa rappresenta il punteggio massimo di 1, con punteggi più alti che indicano fallimenti più estesi.

Regole di misurazione per i sei tipi di slopp scientifici utilizzati nel benchmark. La tabella mostra cosa viene esaminato per ciascuna misura, come viene calcolato il punteggio e cosa rappresenta il punteggio massimo di 1, con punteggi più alti che indicano fallimenti più estesi.

Le sei misure di slop scientifico definite nell’articolo sono riferimenti trasversali (se le sezioni si riferiscono in modo significativo a materiale presente altrove nell’articolo); macro ridondanza (se le sezioni successive ripetono materiale precedente); grafico argomentativo (se le affermazioni sono adeguatamente supportate dal ragionamento precedente); isolamento delle citazioni (se le citazioni sono usate superficialmente, senza spiegare come i lavori citati si relazionano all’articolo o tra loro); esposizione delle figure (se le figure dei metodi spiegano realmente il metodo); e lacuna di evidenza (se i risultati riportati sono supportati da esempi concreti).

Il benchmark è stato costruito accoppiando articoli generati dall’IA con articoli umani comparabili/equivalenti, con gli articoli IA curati da FARS e dalla competizione 2025 Agents4Science.

Per ciascun articolo generato da macchina nel dataset FARS, i ricercatori hanno esaminato le citazioni alla ricerca di un articolo scritto da umani dello stesso tipo, accettato in una sede di alto livello, e hanno poi selezionato la corrispondenza più vicina per argomento di ricerca, ottenendo 143 coppie. Gli articoli Agents4Science sono stati analogamente accoppiati con controparti scritte da umani, generando altre 247 coppie e portando il benchmark a un totale di 390 coppie AI‑umano. Gli articoli coprono le scienze della vita, sociali e naturali, sebbene il dataset sia fortemente sbilanciato verso l’informatica.

Per le metriche, le prestazioni sono state valutate usando PairAcc, che misura quanto spesso l’articolo umano è classificato sopra la sua controparte AI; e AUROC, che misura la separazione complessiva tra articoli umani e AI a diverse soglie. Gli autori riportano inoltre le prestazioni di rilevamento quando il tasso di falsi positivi per gli articoli umani è fissato al 5 %.

Test

I test iniziali hanno confrontato SciSlop con i rilevatori di testo AI Binoculars; DetectGPT; e NTS††, nonché con i sistemi di revisione automatizzata AI Scientist Reviewer e CycleReviewer.

Per i test di revisione successivi, sono state utilizzate quattro baseline: base prompting; Claude Code; reviewer-based refinement; e slop-aware revision. Le prime tre hanno ricevuto solo istruzioni generali per migliorare l’articolo, mentre la revisione slop‑aware ha ricevuto inoltre le definizioni e le posizioni del slop rilevato. Tutte sono state confrontate con SciSlopHarness in condizioni di revisione equivalenti.

Per l’implementazione, i rilevatori di testo hanno ricevuto la prosa dell’articolo, mentre gli altri metodi hanno ricevuto il codice sorgente dell’articolo e, dove necessario, l’accesso al suo codice. Binoculars ha utilizzato Falcon-7B per i modelli base e di istruzione; DetectGPT ha impiegato T5-3B per generare 100 perturbazioni; AI Scientist ha usato Qwen2.5-32B-Instruct; e CycleReviewer ha sfruttato il suo checkpoint da 8 B rilasciato. Per gli articoli che superano il limite di 2 048 token di Falcon, le finestre non sovrapposte sono state valutate separatamente e mediate.

I risultati iniziali di rilevamento sono dettagliati nelle due tabelle seguenti: SciSlop ha raggiunto l’85,9 % di PairAcc, rispetto al 68,7 % di Binoculars e al 68,5 % del revisore automatizzato più performante, riducendo il tasso di errore di oltre la metà:

Risultati di rilevamento confrontando SciSlop con i rilevatori di testo AI e i revisori automatizzati, insieme ai risultati per le sue sei misure individuali di slop. SciSlop ottiene il più alto PairAcc complessivo, mentre i riferimenti incrociati forniscono il risultato individuale più forte.

Risultati di rilevamento confrontando SciSlop con i rilevatori di testo AI e i revisori automatizzati, insieme ai risultati per le sue sei misure individuali di slop. SciSlop ottiene il più alto PairAcc complessivo, mentre i riferimenti incrociati forniscono il risultato individuale più forte.

I riferimenti incrociati hanno mostrato una performance particolarmente forte da soli, raggiungendo il 90,5 % di PairAcc senza richiedere un modello, e rilevando il 65 % degli articoli generati da AI a un tasso di falsi positivi del 5 %, rispetto al 24 % di Binoculars.

Gli autori sostengono che questi risultati indicano che le relazioni all’interno dell’articolo forniscono un segnale più forte di generazione AI rispetto ai tradizionali rilevamenti a livello di testo su questo dataset, identificando al contempo specifiche debolezze che potrebbero essere successivamente mirate per la revisione.

È stata poi esaminata la relazione tra lo slop scientifico e le valutazioni umane della qualità dell’articolo. Come mostrato nella prima colonna qui sotto, uno slop più elevato era associato a punteggi ICLR più bassi per valutazione complessiva, solidità, presentazione e contributo:

Confronto di SciSlop con i rilevatori di testo AI e i revisori automatizzati rispetto ai risultati delle revisioni ICLR. Il pannello sinistro mostra la somiglianza AI rispetto ai punteggi di revisione; il centro confronta le singole dimensioni di revisione; il destro mostra le prestazioni nel distinguere articoli respinti da quelli accettati in un arco di nove anni.

Confronto di SciSlop con i rilevatori di testo AI e i revisori automatizzati rispetto ai risultati delle revisioni ICLR. Il pannello sinistro mostra la somiglianza AI rispetto ai punteggi di revisione; il centro confronta le singole dimensioni di revisione; il destro mostra le prestazioni nel distinguere articoli respinti da quelli accettati in un arco di nove anni.

Anche gli articoli respinti e accettati sono stati distinti al di sopra del caso in tutti i nove anni esaminati, mentre i rilevatori convenzionali sono risultati al di sotto del caso nella maggior parte dei confronti.

Lo slop scientifico è quindi stato riscontrato come riflesso di debolezze già penalizzate dai revisori umani, piuttosto che funzionare esclusivamente come segnale di paternità AI.

I test finali hanno verificato se SciSlopHarness potesse rimuovere lo slop residuo dopo una revisione più generale. Come mostrato di seguito, il harness ha raggiunto il valore più vicino alla media umana su tutte e sei le misure, mentre la revisione generale ha spesso lasciato uno slop consistente e la revisione slop‑aware a volte ha sovracorretto:

Risultati di revisione confrontando SciSlopHarness con quattro metodi di baseline su sei misure di slop. Valori più vicini a zero indicano una maggiore vicinanza alla media degli articoli umani, con SciSlopHarness che tende generalmente verso questo livello, mentre la revisione slop‑aware spesso lo supera.

Risultati della revisione confrontando SciSlopHarness con quattro metodi di riferimento attraverso le sei misure di slop. Valori più vicini a zero sono più vicini alla media dei paper umani, con SciSlopHarness che generalmente si avvicina a questo livello mentre la revisione consapevole dello slop spesso lo supera.

Ogni modifica proposta è stata verificata rispetto al ragionamento scientifico del paper e alle evidenze di supporto, con le modifiche non supportate respinte. Attraverso le sei misure, il divario residuo rispetto ai paper scritti da esseri umani è stato ridotto del 63% rispetto a Claude Code, il più forte baseline di revisione.

Conclusione

È stato interessante, nel corso della stesura di questo articolo, notare non solo quanto questo paper abbia ottenuto un punteggio basso sul proprio sito demo, ma osservare almeno un esempio di citazione ‘pigra’ o ‘cosmetica’††, che di recente è diventata una piccola ma crescente maledizione nei paper di ricerca.

In tali casi, oltre a questo specifico paper, i ricercatori sembrano attingere alla propria conoscenza piuttosto che impegnarsi in modo significativo con la letteratura esistente. Tuttavia, vincolati dalla convenzione di ‘mostrare il proprio lavoro’, le citazioni sono spesso fornite con quello che appare come impazienza, persino disprezzo per il processo, e spesso apparentemente si basano sul lettore per accettare un eccesso di riferimenti come una sufficiente ‘patina’ di provenienza, sebbene non sopravviverebbe a uno scrutinio eccessivo.

Arxiv sta reagendo contro l’industrializzazione delle sottomissioni guidata dall’IA; se ci saranno restrizioni simili sul coinvolgimento diretto dell’IA nella ricerca, in assenza di qualche disastro correlato di sufficiente entità, resta da vedere.

 

* Le enfasi degli autori, non le mie – ma la mia conversione, dove necessario, delle citazioni in linea degli autori in hyperlink.

† Gli autori non affermano di non aver usato alcuna IA nel loro paper, e dettagli tale utilizzo.

†† Può interessare il lettore sapere che ho dovuto cercare personalmente un link corretto per il framework NTS, perché il link fornito dagli autori non era pertinente – una delle metriche su cui SciSlop si basa!

Prima pubblicazione domenica 4 ottobre 2026

Scrittore di apprendimento automatico, specialista di dominio nella sintesi di immagini umane. Ex responsabile dei contenuti di ricerca presso Metaphysic.ai, fino alla sua fusione nella Brahma.ai di DNEG.
Sito web: martinanderson.ai
Contatto: martin@martinanderson.ai