Unghiul lui Anderson
Combaterea slopului AI în lucrările științifice

AI face totul la scară, de la scraping web la nivel de atac DOS la producerea sau facilitarea așa de volume imense de depuneri de cercetări științifice, astfel încât rezultatul devine atât o criză logistică, cât și o criză a calității, pe măsură ce raportul semnal‑zgomot devine din ce în ce mai dificil de navigat.
Săptămâna trecută, serverul de preprinturi arXiv anunțat că va institui o nouă politică de limitare a ratei pentru depunători, care acum vor fi limitați la două depuneri pe lună. Măsura a fost luată, sugerează anunțul, în contextul unei creșteri vertiginoase a ratelor de depunere pe o perioadă scurtă de timp:

Depunerile lunare la categoria cs.AI a arXiv din ianuarie 2024 până în septembrie 2026, arătând o creștere de peste șase ori pe parcursul perioadei. Sursă
Postarea pe blog a lui Kat Boboris care anunță această mișcare, care a atras comentarii pe Hacker News joia trecută, a declarat că arXiv a primit 40,363 de depuneri în septembrie 2026 – aproape dublul celor 20,569 din septembrie 2024 și peste patru ori cele 9,869 din septembrie 2016.
Depunerile din ultima lună, a observat Boboris, au generat, de asemenea, aproape 9,000 de tichete de suport pentru personalul și moderatorii arXiv:
‘Moderatorii noștri observă o creștere a lucrărilor subțiri cu domeniu restrâns, precum și a lucrărilor „salami”, în care o singură lucrare este fragmentată și depusă ca un set de lucrări mai mici.
‘Există, de asemenea, o creștere semnificativă a lucrărilor dense, scrise de AI. Instrumentele AI facilitează autorilor să inunde arXiv și alte depozite cu aceste lucrări de valoare scăzută.’
Deja, în mai al acestui an, arXiv a luat măsura de a implementa o interdicție de un an pentru conținut AI necontrolat; și în octombrie al anului trecut, a informat depunătorii de lucrări de tip sondaj și lucrări de poziție (ambele putând fi generate cu mai puțin efort decât un studiu academic complet) că vor avea nevoie de susținere din partea colegilor pentru a fi publicate pe arXiv.
Deocamdată, limitarea adesea obstructivă a cererilor http de către domeniul arXiv nu este foarte evidentă, și se poate doar spera că fluxurile sale RSS foarte utile vor supraviețui acestei retrageri continue. Săptămâna trecută Reddit anunțat eliminarea totală, temută de mult, a fluxurilor sale RSS, care va avea loc din mijlocul lunii viitoare. Totuși, statutul non-profit al arXiv înseamnă că există puțin capital similar de câștigat prin îndrumarea cititorilor către vizite obligatorii pe site, sau autentificări impuse – cel puțin, pentru moment.
Împotriva valului în creștere
În fața unor probleme severe și în creștere legate de efectul negativ al utilizării AI în cercetarea științifică – în special în ceea ce privește cercetarea legată de AI, care a eclipsat toate celelalte categorii și a trecut de la obscuritate la a deveni un semnificator politic și economic, recent – a apărut o linie de cercetare care examinează modalități de a contracara declinul calității depunerilor de lucrări legate de AI.
Cel mai recent demers pentru a aborda problema apare sub forma unei colaborări între Universitatea Națională Seoul din Coreea și Universitatea din Minnesota din SUA. Lucrarea, intitulată Science or Slop?: Benchmarking and Mitigating Scientific Slop in AI-Generated Papers, propune măsurarea „slopului științific” prin eșecuri în conexiunile dintre afirmațiile, dovezile, citările și structura unei lucrări:

Din noua lucrare, o prezentare generală a abordării „slopului științific”, arătând cum eșecurile în structură, argumentare și artefacte de susținere pot dezvălui slăbiciuni pe care detectorii convenționali de text AI le ratează. Sursă
Spre deosebire de abordările anterioare, noul sistem privește dincolo de textul în sine pentru a evalua dacă afirmațiile lucrării sunt susținute corespunzător de argumentele, dovezile și citările sale. Autorii afirmă*:
‘Fiecare parte a unei lucrări poate părea plauzibilă izolat, astfel încât astfel de defecțiuni sunt invizibile pentru detectorii la nivel de token și pot fi identificate sau remediate doar la nivelul întregii lucrări. Pentru a evalua și atenua slopul științific, această lucrare abordează trei provocări.
‘În primul rând, metricile la nivel de token nu reușesc să surprindă modul în care raționamentul științific se leagă pe parcursul unei lucrări. Secțiunile, afirmațiile, citările, dovezile și artefactele pot părea fiecare plauzibile, în timp ce relațiile dintre ele se destramă. Observăm în mod repetat astfel de eșecuri în lucrările generate integral de AI, iar recenzorii ICLR le penalizează deja chiar și în depunerile scrise de oameni.
‘Al doilea, detectarea acestor modele rămâne nemăsurată. Seturile de testare existente etichetează doar textul, astfel că gradul în care detectoarele, inclusiv LLM-urile care citesc întregul articol, identifică aceste modele nu a fost niciodată măsurat.
‘Al treilea, aceste modele sunt dificil de atenuat în mod fiabil. În timp ce semnalele la nivel de token pot fi eliminate prin parafrazare, repararea acestor modele necesită restaurarea relațiilor lipsă fără a schimba știința de bază.’
Noul benchmark al autorilor, denumit SciSlopBench, a fost integrat în SciSlopHarness, un cadru conceput pentru a detecta și repara deficiențele din raționamentul științific al unui articol, păstrând în același timp dovezile științifice de bază:

Exemple care compară pasaje defectuoase cu revizii realizate de SciSlopHarness. Adăugirile nejustificate sunt respinse, în timp ce afirmațiile sunt reordonate sau rescrise acolo unde este necesar pentru a reflecta mai bine dovezile disponibile în articol.
Benchmark-ul SciSlopBench în sine a fost construit din 390 de lucrări generate de IA, fiecare asociată cu o lucrare scrisă de oameni care abordează o problemă de cercetare și un tip de contribuție similare.
În teste, SciSlopBench a fost utilizat pentru a distinge între 390 de perechi de lucrări, fiecare pereche constând din lucrarea generată de IA menționată anterior și o lucrare scrisă de oameni, potrivită pentru problema de cercetare și tipul de contribuție. Benchmark-ul a identificat corect lucrarea generată de IA în 85,9% din aceste comparații, depășind substanțial detectorii convenționali de text AI.
Autorii afirmă:
‘În timp ce reviziile standard lasă slop rezidual și solicitările directe conștiente de slop declanșează manipularea recompenselor, SciSlopHarness reduce diferența rămasă dintre IA și om cu 63% față de cel mai puternic punct de referință de revizie, fără a necesita ținte de referință umane.
‘În ansamblu, demonstrăm că lucrările științifice generate de IA lasă urme fundamentale în raționamentul lor global și că atenuarea responsabilă necesită o fundamentare strictă pe dovezi, nu doar rafinarea prozei.’
Pe lângă contribuțiile aduse de lucrare însăși, autorii au pus în practică principiile noii lor lucrări sub forma unei demo live în care utilizatorii pot trimite lucrări științifice pentru a analiza cantitatea de slop AI pe care o conțin.
Interesant, lucrarea nouă în sine, analizată de demo, are un scor de slop ‘moderate’ de 40/100†:

Lucrarea nouă, analizată de propriul său algoritm, marchează zonele de ‘slop’ prin noul proces al autorilor. Sursă
Metodă și abordare a datelor
Colaborarea din 2025 Why Slop Matters a descris „competenta superficială” ca o caracteristică definitorie a slop-ului AI, în care calitatea aparentă ascunde lipsa substanței. Noua lucrare aplică această idee mai specific la lucrările științifice, definind „slop științific” ca deficiențe care îngreunează urmărirea modului în care un studiu este organizat; cum sunt susținute afirmațiile sale; și cum pot fi examinate metodele și dovezile, cu deficiențele grupate în structură; argument; și artefacte:

Reguli de măsurare pentru cele șase tipuri de slop științific utilizate în benchmark. Tabelul arată ce se examinează pentru fiecare măsură, cum se calculează scorul și ce reprezintă scorul maxim de 1, cu scoruri mai mari indicând deficiențe mai ample.
Ceile șase măsuri ale slop-ului științific definite în lucrare sunt referințe între secțiuni (dacă secțiunile fac referire semnificativă la materialul din alte părți ale lucrării); macro redundanță (dacă secțiunile ulterioare repetă materialul anterior); graf de argumentare (dacă afirmațiile sunt susținute corect de raționamentul anterior); izolare a citărilor (dacă citările sunt folosite superficial, fără a explica cum lucrările citate se raportează la lucrare sau la alte citări); exponare a figurilor (dacă figurile metodologice explică efectiv metoda); și gol de dovezi (dacă rezultatele raportate sunt susținute de exemple concrete).
Benchmark-ul a fost construit prin asocierea lucrărilor generate de IA cu lucrări umane comparabile/equivalente, lucrările IA fiind selectate din FARS și din competiția 2025 Agents4Science.
Pentru fiecare lucrare FARS generată de mașină, cercetătorii i-au căutat în citări o lucrare scrisă de oameni de același tip, acceptată la o conferință de top, și apoi au selectat cea mai apropiată potrivire din punct de vedere al subiectului de cercetare, obținând 143 de perechi. Lucrările Agents4Science au fost, de asemenea, asociate cu omologii scrise de oameni, generând alte 247 de perechi și aducând benchmark‑ul la în total 390 de perechi AI‑uman. Lucrările acoperă științele vieții, sociale și naturale, deși setul de date este ponderat puternic spre informatică.
Pentru metrici, performanța a fost evaluată utilizând PairAcc, care măsoară cât de des lucrarea umană este clasată peste omologul său AI; și AUROC, care evaluează separarea globală dintre lucrările umane și cele AI la diferite praguri. Autorii raportează, de asemenea, performanța de detectare când rata de fals‑pozitive pentru lucrările umane este fixată la 5%.
Teste
Testele inițiale au comparat SciSlop cu detectoarele de text AI Binoculars; DetectGPT; și NTS††, precum și cu sistemele de revizuire automate AI Scientist Reviewer și CycleReviewer.
Pentru testele de revizuire ulterioare, au fost utilizate patru linii de bază: promptare de bază; Claude Code; refinament bazat pe recenzent; și revizuire conștientă de slop. Primele trei au primit doar instrucțiuni generale pentru îmbunătățirea lucrării, în timp ce revizuirea conștientă de slop a primit în plus definițiile și locațiile slop‑ului detectat. Toate au fost comparate cu SciSlopHarness în condiții de revizuire echivalente.
Pentru implementare, detectoarele de text au primit proza lucrării, în timp ce celelalte metode au primit sursa lucrării și, unde era necesar, acces la codul acesteia. Binoculars a utilizat Falcon-7B pentru modele de bază și instruct; DetectGPT a folosit T5-3B pentru a genera 100 de perturbații; AI Scientist a utilizat Qwen2.5-32B-Instruct; și CycleReviewer a folosit punctul de control de 8B lansat. Pentru lucrările care depășeau limita de 2.048 de tokeni a lui Falcon, ferestrele ne‑suprapuse au fost evaluate separat și apoi mediate.
Rezultatele inițiale de detectare sunt detaliate în cele două tabele de mai jos: SciSlop a atins 85,9% PairAcc, comparativ cu 68,7% pentru Binoculars și 68,5% pentru cel mai performant recenzent automat, reducând rata de eroare cu peste jumătate:

Rezultatele de detectare comparând SciSlop cu detectoarele de text AI și recenzorii automați, alături de rezultatele pentru cele șase măsuri individuale de slop. SciSlop obține cel mai mare PairAcc global, în timp ce referințele de secțiune transversală oferă cel mai puternic rezultat individual.
Referințele de secțiune transversală au avut o performanță deosebit de puternică pe cont propriu, atingând 90,5% PairAcc fără a necesita un model și detectând 65% dintre lucrările generate de AI la o rată de fals‑pozitive de 5%, comparativ cu 24% pentru Binoculars.
Autorii susțin că aceste rezultate indică faptul că relațiile din cadrul lucrării furnizează un semnal mai puternic al generării AI decât detectarea convențională la nivel de text pe acest set de date, identificând totodată slăbiciuni specifice care ar putea fi ulterior vizate pentru revizuire.
Relația dintre slop‑ul științific și evaluările umane ale calității lucrării a fost examinată în continuare. După cum se arată în prima coloană de mai jos, un slop mai mare a fost asociat cu scoruri ICLR mai mici pentru evaluarea generală, soliditate, prezentare și contribuție:

Compararea SciSlop cu detectoarele de text AI și recenzorii automați în raport cu rezultatele revizuirilor ICLR. Panoul din stânga arată asemănarea cu AI în raport cu scorurile de revizie; centrul compară dimensiunile individuale ale reviziei; dreapta prezintă performanța în distingerea lucrărilor respinse de cele acceptate pe parcursul a nouă ani.
Lucrările respinse și cele acceptate au fost, de asemenea, diferențiate peste nivelul aleatoriu în toți cei nouă ani examinați, în timp ce detectoarele convenționale au înregistrat performanțe sub nivelul aleatoriu în majoritatea comparațiilor.
Prin urmare, s-a constatat că slop‑ul științific reflectă slăbiciuni deja penalizate de recenzorii umani, în loc să funcționeze exclusiv ca un semnal al autoratului AI.
Testele finale au examinat dacă SciSlopHarness ar putea elimina slop‑ul rămas după o revizuire mai generală. După cum se arată mai jos, harness‑ul a ajuns cel mai aproape de media umană pe toate cele șase măsuri, în timp ce revizuirea generală a lăsat adesea slop semnificativ, iar revizuirea directă conștientă de slop a corectat uneori excesiv:

Rezultatele reviziei comparând SciSlopHarness cu patru metode de referință pe cele șase măsuri de slop. Valorile mai apropiate de zero sunt mai apropiate de media lucrărilor umane, SciSlopHarness deplasându-se în general spre acest nivel, în timp ce revizia conștientă de slop depășește frecvent această valoare.
Fiecare modificare propusă a fost verificată în raport cu raționamentul științific al lucrării și dovezile de susținere, iar editările nejustificate au fost respinse. Pe cele șase măsuri, diferența rămasă față de lucrările scrise de oameni a fost redusă cu 63 % în comparație cu Claude Code, cea mai puternică bază de revizie.
Concluzie
A fost interesant, în timpul redactării acestui articol, să observ nu doar cât de slab a fost evaluat acestă lucrare pe propriul său site demo, ci și să identific cel puțin un exemplu de citare „leneșă” sau „cosmetic㔆†, care recent a devenit o mică, dar în creștere, blestem în lucrările de cercetare.
În astfel de cazuri, dincolo de această lucrare specifică, cercetătorii par să se bazeze pe propria lor cunoaștere în loc să interacționeze în mod semnificativ cu literatura existentă. Totuși, constrânși de convenție să „își arate munca”, citările sunt adesea furnizate cu ceea ce pare a fi nerăbdare, chiar dispreț față de proces, și deseori se bazează aparent pe cititor pentru a accepta un exces de referințe ca o „patină” suficientă de proveniență, deși una care nu ar rezista unei examinări riguroase.
Arxiv se opune industrializării depunerilor conduse de IA; dacă vor exista constrângeri similare privind implicarea directă a IA în cercetare, în absența unui dezastru conex de magnitudine suficientă, rămâne de văzut.
* Accenturile autorilor, nu ale mele – dar conversia mea, unde e necesar, a citărilor în linie ale autorilor în hyperlinkuri.
† Autorii nu susțin că nu au folosit IA în propria lor lucrare, și detaliază o astfel de utilizare.
†† Ar putea interesa cititorul să știe că a trebuit să caut eu însumi un link corect pentru cadrul NTS, deoarece linkul furnizat de autori nu era relevant – una dintre metricile pe care SciSlop le urmărește!
Publicat prima dată duminică, 4 octombrie 2026












