Andersons hoek
AI-gegenereerde taal begint wetenschappelijke literatuur te verontreinigen

Onderzoekers uit Frankrijk en Rusland hebben een studie gepubliceerd waarin wordt aangetoond dat het gebruik van AI-gestuurde probabilistische tekstgeneratoren zoals GPT-3 ‘gemartelde taal’, citaten van niet-bestaande literatuur en ad hoc, ongecrediteerde hergebruik van afbeeldingen introduceert in eerder respectabele kanalen voor de publicatie van nieuwe wetenschappelijke literatuur.
Misschien wel het meest zorgwekkend is dat de onderzochte artikelen ook wetenschappelijk onnauwkeurige of niet-reproduceerbare inhoud bevatten, die wordt gepresenteerd als het resultaat van objectieve en systematische onderzoek, wat aangeeft dat generatieve taalmodellen niet alleen worden gebruikt om de beperkte Engelse vaardigheden van de auteurs te verbeteren, maar ook om het zware werk te doen (en dat meestal slecht).
Het rapport, getiteld Gemartelde frases: een twijfelachtige schrijfstijl in de wetenschap, is samengesteld door onderzoekers van de afdeling Computer Science van de Universiteit van Toulouse en Yandex-onderzoeker Alexander Magazinov, momenteel verbonden aan de Universiteit van Tel Aviv.
De studie richt zich met name op de groei van nonsensische AI-gegenereerde wetenschappelijke publicaties in het Elsevier-tijdschrift Microprocessors en Microsystems.
Andere benamingen
Autoregressieve taalmodellen zoals GPT-3 worden getraind op grote hoeveelheden data en zijn ontworpen om te parafraseren, samen te vatten, te combineren en te interpreteren van de bijdragende data in coherente generatieve taalmodellen die in staat zijn om natuurlijke spraak- en schrijfpatronen te reproduceren, terwijl ze de oorspronkelijke bedoeling van de trainingsdata behouden.
Sinds dergelijke kaders frequent worden gestraft tijdens de modeltrainingsfase voor het aanbieden van directe en ‘niet-opgenomen’ herhaling van de oorspronkelijke data, zoeken ze onvermijdelijk naar synoniemen – zelfs voor goed gevestigde frases.
De ogenschijnlijk AI-gegenereerde/ondersteunde wetenschappelijke inzendingen die door de onderzoekers zijn ontdekt, bevatten een buitengewoon aantal mislukte pogingen om creatieve synoniemen voor bekende frases in de machine learning-sector te vinden:
diepe neurale netwerk: ‘diepe neurale organisatie’
kunstmatig neurale netwerk: ‘(nep | valse) neurale organisatie’
mobiel netwerk: ‘veelzijdige organisatie’
netwerkaanval: ‘organisatie (overval | aanval)’
netwerkverbinding: ‘organisatie associatie’
big data: ‘(enorm | groot | immens | kolossaal) informatie’
datawarehouse: ‘informatie (magazijn | distributiecentrum)’
kunstmatige intelligentie (AI): ‘(nep | door de mens gemaakte) bewustzijn’
hoge prestatie computing: ‘elite berekening’
fog/mist/cloud computing: ‘nevel berekening’
graphics processing unit (GPU): ‘ontwerp voorbereidingsunit’
centrale verwerkingseenheid (CPU): ‘focale voorbereidingsunit’
werkstroommotor: ‘werkprocesmotor’
gezichtsherkenning: ‘gezichtserkenning’
spraaagherkenning: ‘discours erkenning’
gemiddelde kwadratische fout: ‘gemiddelde kwadratische (fout | blunder)’
gemiddelde absolute fout: ‘gemiddelde (absolute | opperste) (fout | blunder)’
signaal-ruis: ‘(beweging | vlag | indicator | teken | signaal) tot (geluid | opschudding | lawaai)’
globale parameters: ‘wereldwijde parameters’
willekeurige toegang: ‘(willekeurige | onregelmatige) toegang tot’
willekeurig bos: ‘(willekeurige | onregelmatige) (bos | wildernis | dicht land)’
willekeurige waarde: ‘(willekeurige | onregelmatige) waarde’
mierenkolonie: ‘ondergrondse insecten (staat | provincie | gebied | regio | nederzetting)’
mierenkolonie: ‘ondergrondse insecten (staat | provincie | gebied | regio | nederzetting)’
overgebleven energie: ‘overgebleven vitaliteit’
kinetische energie: ‘motorische vitaliteit’
naïeve Bayes: ‘(gelovige | onschuldige | goedgelovige) Bayes’
persoonlijke digitale assistent (PDA): ‘individuele geautomatiseerde medewerker’
In mei 2021 hebben de onderzoekers de Dimensions academische zoekmachine geraadpleegd op zoek naar dit soort verminkte, geautomatiseerde taal, waarbij ze ervoor zorgden dat ze legitieme frases zoals ‘enorme informatie’ (die een geldige frase is en geen mislukte synoniem voor ‘big data’) uitsloten. Op dat moment zagen ze dat Microprocessors en Microsystems het hoogste aantal voorkomens van verkeerd gehanteerde parafraseren had.
Op het moment is het nog steeds mogelijk om een aantal wetenschappelijke artikelen op te halen (archiefsnapshot, 15/07/2021) voor de nonsensfrase ‘diepe neurale organisatie’ (d.w.z. ‘diep neurale netwerk’), en andere in de bovenstaande lijst opleveren soortgelijke treffers.

Zoekresultaten voor ‘diepe neurale organisatie’ (‘diep neurale netwerk’) bij Dimensions. Bron: https://app.dimensions.ai/
Het Microprocessors-tijdschrift werd in 1976 opgericht en twee jaar later omgedoopt tot Microprocessors en Microsystems.
Groei van nonsensuele taal
De onderzoekers hebben een periode bestudeerd die loopt van februari 2018 tot juni 2021 en hebben een steile stijging gezien in het volume van inzendingen over de laatste twee jaar, en met name over de laatste 6-8 maanden;

Correlatie of oorzakelijkheid? De stijging in inzendingen voor het Microprocessors en Microsystems-tijdschrift lijkt samen te vallen met de groei van ‘nonsensuele’ tekst en synoniemen in ogenschijnlijk respectabele inzendingen. Bron: https://arxiv.org/pdf/2107.06751.pdf
De definitieve dataset die door de samenwerkers is verzameld, bevat 1.078 volledige artikelen die zijn verkregen via de Elsevier-abonnement van de Universiteit van Toulouse.
Afnemende redactionele toezicht voor Chinese wetenschappelijke artikelen
Het artikel stelt vast dat de tijd die is toegewezen voor de redactionele beoordeling van de geselectioneerde inzendingen drastisch wordt verkort in 2021, tot minder dan 40 dagen; een zesvoudige daling in de standaardtijd voor peer review, duidelijk vanaf februari 2021.
Het grootste aantal geselectioneerde artikelen komt van auteurs met affiliaties met het Chinese vasteland: van de 404 artikelen die zijn aanvaard in minder dan 30 dagen, zijn 97,5% gerelateerd aan China. Omgekeerd vertegenwoordigen China-geaffilieerde inzendingen in gevallen waar de redactionele procedure meer dan 40 dagen duurt (615 artikelen) slechts 9,5% van die categorie – een tien keer grotere onevenwichtigheid.
Het rapport wijt de infiltratie van de geselectioneerde artikelen aan tekortkomingen in het redactionele proces en een mogelijke gebrek aan middelen in het licht van een groeiend aantal inzendingen.
De onderzoekers vermoeden dat GPT-achtige generatieve modellen en soortgelijke typen taalgeneratiemodellen zijn gebruikt om een groot deel van de tekst in de geselectioneerde artikelen te produceren; echter maakt de manier waarop een generatief model zijn bronnen abstracteert het moeilijk om dit te bewijzen, en het belangrijkste bewijs ligt in een gezond verstandhouding van slechte en onnodige synoniemen en een zorgvuldige examinatie van de logische coherentie van de inzending.
De onderzoekers merken verder op dat de generatieve taalmodellen die zij denken dat bijdragen aan deze vloed van nonsens niet alleen in staat zijn om de problematische teksten te creëren, maar ook om ze systematisch te herkennen en te markeren, op dezelfde manier als de onderzoekers zelf hebben gedaan. Het artikel beschrijft een dergelijke implementatie, met behulp van GPT-2, en biedt een kader voor toekomstige systemen om problematische wetenschappelijke inzendingen te identificeren.
Het aantal ‘verontreinigde’ inzendingen is veel hoger in het Elsevier-tijdschrift (72,1%) in vergelijking met andere tijdschriften die zijn onderzocht (13,6% maximaal).
Niet alleen semantiek
De onderzoekers benadrukken dat veel van de tijdschriften in kwestie niet alleen de verkeerde taal gebruiken, maar ook wetenschappelijk onnauwkeurige uitspraken bevatten, wat aangeeft dat generatieve taalmodellen niet alleen worden gebruikt om de beperkte taalvaardigheden van de auteurs te verbeteren, maar mogelijk ook om ten minste enkele van de kerntheorieën en gegevens in het artikel te formuleren.
In andere gevallen vermoeden de onderzoekers een effectieve ‘hercompositie’ of ‘herinterpretatie’ van geabstraheerde (en superieure) eerdere werk, om te voldoen aan de druk van ‘publiceer of verdwijn’ in de academische onderzoekscultuur, en mogelijk om de nationale ranglijsten voor wereldwijde superioriteit in AI-onderzoek te verbeteren, door het volume.

Nonsensuele inhoud in een ingediend artikel. In dit geval hebben de onderzoekers ontdekt dat de tekst is afgeleid, ad hoc, van een EDN-artikel, waarvan de begeleidende illustratie ook zonder toewijzing is overgenomen. De herschrijving van de oorspronkelijke inhoud is zo extreem dat deze zinloos wordt.
Bij het analyseren van enkele van de ingediende Elsevier-artikelen vonden de onderzoekers zinnen waarvoor ze geen enkele betekenis konden afleiden; verwijzingen naar niet-bestaande literatuur; verwijzingen naar variabelen en theorieën in formules die niet daadwerkelijk in het ondersteunende materiaal voorkwamen (wat aangeeft dat taalgebaseerde abstractie, of ‘hallucinatie’ van ogenschijnlijk feitelijke gegevens); en hergebruik van afbeeldingen zonder enige erkenning van hun bron (wat de onderzoekers bekritiseren niet vanuit een auteursrechtelijk oogpunt, maar eerder als een indicator van onvoldoende wetenschappelijke zorgvuldigheid).
Citatiefouten
De citaten die bedoeld zijn om de argumenten in een wetenschappelijk artikel te ondersteunen, werden in veel van de geselectioneerde voorbeelden aangetroffen als ‘ofwel gebroken of leidend tot niet-gerelateerde publicaties’.
Bovendien bevatten verwijzingen naar ‘gerelateerd werk’ vaak auteurs die de onderzoekers vermoeden te zijn ‘gehallucineerd’ door een GPT-achtig systeem.
Afgeleide aandacht
Een ander tekortkoming van zelfs state-of-the-art taalmodellen zoals GPT-3 is hun neiging om de focus te verliezen over een lange discours. De onderzoekers vonden dat de geselectioneerde artikelen vaak een onderwerp aansneden dat nooit meer werd teruggekeerd naar na de initiële notities of elders.
Zij vermoeden ook dat sommige van de slechtste voorbeelden optreden door meerdere reizen van brontekst door een reeks vertaalmachines, waarbij elke vertaling de betekenis verder vertekent.
Bronnen en redenen
Bij het proberen te achterhalen wat achter dit fenomeen zit, suggereren de auteurs van het artikel een aantal mogelijkheden: dat inhoud van paper mills wordt gebruikt als bronmateriaal, waardoor onnauwkeurigheden worden geïntroduceerd vanaf het allereerste begin van een proces dat onvermijdelijk nog meer onnauwkeurigheden zal produceren; dat artikel-spinningtools zoals Spinbot worden gebruikt om plagiaat te maskeren; en dat de overweldigende druk om regelmatig te publiceren ertoe leidt dat onderbezette onderzoekers GPT-3-achtige systemen gebruiken om ofwel te verbeteren of geheel nieuwe wetenschappelijke artikelen te genereren.
De onderzoekers eindigen met een oproep tot actie voor meer toezicht en verbeterde normen in een gebied van academische publicatie dat blijkbaar voer wordt voor het eigen onderwerp – machine learning-systemen. Zij roepen ook Elsevier en andere uitgevers op om strengere selectie- en beoordelingsprocedures in te voeren en bekritiseren breed de huidige normen en praktijken op dit gebied, waarbij wordt gesuggereerd dat ‘misleiding met synthetische teksten de integriteit van de wetenschappelijke literatuur bedreigt.’ De onderzoekers eindigen met een oproep tot actie voor meer toezicht en verbeterde normen in een gebied van academische publicatie dat blijkbaar voer wordt voor het eigen onderwerp – machine learning-systemen. Zij roepen ook Elsevier en andere uitgevers op om strengere selectie- en beoordelingsprocedures in te voeren en bekritiseren breed de huidige normen en praktijken op dit gebied, waarbij wordt gesuggereerd dat ‘misleiding met synthetische teksten de integriteit van de wetenschappelijke literatuur bedreigt.’












