Andersons vinkel

AI-generert språk begynner å forurensa vitenskapelig litteratur

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Forskere fra Frankrike og Russland har publisert en studie som indikerer at bruk av AI-drevne probabilistiske tekstgenereringer som GPT-3 introduserer “pint språk”, sitater av ikke-eksisterende litteratur og ad hoc, ukreditert gjenbruk av bilder i tidligere respektable kanaler for publisering av ny vitenskapelig litteratur.

Kanskje det mest bekymringsverdige er at artiklene som er studert også inneholder vitenskapelig uriktige eller ikke-reproduserbare innhold presentert som resultater av objektiv og systematisk forskning, noe som indikerer at generative språkmodeller brukes ikke bare til å støtte begrensede engelske ferdigheter hos artiklenes forfattere, men faktisk til å gjøre den harde arbeidet (og, uunngåelig, til å gjøre det dårlig).

Rapporten, som har tittelen Pinte fraser: En tvilsom skrivestil som oppstår i vitenskapen, er samlet av forskere fra Computer Science Department ved University of Toulouse og Yandex-forsker Alexander Magazinov, nå ved Tel Aviv University.

Studien fokuserer spesielt på veksten av meningsløse AI-genererte vitenskapelige publikasjoner i Elsevier-tidsskriftet Mikroprosessorer og mikrosystemer.

Under et annet navn

Autoregressive språkmodeller som GPT-3 er trenet på store mengder data og er designet til å parafrasere, summerere, samle og tolke den bidragende datamen til kohesive generative språkmodeller som kan reproducere naturlig tale- og skrivemønster, samtidig som de beholder den opprinnelige intensjonen bak treningsdataene.

Siden slike rammeverk ofte straffes i modelltreningstadiet for å tilby direkte og “ikke-absorbert” regurgitasjon av den opprinnelige datamen, søker de uunngåelig etter synonyme ord – selv for etablerte fraser.

De åpenbart AI-skapt/assistede vitenskapelige innleveringene som forskerne har avdekket, inkluderer et ekstraordinært høyt antall mislykkede forsøk på å finne kreative synonyme ord for kjente fraser i maskinlæringssektoren:

dyp neuronalt nettverk: ‘dypt neuronalt organisasjon’
kunstig neuronalt nettverk: ‘(falsk | kunstig) neuronalt organisasjon’
mobil nettverk: ‘variabel organisasjon’
nettverksangrep: ‘organisasjon (overfall | angrep)’
nettverksforbindelse: ‘organisasjonsforbindelse’
stor data: ‘(enorm | stor | enorm | kolossal) informasjon’
datahus: ‘informasjon (lager | distribusjonssenter)’
kunstig intelligens (AI): ‘(falsk | menneskeskapt) bevissthet’
høy-ytelses databehandling: ‘eliteregning’
sky/tåke/sky databehandling: ‘disregning’
grafikkprosessor (GPU): ‘design som forbereder enhet’
sentral prosessor (CPU): ‘fokus som forbereder enhet’
arbeidsflyt motor: ‘arbeidsprosess motor’
ansiktsgjenkjenning: ‘ansiktsbekreftelse’
talegjenkjenning: ‘diskursbekreftelse’
gjennomsnittlig kvadratisk feil: ‘gjennomsnittlig kvadratisk (feil | tabbe)’
gjennomsnittlig absolutt feil: ‘gjennomsnittlig (absolutt | suprem) (feil | tabbe)’
signal til støy: ‘(bevegelse | flagg | indikator | tegn | signal) til (larm | forstyrrelse | støy)’
globale parametre: ‘verdensomspennende parametre’
tilfeldig tilgang: ‘(tilfeldig | uregelmessig) adgang’
tilfeldig skog: ‘(tilfeldig | uregelmessig) (skog | terreng | område)’
tilfeldig verdi: ‘(tilfeldig | uregelmessig) verdi’
maurkoloni: ‘underjordisk insekt (stat | provins | område | region | bosetting)’
maurkoloni: ‘underjordisk krypdyr (stat | provins | område | region | bosetting)’
gjenværende energi: ‘gjenværende kraft’
kinetisk energi: ‘bevegelseskraft’
naiv Bayes: ‘(troende | uskyldig | lett troende) Bayes’
personlig digital assistent (PDA): ‘individuell datamaskinassistent’

I mai 2021 spurte forskerne Dimensions akademiske søkemotor etter denne typen forvrengt, automatisert språk, og tok vare på å ekskludere gyldige fraser som “enorm informasjon” (som er en gyldig frase, og ikke en mislykt synonym for “stor data”). På dette tidspunktet observerte de at Mikroprosessorer og mikrosystemer hadde det høyeste antallet forekomster av mishandlet parafrasering.

For tiden er det fortsatt mulig å hente (arkivsnapshot, 15/07/2021) en rekke vitenskapelige artikler for det meningsløse uttrykket “dypt neuronalt organisasjon” (dvs. “dyp neuronalt nettverk”), og andre i listen over gir lignende treff.

Søkeresultater for 'dypt neuronalt organisasjon' ('dyp neuronalt nettverk') i Dimensions. Kilde: https://app.dimensions.ai/

Søkeresultater for ‘dypt neuronalt organisasjon’ (‘dyp neuronalt nettverk’) i Dimensions. Kilde: https://app.dimensions.ai/

Tidsskriftet Mikroprosessorer ble grunnlagt i 1976 og omdøpt til Mikroprosessorer og mikrosystemer to år senere.

Vekst av meningsløst språk

Forskere studerte en periode som dekket februar 2018 til juni 2021, og observerte en bratt økning i volumet av innleveringer over de siste to årene, og spesielt over de siste 6-8 månedene:

Korrelasjon eller årsak? Økningen i innleveringer til tidsskriftet Mikroprosessorer og mikrosystemer synes å sammenfalle med veksten av 'meningsløst' tekst og synonyme i åpenbart respektable innleveringer. Kilde: https://arxiv.org/pdf/2107.06751.pdf

Korrelasjon eller årsak? Økningen i innleveringer til tidsskriftet Mikroprosessorer og mikrosystemer synes å sammenfalle med veksten av ‘meningsløst’ tekst og synonyme i åpenbart respektable innleveringer. Kilde: https://arxiv.org/pdf/2107.06751.pdf

Den endelige datasetten som er samlet av samarbeidspartnerne, inneholder 1 078 fullstendige artikler som er hentet via Elseviers abonnement ved University of Toulouse.

Diminering redaksjonell tilsyn for kinesiske vitenskapelige artikler

Rapporten observerer at tidsperioden som er allokeret for redaksjonell vurdering av de merkte innleveringene, blir radikalt forkortet i 2021, og faller til under 40 dager; en seksdobling av standardtiden for fagfellevurdering, som er tydelig fra februar 2021.

Det største antallet merkte artikler kommer fra forfattere med tilknytning til Fastlands-Kina: av 404 artikler som er akseptert på under 30 dager, er 97,5 % Kina-relatert. Omvendt, i tilfeller hvor redaksjonsprosessen overstiger 40 dager (615 artikler), utgjør Kina-tilknyttede innleveringer bare 9,5 % av denne kategorien – en tidobling av ubalansen.

Rapporten tilskriver innfiltreringen av de merkte artiklene til mangler i redaksjonsprosessen, og en mulig mangel på ressurser i møte med en økende mengde innleveringer.

Forskere hypotetiserer at GPT-liknende generative modeller, og lignende typer språkgenereringsrammeverk, har vært brukt til å produsere mye av teksten i de merkte artiklene; men måten en generativ modell abstraherer sine kilder gjør det vanskelig å bevise, og hovedbeviset ligger i en sunn fornuftsvurdering av dårlige og unødvendige synonyme ord, og en nøye undersøkelse av innleveringens logiske konsistens.

Forskere observerer videre at de generative språkmodellene som de mener bidrar til denne flommen av meningsløst språk, er i stand til ikke bare å skape de problematiske tekstene, men også å gjenkjenne og merke dem systematisk, på samme måte som forskerne selv har gjort manuelt. Arbeidet detaljerer en slik implementering, som bruker GPT-2, og tilbyr et rammeverk for fremtidige systemer til å identifisere problematiske vitenskapelige innleveringer.

Forekomsten av “forurensede” innleveringer er mye høyere i Elsevier-tidsskriftet (72,1 %) sammenlignet med andre tidsskrifter som er studert (13,6 % maks).

Ikke bare semantikk

Forskere betoner at mange av tidsskriftene i question ikke bare bruker feil språk, men inneholder vitenskapelig uriktige utsagn, noe som indikerer at generative språkmodeller ikke bare brukes til å forbedre begrensede språkferdigheter hos bidragsyterne, men kan faktisk brukes til å formulere minst noen av de grunnleggende teoremene og dataene i artikkelen.

I andre tilfeller antyder forskere en effektiv “resyntese” eller “spinning” av abstrahert (og overlegen) tidligere arbeid, for å møte presset fra “publisér eller dør” akademiske forskningskulturer, og muligens for å forbedre nasjonale rangeringer for globalt fremtredenhet i AI-forskning, gjennom ren volum.

Meningsløst innhold i en innlevering. I dette tilfelle fant forskerne at teksten var avledet ad hoc fra en EDN-artikkel, hvor den tilhørende illustrasjonen også var lånt uten attribusjon. Omformuleringen av den opprinnelige teksten er så ekstrem at den blir meningsløs.

Meningsløst innhold i en innlevering. I dette tilfelle fant forskerne at teksten var avledet ad hoc fra en EDN-artikkel, hvor den tilhørende illustrasjonen også var lånt uten attribusjon. Omformuleringen av den opprinnelige teksten er så ekstrem at den blir meningsløs.

Ved å analysere flere av de innleverte Elsevier-artiklene, fant forskerne setninger som de ikke kunne tolke noen mening fra; referanser til ikke-eksisterende litteratur; referanser til variabler og teorem i formeler som ikke faktisk fantes i støtte materialet (hvorpå det antydes språkbasert abstraksjon, eller “hallusinering” av åpenbart faktiske data); og gjenbruk av bilder uten noen form for kildeangivelse (som forskerne kritiserte ikke fra et opphavsrettslig synspunkt, men snarere som en indikator på manglende vitenskapelig stringens).

Sitatsvikt

Sitater som er ment å støtte argumentene i en vitenskapelig artikkel, ble funnet i mange av de merkte eksemplene å være “enten brutt eller ledende til ubeslektede publikasjoner”.

I tillegg inkluderer referanser til “relatert arbeid” ofte forfattere som forskerne mener har blitt “hallusinert” av et GPT-liknende system.

Vandrende oppmerksomhet

En annen svakhet ved selv de mest avanserte språkmodellene som GPT-3, er deres tendens til å miste fokus over en lang diskurs. Forskere fant at de merkte artiklene ofte tar opp et tema tidlig i artikkelen som aldri blir returnert til etter at det først er nevnt i innledende notater eller andre steder.

De teoriserer også at noen av de verste eksemplene skjer gjennom multiple reiser av kilde teksten gjennom en rekke oversettelsesmotorer, hver av dem forvrer meningen ytterligere.

Kilder og årsaker

I forsøket på å avgjøre hva som ligger bak dette fenomenet, foreslår rapportens forfattere en rekke muligheter: at innhold fra “paper mills” brukes som kilde materiale, og introduserer uriktigheter svært tidlig i en prosess som vil uunngåelig produsere ytterligere uriktigheter; at artikkel-spinning-verktøy som Spinbot brukes til å maskere plagiat; og at presset på å publisere regelmessig fører underresurserte forskere til å bruke GPT-3-liknende systemer til å enten supplere eller helt generere nye akademiske artikler.

Forskere avslutter med en oppfordring til handling for økt tilsyn og forbedrede standarder i et område av akademisk publisering som synes å bli føde for eget emne – maskinlæringsystemer. De oppfordrer også Elsevier og andre forlag til å innføre mer rigorous skjerming og gjennomgangsprosedyrer, og kritiserte bredt gjeldende standarder og praksis i denne sammenhengen, og foreslo at “bedrag med syntetiske tekster truer integriteten til den vitenskapelige litteraturen”.

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai