Andersons vinkel

AI-baserede generative skrive-modeller kopierer ofte “copy and paste” kilde-data

mm
Føj Unite.AI til dine foretrukne kilder på Google

Amerikansk dramatiker og iværksætter Wilson Mizner citeres ofte for at sige ‘Når du stjæler fra en forfatter, er det plagiarism; hvis du stjæler fra mange, er det research’.

Ligeledes er antagelsen omkring den nye generation af AI-baserede kreative skrive-systemer, at de vældige mængder af data, der fødes til dem under træningsstadiet, har resulteret i en ægte abstraktion af højt niveau koncepter og ideer; at disse systemer har til rådighed den destillerede visdom af tusinder af bidragende forfattere, som AI kan formulere innovative og originale skrifter; og at dem, der bruger sådanne systemer, kan være sikre på, at de ikke ufrivilligt deltager i plagiarism-by-proxy.

Det er en antagelse, der udfordres af en ny rapport fra et forskningskonsortium (herunder Facebook og Microsofts AI-forskningsafdelinger), som har fundet, at maskinlærings-generative sprogmodeller som GPT-serien ‘occasionally copy even very long passages’ i deres påståede originale output, uden attribution.

I visse tilfælde vil GPT-2 duplikere over 1.000 ord fra træningsmængden i dens output.

Den rapport er titlen How much do language models copy from their training data? Evaluating linguistic novelty in text generation using RAVEN, og er et samarbejde mellem Johns Hopkins University, Microsoft Research, New York University og Facebook AI Research.

RAVEN

Studiet bruger en ny tilgang kaldet RAVEN (RAtingVErbalNovelty), et akronym, der er underholdende torteret for at reflektere den fuglelige skurk i et klassisk digt:

‘Dette akronym henviser til “The Raven” af Edgar Allan Poe, hvor fortælleren møder en mystisk ravn, der gentager “Nevermore!” Fortælleren kan ikke sige, om ravnen blot gentager noget, den har hørt en menneske sige, eller om den konstruerer sine egne udsagn (måske ved at kombinere never og more)—den samme grundlæggende tvetydighed, som vores rapport behandler.’

Fundene fra den nye rapport kommer i sammenhæng med en stor vækst for AI-indholdsskrivningssystemer, der søger at erstatte ‘simple’ redigeringstasks, og endda til at skrive fuldlængde-indhold. Et sådant system modtog $21 millioner i serie A-finansiering tidligere på ugen.

Forskerne bemærker, at ‘GPT-2 af og til duplikerer træningspassager, der er over 1.000 ord lange. (deres fremhævelse), og at generative sprogsystemer propagerer lingvistiske fejl i kilde-data.

Sprogmodellerne, der blev studeret under RAVEN, var GPT-serien af udgaver op til GPT-2 (forfatterne havde ikke adgang til GPT-3 på det tidspunkt), en Transformer, Transformer-XL og en LSTM.

Nyhed

Rapporten bemærker, at GPT-2 opfinder Bush 2-stil inflekter som ‘Swissified’, og afledninger som ‘IKEA-ness’, og skaber sådanne nye ord (de optræder ikke i GPT-2’s træningsdata) på lingvistiske principper, der er afledt fra højdimensionelle rum, der er etableret under træning.

Resultaterne viser også, at ‘74% af sætninger, der er genereret af Transformer-XL, har en syntaktisk struktur, som ingen træningssætning har’, hvilket, som forfatterne siger, ‘neurale sprogmodeller ikke blot husker; i stedet bruger de produktive processer, der tillader dem at kombinere velkendte dele på nye måder.’

Så teknisk set skal generalisering og abstraktion produces innovative og nye tekster.

Data-Duplikation Kan Være Problemet

Rapporten teoriserer, at lange og ordret citeringer, der er produceret af Natural Language Generation (NLG)-systemer, kan blive ‘bagt’ hele ind i AI-modellen, fordi den oprindelige kilde-tekst er gentaget flere gange i datasæt, der ikke er blevet tilstrækkeligt de-duplikeret.

Selv om et andet forskningsprojekt har fundet, at komplet duplikation af tekst kan optræde, selv om kilde-teksten kun optræder én gang i datasættet, bemærker forfatterne, at projektet har en anden konceptuel arkitektur end den almindelige række af indholdsgenererende AI-systemer.

Forfatterne bemærker også, at ændring af dekodningskomponenten i sproggenererings-systemer kan øge nytænkning, men fandt i tests, at dette sker på bekostning af outputkvalitet.

Yderligere problemer opstår, når datasættene, der driver indholdsgenereringsalgoritmer, bliver større og større. Ud over at forværre problemer omkring datapræprocessingens omkostning og gennemførlighed samt kvalitetssikring og de-duplikation af data, er mange grundlæggende fejl i kilde-data, som derefter bliver propageret i indholdet, der er produceret af AI.

Forfatterne bemærker*:

‘Seneste øgninger i træningsmængder gør det særligt kritisk at kontrollere nytænkning, fordi størrelsen af disse træningsmængder kan bryde vores intuitioner om, hvad der kan forventes at optræde naturligt. For eksempel afhænger nogle bemærkelsesværdige arbejder i sprog erhvervelse af antagelsen, at regelmæssige fortidige former af uregelmæssige verber (f.eks. becomed, teached) ikke optræder i en lærers erfaring, så hvis en lærer producerer sådanne ord, må de være nye for læreren.

‘Men det viser sig, at for alle 92 grundlæggende uregelmæssige verber på engelsk optræder den forkerte regelmæssige form i GPT-2’s træningsmængde.’

Mere Data-Curation Er Nødvendigt

Rapporten fastslår, at der skal lægges mere opmærksomhed på nytænkning i formuleringen af generative sprog-systemer, med en særlig vægt på sikring af, at den ‘værdige’ testdel af data (den del af kilde-data, der er sat til side for at teste, hvor godt den endelige algoritme har vurderet den primære træningsdata) er egnet til opgaven.

‘I maskinlæring er det kritisk at evaluere modeller på en værdig testmængde. Pga. den åbne natur af tekstgenerering kan en models genererede tekst være kopieret fra træningsmængden, i hvilket tilfælde den ikke er værdig—så brug af den data til at evaluere modellen (f.eks. for kohærens eller grammatik) er ikke gyldig.’

Forfatterne fastslår også, at mere omhu er nødvendig i produktionen af sprogmodeller på grund af Eliza-effekten, en syndrom, der blev identificeret i 1966, som identificerede “menneskers tilbøjelighed til at læse langt mere forståelse end berettiget ind i streng af symboler—specielt ord—strængt sammen af computere”.

 

* Min konvertering af inline-citationer til hyperlinks

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai