Andersons vinkel

De mangler ved Amazon Mechanical Turk kan true Natural Language Generation-systemer

mm
Føj Unite.AI til dine foretrukne kilder på Google

En ny undersøgelse fra University of Massachusetts Amherst har sat engelsklærere op imod crowdsourced-arbejdere på Amazon Mechanical Turk i vurdering af output fra Natural Language Generation (NLG)-systemer, og konkluderer, at lave standarder og ‘gaming’ af prisvindende opgaver blandt AMT-arbejdere kan hindre udviklingen af sektoren.

Rapporten kommer til en række kritiske konklusioner om, hvor langt ‘industri-mæssig’ billig udlicitering af åbne NLG-evalueringopgaver kan føre til ringe resultater og algoritmer i denne sektor.

Forskerne har også samlet en liste over 45 artikler om åben tekstgenerering, hvor forskningen havde anvendt AMT, og fandt, at ‘den overvældende majoritet’ ikke rapporterede kritiske detaljer om brugen af Amazon’s crowdservice, hvilket gjorde det svært at reproduceres artiklens resultater.

Sved-shop-arbejde

Rapporten retter kritik mod både sved-shop-karaktären af Amazon Mechanical Turk og de (sandsynligvis budget-begrænsede) akademiske projekter, der giver AMT yderligere troværdighed ved at bruge (og citerer) det som en gyldig og konsekvent forskningsressource. Forfatterne bemærker:

‘Selvom AMT er en praktisk og billig løsning, observerer vi, at høj variation mellem arbejdere, dårlig kalibrering og kognitivt krævende opgaver kan føre forskere til at trække misvisende videnskabelige konklusioner (f.eks. at menneskeskrevet tekst er “værre” end GPT-2’s).’

Rapporten skyder skylden på systemet snarere end på spillere, med forskerne observerer:

‘[Crowd] arbejdere bliver ofte underbetalt for deres arbejde, hvilket skader både kvaliteten af forskningen og, vigtigere, disse crowd-arbejdernes evne til at tjene en adequat indtægt.’

Den artikel, med titlen The Perils of Using Mechanical Turk to Evaluate Open-Ended Text Generation, konkluderer yderligere, at ‘ekspert-vurderere’ som sprog-lærere og lingvister skal bruges til at evaluere åben kunstig NLG-indhold, selvom AMT er billigere.

Testopgaver

I sammenligning af AMT’s præstation med mindre tidsbegrænsede, ekspert-læsere, brugte forskerne 144 dollar på AMT-tjenesterne, der faktisk blev brugt i sammenligningstestene (selvom meget mere blev brugt på ‘ubrugelige’ resultater – se nedenfor), og krævede, at tilfældige ‘Turks’ skulle evaluere en af 200 tekster, fordelt mellem menneskeskabt tekstindhold og kunstigt genereret tekst.

At bede professionelle lærere om at udføre det samme arbejde kostede 187,50 dollar, og bekræftede deres overlegne præstation (i forhold til AMT-arbejdere) ved at hyre Upwork-freelancere til at gentage opgaverne kostede yderligere 262,50 dollar.

Hver opgave bestod af fire evaluative kriterier: grammatik (‘Hvor grammatisk korrekt er teksten i historiefragmentet?’); kohærens (‘Hvor godt passer sætningerne i historiefragmentet sammen?’); behagelighed (‘Hvor behageligt finder du historiefragmentet?’); og relevans (‘Hvor relevant er historiefragmentet i forhold til prompten?’).

Generering af tekster

For at få NLG-materiale til testene brugte forskerne Facebook AI Research’s 2018 Hierarchical Neural Story Generation dataset, der består af 303.358 engelske historier skabt af brugere på den meget populære (15 millioner+ brugere) r/writingprompts subreddit, hvor brugernes historier er ‘sået’ med enkelt-sætnings-‘prompts’ på en lignende måde som nuværende praksis i tekst-til-billede-generering – og, naturligvis, i åben Natural Language Generation systemer.

200 prompts fra datasettet blev tilfældigt valgt og passeret gennem en medium-størrelse GPT-2-model ved hjælp af Hugging-Face Transformers bibliotek. Derved blev to sæt resultater opnået fra de samme prompts: de menneskeskrevne diskursive essays fra Reddit-brugere og GPT-2-genererede tekster.

For at forhindre, at de samme AMT-arbejdere bedømmer det samme historiefragment flere gange, blev tre AMT-arbejder-bedømmelser anmodet per eksempel. Sammen med eksperimenter omkring de engelske sprogfærdigheder hos arbejderne (se slutningen af artiklen) og diskontering af resultater fra lav-indsatte arbejdere (se ‘Kort tid’ nedenfor), øgede dette den samlede udgift på AMT til omkring 1.500 dollar USD.

For at skabe en lige spillende grund blev alle test udført på hverdage mellem 11.00-11.30 PST.

Resultater og konklusioner

Den omfattende undersøgelse dækker meget ground, men de vigtigste punkter er følgende:

Kort tid

Artiklen fandt, at en officiel Amazon-rapporteret gennemsnitlig opgave-tid på 360 sekunder blev reduceret til en reel arbejdstid på kun 22 sekunder, og en median arbejdstid på kun 13 sekunder – en fjerdedel af den tid, det hurtigste engelsk-lærer tog til at gentage opgaven.

Fra dag 2 af undersøgelsen: de enkelte arbejdere (i orange) brugte bemærkelsesværdigt mindre tid på at evaluere hver opgave end de bedre betalte lærere og (senere) de endnu bedre betalte Upwork-kontrahenter. Kilde: https://arxiv.org/pdf/2109.06835.pdf

Fra dag 2 af undersøgelsen: de enkelte arbejdere (i orange) brugte bemærkelsesværdigt mindre tid på at evaluere hver opgave end de bedre betalte lærere og (senere) de endnu bedre betalte Upwork-kontrahenter. Kilde: https://arxiv.org/pdf/2109.06835.pdf

Da AMT ikke pålægger nogen begrænsning på de Human Intelligence Tasks (HITs), der kan påtages af en enkelt arbejder, er AMT ‘big hitters’ dukket op, med (profitable) rygte for at fuldføre høje antal opgaver pr. eksperiment. For at kompensere for accepterede hits af samme arbejder målte forskerne tiden mellem pågående indsendte HITs, sammenlignende start- og slut-tidspunkt for hver HIT. Derved kom forskellen mellem AMT’s rapporterede WorkTimeInSeconds og den faktiske tid brugt på opgaven i fokus.

Da sådant arbejde ikke kan udføres i disse reducerede tidsrammer, måtte forskerne kompensere for dette:

‘Da det er umuligt at læse en paragraf-længde historie og vurder alle fire egenskaber på kun 13 sekunder, måler vi effekten på gennemsnitsvurderinger, når vi filterer ud arbejdere, der bruger for lidt tid pr. HIT… Specifikt fjerner vi vurderinger fra arbejdere, hvis median tid er under 40 sekunder (hvilket er en lav grænse), og finder, at i gennemsnit omkring 42% af vores vurderinger fjernes (varierende fra 20%-72% over alle eksperimenter).’

Artiklen påstår, at misrapporteret reel arbejdstid i AMT er ‘en stor problem’ typisk overset af forskere, der bruger tjenesten.

Hånd-holdning nødvendig

Forskningens resultater antyder yderligere, at AMT-arbejdere ikke kan pålideligt skelne mellem tekst skrevet af et menneske og tekst skrevet af en maskine, medmindre de ser begge tekster side om side, hvilket ville kompromittere en typisk evalueringsscenarie (hvor læseren skal kunne træffe en vurdering baseret på en enkelt tekstprøve, ‘ægte’ eller kunstigt genereret).

Kvalitetsløs accept af lavkvalitets kunstig tekst

AMT-arbejdere vurderede konsekvent lavkvalitets GPT-baseret kunstig tekst på samme niveau som højere kvalitets, koherente tekster skrevet af mennesker, i modsætning til de engelske lærere, der let kunne skelne forskellen i kvalitet.

Ingen forberedelsestid, nul kontekst

At komme i den rette sindstilstand for en så abstrakt opgave som vurdering af ægthed kommer ikke naturligt; engelske lærere krævede 20 opgaver for at kalibrere deres sanser til vurderingsmiljøet, mens AMT-arbejdere typisk fik ingen ‘orienteringstid’ overhovedet, hvilket reducerede kvaliteten af deres input.

At spille systemet

Rapporten fastholder, at den samlede tid AMT-arbejdere bruger på enkelt-opgaver er forhøjet af arbejdere, der accepterer multiple opgaver samtidigt og løber gennem opgaverne i forskellige faneblade på deres browsere, i stedet for at koncentrere sig om en opgave for den registrerede opgavevarighed.

Land af oprindelse er vigtigt

AMT’s standardindstillinger filtrerer ikke arbejdere efter land af oprindelse, og rapporten bemærker tidligere arbejde, der angiver, at AMT-arbejdere bruger VPN’er til at arbejde omkring geografiske begrænsninger, hvilket giver ikke-moderne talere mulighed for at præsentere sig som moderne talere (i et system, der måske naivt ligner en arbejders modersmål med deres IP-baserede geografiske placering).

Derfor genkørte forskerne vurderingstestene på AMT med filtre, der begrænsede potentielle deltagere til ikke-engelsktalende lande, og fandt, at ‘arbejdere fra ikke-engelsktalende lande vurderede kohærens, relevans og grammatik… signifikant lavere end identisk kvalificerede arbejdere fra engelsktalende lande’.

Rapporten konkluderer:

‘[Ekspert] vurderere som lingvister eller sprog-lærere skal bruges, når det er muligt, da de allerede er trænet til at evaluere skrevet tekst, og det er ikke meget dyrere…’.

 

Udgivet 16. september 2021Opdateret 18. december 2021: Tilføjet tags

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai