Andersons vinkel
Manglene ved Amazon Mechanical Turk kan true Natural Language Generation-systemer

En ny studie fra University of Massachusetts Amherst har sammenlignet engelsklærere med crowdsourced-arbeidere på Amazon Mechanical Turk i vurdering av output fra Natural Language Generation (NLG)-systemer, og konkluderte med at lavere standarder og “gaming” av prisvurderte oppgaver blant AMT-arbeidere kan hindre utviklingen av sektoren.
Rapporten kommer til en rekke kritiske konklusjoner om omfanget av hvilken “industriell” billig outsourcing av åpne NLG-evalueringoppgaver kan føre til dårligere resultater og algoritmer i denne sektoren.
Forskerne har også samlet en liste over 45 artikler om åpen tekstgenerering der forskningen har brukt AMT, og fant at “den overveldende majoriteten” ikke rapporterte kritiske detaljer om bruk av Amazons crowdservice, noe som gjør det vanskelig å gjenta artiklenes funn.
Sveitsisk arbeid
Rapporten retter kritikk mot både sveitsisk arbeid-naturen til Amazon Mechanical Turk og (sannsynligvis budsjett-begrensede) akademiske prosjekter som gir AMT ytterligere kredibilitet ved å bruke (og sitere) det som en gyldig og konsekvent forskningsressurs. Forfatterne bemerker:
‘Selv om AMT er en praktisk og rimelig løsning, observerer vi at høy variasjon mellom arbeidere, dårlig kalibrering og kognitivt krevende oppgaver kan føre forskere til å trekke misvisende vitenskapelige konklusjoner (f.eks. at menneskeskrevet tekst er “verre” enn GPT-2s).’
Rapporten skylder spillet heller enn spillerne, med forskerne observerer:
‘[Crowd] arbeidere blir ofte underbetalt for sin arbeidskraft, noe som skader både kvaliteten på forskningen og, viktigere, evnen til disse crowd-arbeiderne til å tjene en adekvat inntekt.’
Den artikkelen, med tittelen The Perils of Using Mechanical Turk to Evaluate Open-Ended Text Generation, konkluderer videre med at ‘ekspert-vurderere’ som språklærere og lingvister bør brukes til å vurdere åpne kunstige NLG-innhold, selv om AMT er billigere.
Testoppgaver
I sammenligning av AMT’s ytelse mot mindre tid-begrensede, ekspertlesere, brukte forskerne $144 på AMT-tjenestene som faktisk ble brukt i sammenligningstestene (selv om mye mer ble brukt på ‘ubrukbare’ resultater – se nedenfor), og krevde tilfeldige ‘Turks’ til å vurdere en av 200 tekster, delt mellom menneskeskrevet tekstinnhold og kunstig generert tekst.
Å gi profesjonelle lærere samme oppgave kostet $187,50, og bekreftet deres overlegne ytelse (i sammenligning med AMT-arbeidere) ved å ansette Upwork-frilansere til å gjenta oppgavene kostet ytterligere $262,50.
Hver oppgave bestod av fire vurderingskriterier: grammatikk (‘Hvor grammatisk korrekt er tekstens historiefragment?’); kohesjon (‘Hvor godt passer setningene i historiefragmentet sammen?’); likbarhet (‘Hvor morsomt finner du historiefragmentet?’); og relevans (‘Hvor relevant er historiefragmentet til prompten?’).
Generering av tekst
For å få NLG-materiale for testene, brukte forskerne Facebook AI Research’s 2018 Hierarchical Neural Story Generation dataset, som består av 303 358 engelske historier komponert av brukere på den svært populære (15 millioner+ brukere) r/writingprompts subreddit, hvor abonnenters historier er ‘sådd’ av enkeltsetninger ‘prompts’ på en lignende måte som nåværende praksis i tekst-til-bilde-generering – og, naturligvis, i åpen Natural Language Generation systemer.
200 prompts fra datasettet ble tilfeldig valgt og sendt gjennom en medium-størrelse GPT-2-modell ved hjelp av Hugging-Face Transformers bibliotek. Dermed ble to sett med resultater fått fra samme promptene: de menneskeskrevne diskursive essayer fra Reddit-brukere, og GPT-2-genererte tekster.
For å forhindre at samme AMT-arbeidere vurderte samme historie flere ganger, ble tre AMT-arbeider-vurderinger søkt per eksempel. Sammen med eksperimenter om engelsk språkferdighet blant arbeiderne (se slutten av artikkelen) og fjerning av resultater fra lav-innsats-arbeidere (se ‘Kort tid’ nedenfor), økte dette den totale utgiften til AMT til rundt $1 500 USD.
For å skape en jevn spillende bane, ble alle tester utført på ukedager mellom 11.00-11.30 PST.
Resultater og konklusjoner
Den omfattende studien dekker mye ground, men hovedpoengene er som følger:
Kort tid
Artikkelen fant at en offisiell Amazon-rapportert gjennomsnittlig oppgavetid på 360 sekunder ble redusert til en reell arbeidstid på bare 22 sekunder, og en median arbeidstid på kun 13 sekunder – en fjerdedel av tiden det tok den raskeste engelsklæreren å gjenta oppgaven.

Fra dag 2 av studien: de enkelte arbeiderne (i oransje) brukte merkbart mindre tid på å vurdere hver oppgave enn de bedre betalte lærerne, og (senere) de enda bedre betalte Upwork-kontraktorene. Kilde: https://arxiv.org/pdf/2109.06835.pdf
Siden AMT ikke setter noen begrensning på de menneskelige intelligensoppgaver (HIT) som en enkelt arbeider kan påta seg, har AMT “store spillere” oppstått, med (lønnsomme) rykter for å fullføre høye antall oppgaver per eksperiment. For å kompensere for aksepterte treff av samme arbeider, målte forskerne tiden mellom påfølgende innsendte HIT, sammenlignet start- og sluttiden for hver HIT. På denne måten kom forskjellen mellom AMT’s rapporterte WorkTimeInSeconds og den faktiske tiden brukt på oppgaven i fokus.
Siden slik arbeid ikke kan utføres i disse reduserte tidsrammene, måtte forskerne kompensere for dette:
‘Ettersom det er umulig å lese en paragraf-lang historie og vurdere alle fire egenskaper på så kort tid som 13 sekunder, måler vi effekten på gjennomsnittsvurderinger når vi fjerner arbeidere som bruker for lite tid per HIT…Spesifikt fjerner vi vurderinger fra arbeidere hvis median tid er under 40 sekunder (som er en lav terskel), og finner at i gjennomsnitt ca. 42% av våre vurderinger fjernes (varierer fra 20%-72% over alle eksperimenter).’
Artikkelen hevder at misrapportert faktisk arbeidstid i AMT er ‘en stor sak’ som vanligvis oversees av forskere som bruker tjenestene.
Håndtering nødvendig
Funnene tyder videre på at AMT-arbeidere ikke kan pålitelig skille mellom tekst skrevet av en menneske og tekst skrevet av en maskin, med mindre de ser begge tekstene side om side, noe som ville kompromittere en typisk vurderingsscenarie (hvor leseren skal kunne gjøre en vurdering basert på en enkelt tekstprøve, ‘ekte’ eller kunstig generert).
Kasuell aksept av lavkvalitets kunstig tekst
AMT-arbeidere vurderer konsekvent lavkvalitets GPT-basert kunstig tekst på lik linje med høykvalitets, koherent tekst skrevet av mennesker, i motsetning til engelsklærerne, som lett kunne skille kvalitetsforskjellen.
Ingen forberedelsestid, null kontekst
Å gå inn i riktig sinnstemning for en så abstrakt oppgave som vurdering av autentisitet kommer ikke naturlig; engelsklærere trengte 20 oppgaver for å kalibrere sine sanser til vurderingsmiljøet, mens AMT-arbeidere vanligvis får ingen ‘orienteringstid’ i det hele tatt, noe som senker kvaliteten på deres innputt.
Spill systemet
Rapporten hevder at den totale tiden AMT-arbeidere bruker på enkeltoppgaver er inflasjonert av arbeidere som aksepterer flere oppgaver samtidig, og kjører gjennom oppgavene i forskjellige faner i nettleseren, i stedet for å konsentrere seg om en oppgave for den registrerte oppgavetiden.
Opphavslands betydning
AMT’s standardinnstillinger filtrerer ikke arbeidere etter opphavsland, og rapporten bemerker tidligere arbeid som indikerer at AMT-arbeidere bruker VPN-er for å arbeide rundt geografiske begrensninger, og presenterer seg som native engelsktalende (i et system som, kanskje ganske naivt, liker en arbeiders morsmål med deres IP-baserte geografiske plassering).
Så forskerne kjørte vurderingstestene på AMT på nytt med filtre som begrensede potensielle takerne til ikke-engelsktalende land, og fant at ‘arbeidere fra ikke-engelsktalende land vurderer kohesjon, relevans og grammatikk…signifikant lavere enn likviderte arbeidere fra engelsktalende land’.
Rapporten konkluderer:
‘[Ekspert]vurderere som lingvister eller språklærere bør brukes når det er mulig, da de allerede er trent i å vurdere skrevet tekst, og det er ikke mye dyrere…’.
Publisert 16. september 2021 – Oppdatert 18. desember 2021: Lagt til kategorier












