Andersons vinkel

Bristerna i Amazon Mechanical Turk kan hota system för naturlig språkgenerering

mm
Lägg till Unite.AI bland dina föredragna källor på Google

En ny studie från University of Massachusetts Amherst har jämfört engelsklärare med crowdsourcade arbetare på Amazon Mechanical Turk i utvärdering av utdata från system för naturlig språkgenerering (NLG), och kommit fram till att låga standarder och “gaming” av uppgifter bland AMT-arbetare kan hämma utvecklingen av sektorn.

Rapporten kommer fram till flera fördömande slutsatser om den utsträckning till vilken den “industriella” billiga utkontrakteringen av öppna NLG-utvärderingsuppgifter kan leda till undermåliga resultat och algoritmer i denna sektor.

Forskarna har också sammanställt en lista på 45 artiklar om öppen textgenerering där forskningen har använt AMT, och funnit att “den överväldigande majoriteten” inte rapporterade kritiska detaljer om användningen av Amazons crowdservicetjänst, vilket gör det svårt att reproducera artiklarnas resultat.

Svettshopparbete

Rapporten riktar kritik mot både svettshoppsnaturen hos Amazon Mechanical Turk och de (sannolikt budgetbegränsade) akademiska projekten som ger AMT ytterligare trovärdighet genom att använda (och citera) det som en giltig och konsekvent forskningsresurs. Författarna noterar:

‘Medan AMT är en bekväm och prisvärd lösning, observerar vi att hög varians mellan arbetare, dålig kalibrering och kognitivt krävande uppgifter kan leda forskare till vilseledande vetenskapliga slutsatser (t.ex. att människoskriven text är “sämre” än GPT-2:s).’

Rapporten skyller på systemet snarare än spelarna, med forskarna som observerar:

‘[Crowd]arbetare är ofta underbetalda för sitt arbete, vilket skadar både forskningskvaliteten och, viktigare, förmågan hos dessa crowdarbetare att tjäna en skälig levnad.’

Den artikeln, med titeln Farorna med att använda Mechanical Turk för att utvärdera öppen textgenerering, slutsatsar vidare att “expertrattare” som språklärare och lingvister bör användas för att utvärdera öppen artificiell NLG-innehåll, även om AMT är billigare.

Testuppgifter

I jämförelse med AMT:s prestation mot mindre tidsbegränsade, expertrattare, spenderade forskarna 144 dollar på AMT-tjänsterna som faktiskt användes i jämförelsetesterna (även om mycket mer spenderades på “icke-användbara” resultat – se nedan), och krävde slumpmässiga “Turks” för att utvärdera en av 200 texter, uppdelade mellan människoskapad text och artificiellt genererad text.

Att ge professionella lärare samma uppgift kostade 187,50 dollar, och bekräftade deras överlägsna prestation (jämfört med AMT-arbetare) genom att anställa Upwork-freelancers för att replikera uppgifterna kostade ytterligare 262,50 dollar.

Varje uppgift bestod av fyra utvärderingskriterier: grammatik (‘Hur grammatiskt korrekt är texten i berättelsens fragment?’); sammanhang (‘Hur väl passar meningarna i berättelsens fragment ihop?’); tyckbarhet (‘Hur njutbar tycker du att berättelsens fragment är?’); och relevans (‘Hur relevant är berättelsens fragment till prompten?’).

Generering av texter

För att få NLG-material för testerna använde forskarna Facebook AI Researchs 2018 Hierarchical Neural Story Generation dataset, som består av 303 358 engelska berättelser skapade av användare på den mycket populära (15 miljoner+ användare) r/writingprompts subreddit, där användarnas berättelser “sås” med enskilda meningars “prompt” på ett sätt som liknar nuvarande metoder i text-till-bild-generering – och, naturligtvis, i öppen naturlig språkgenerering system.

200 prompt från datasetet valdes slumpmässigt och passerades genom en medelstor GPT-2-modell med hjälp av Hugging-Face Transformers bibliotek. Således erhölls två uppsättningar resultat från samma prompt: de människoskapade diskursiva essäerna från Reddit-användare och GPT-2-genererade texter.

För att förhindra att samma AMT-arbetare bedömer samma berättelse flera gånger, begärdes tre AMT-arbetarbedömningar per exempel. Tillsammans med experiment om de engelska språkfärdigheterna hos arbetarna (se slutet av artikeln) och diskontering av resultat från låginsatsarbetare (se “Kort tid” nedan), ökade detta den totala utgiften för AMT till cirka 1 500 dollar.

För att skapa en jämn spelplan genomfördes alla tester på vardagar mellan 11.00-11.30 PST.

Resultat och slutsatser

Den omfattande studien täcker mycket mark, men de viktigaste punkterna är följande:

Kort tid

Artikeln fann att den officiellt rapporterade genomsnittliga uppgiftstiden på 360 sekunder motsvarade en verklig arbetstid på bara 22 sekunder, och en medianarbetstid på bara 13 sekunder – en fjärdedel av den tid som den snabbaste engelska läraren tog på sig uppgiften.

Från dag 2 av studien: de enskilda arbetarna (i orange) tillbringade betydligt mindre tid på att utvärdera varje uppgift än de bättre betalda lärarna, och (senare) de ännu bättre betalda Upwork-kontraktarna. Källa: https://arxiv.org/pdf/2109.06835.pdf

Från dag 2 av studien: de enskilda arbetarna (i orange) tillbringade betydligt mindre tid på att utvärdera varje uppgift än de bättre betalda lärarna, och (senare) de ännu bättre betalda Upwork-kontraktarna. Källa: https://arxiv.org/pdf/2109.06835.pdf

Eftersom AMT inte har någon gräns för de mänskliga intelligensuppgifter (HIT) som en enskild arbetare kan ta på sig, har AMT-“stjärnor” dykt upp, med (lönsamma) rykten för att slutföra höga antal uppgifter per experiment. För att kompensera för accepterade träffar av samma arbetare, mätte forskarna tiden mellan på varandra följande inskickade HIT, och jämförde start- och sluttiden för varje HIT. På detta sätt kom bristen mellan AMT:s rapporterade WorkTimeInSeconds och den faktiska tiden som spenderades på uppgiften i fokus.

Eftersom ett sådant arbete inte kan utföras inom dessa reducerade tidsramar, var forskarna tvungna att kompensera för detta:

‘Eftersom det är omöjligt att noggrant läsa en paragraf-lång berättelse och utvärdera alla fyra egenskaper på så lite som 13 sekunder, mäter vi effekten på genomsnittliga betyg när vi filtrerar bort arbetare som tillbringar för lite tid per HIT…Specifikt tar vi bort bedömningar från arbetare vars median tid är under 40 sekunder (vilket är en låg ribba), och hittar att i genomsnitt cirka 42% av våra betyg filtreras bort (varierar från 20%-72% över alla experiment).’

Artikeln hävdar att felaktigt rapporterad faktisk arbetstid i AMT är “en stor fråga” som vanligtvis förbises av forskare som använder tjänsterna.

Hand-holding nödvändig

Resultaten tyder vidare på att AMT-arbetare inte kan tillförlitligt skilja mellan text skriven av en människa och text skriven av en maskin, såvida de inte ser båda texterna sida vid sida, vilket skulle kompromettera en typisk utvärderingsscenarie (där läsaren ska kunna fatta ett beslut baserat på en enda textprov, “verklig” eller artificiellt genererad).

Kasuell acceptans av lågkvalitativ artificiell text

AMT-arbetare bedömde konsekvent lågkvalitativ GPT-baserad artificiell text på samma sätt som högkvalitativ, sammanhängande text skriven av människor, till skillnad från de engelska lärarna, som lätt kunde skilja på kvalitetsskillnaden.

Ingen förberedelsetid, noll kontext

Att komma in i rätt sinnesstämning för en sådan abstrakt uppgift som utvärdering av äkthet kommer inte naturligt; engelska lärare krävde 20 uppgifter för att kalibrera sin känslighet till utvärderingsmiljön, medan AMT-arbetare vanligtvis fick ingen “inriktningstid” alls, vilket sänkte kvaliteten på deras indata.

Att spela systemet

Rapporten hävdar att den totala tiden AMT-arbetare tillbringar på enskilda uppgifter är uppblåst av arbetare som accepterar flera uppgifter samtidigt och kör igenom uppgifterna i olika flikar i webbläsaren, istället för att koncentrera sig på en uppgift under den registrerade uppgiftstiden.

Ursprungsland är viktigt

AMT:s standardinställningar filtrerar inte arbetare efter ursprungsland, och rapporten noterar tidigare arbete som visar att AMT-arbetare använder VPN för att kringgå geografiska begränsningar, vilket möjliggör för icke-modersmålstalare att presentera sig som modersmålstalare (i ett system som, kanske ganska naivt, likställer en arbetares modersmål med deras IP-baserade geografiska plats).

Således körde forskarna om utvärderingstesterna på AMT med filter som begränsade potentiella deltagare till icke-engelsktalande länder, och fann att ‘arbetare från icke-engelsktalande länder bedömde sammanhang, relevans och grammatik…signifikant lägre än lika kvalificerade arbetare från engelsktalande länder’.

Rapporten slutsatsar:

‘[Expertrattare] som lingvister eller språklärare bör användas när det är möjligt, eftersom de redan har utbildats för att utvärdera skriven text, och det är inte mycket dyrare…’.

 

Publicerad den 16 september 2021Uppdaterad den 18 december 2021: Lade till taggar

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai