Andersons hoek
De tekortkomingen van Amazon Mechanical Turk kunnen Natural Language Generation-systemen bedreigen

Een nieuwe studie van de Universiteit van Massachusetts Amherst heeft Engelse leraren tegenover crowdsourced werknemers op Amazon Mechanical Turk gezet bij het beoordelen van de output van Natural Language Generation (NLG) systemen, en concludeert dat lage standaarden en het ‘gamen’ van gewaardeerde taken onder AMT-werknemers de ontwikkeling van de sector kunnen hinderen.
Het rapport komt tot een aantal vernietigende conclusies over de mate waarin de ‘industriële’ goedkope uitbesteding van open-eindige NLG-evaluatietaken kan leiden tot inferieure resultaten en algoritmen in deze sector.
De onderzoekers hebben ook een lijst van 45 papers over open-eindige tekstgeneratie samengesteld waarin het onderzoek gebruik had gemaakt van AMT, en ontdekten dat ‘de overgrote meerderheid’ geen kritische details over het gebruik van Amazon’s crowdservicedienst rapporteerde, waardoor het moeilijk was om de resultaten van de papers te reproduceren.
Sweat-Shop Arbeid
Het rapport richt kritiek op zowel de sweat-shop-aard van Amazon Mechanical Turk als de (waarschijnlijk door het budget beperkte) academische projecten die AMT extra geloofwaardigheid geven door het te gebruiken en te citeren als een geldig en consistent onderzoeksbron. De auteurs merken op:
‘Terwijl AMT een handige en betaalbare oplossing is, observeren we dat een hoge variatie tussen werknemers, slechte kalibratie en cognitief veeleisende taken onderzoekers ertoe kunnen brengen om misleidende wetenschappelijke conclusies te trekken (bijv. dat door mensen geschreven tekst “slechter” is dan die van GPT-2).’
Het rapport geeft de schuld aan het spel en niet aan de spelers, waarbij de onderzoekers opmerken:
‘[Crowd]werknemers worden vaak onderbetaald voor hun arbeid, wat zowel de kwaliteit van het onderzoek als de mogelijkheid van deze crowdwerkers om een adequaat inkomen te verdienen, schaadt.’
Het artikel, getiteld De gevaren van het gebruik van Mechanical Turk voor het evalueren van open-eindige tekstgeneratie, concludeert verder dat ‘expertbeoordelaars’ zoals taalleraren en linguïsten moeten worden gebruikt om open-eindige kunstmatige NLG-inhoud te beoordelen, zelfs als AMT goedkoper is.
Testtaken
Bij het vergelijken van de prestaties van AMT met minder tijdsgebonden, expertlezers, hebben de onderzoekers $144 uitgegeven aan de AMT-diensten die daadwerkelijk werden gebruikt in de vergelijkingstests (hoewel veel meer werd uitgegeven aan ‘niet-bruikbare’ resultaten – zie hieronder), waarbij willekeurige ‘Turks’ één van de 200 teksten moesten beoordelen, verdeeld over door mensen gegenereerde tekstinhoud en kunstmatig gegenereerde tekst.
Het inschakelen van professionele leraren voor hetzelfde werk kostte $187,50, en hun superieure prestaties (in vergelijking met AMT-werknemers) werden bevestigd door het inhuren van Upwork-freelancers om de taken te repliceren, wat een extra $262,50 kostte.
Elke taak bestond uit vier beoordelingscriteria: grammatica (‘Hoe grammaticaal correct is de tekst van het verhaalfragment?’); coherentie (‘Hoe goed passen de zinnen in het verhaalfragment bij elkaar?’); sympathie (‘Hoe leuk vindt u het verhaalfragment?’); en relevantie (‘Hoe relevant is het verhaalfragment voor de prompt?’).
Het genereren van teksten
Om NLG-materiaal voor de tests te verkrijgen, hebben de onderzoekers het dataset van Facebook AI Research uit 2018 gebruikt, dat bestaat uit 303.358 Engelstalige verhalen die zijn geschreven door gebruikers op de populaire (15 miljoen+ gebruikers) r/writingprompts subreddit, waarbij verhalen van abonnees worden ‘gezaaid’ door enkele zin-prompten op een manier die lijkt op de huidige praktijken in tekst-naar-afbeeldinggeneratie – en natuurlijk in open-eindige Natural Language Generation systemen.
200 prompts uit het dataset werden willekeurig geselecteerd en door een middelgrote GPT-2-model geleid met behulp van de Hugging-Face Transformers bibliotheek. Zo werden twee sets resultaten verkregen van dezelfde prompts: de door mensen geschreven discursieve essays van Reddit-gebruikers en GPT-2-gegenereerde teksten.
Om te voorkomen dat dezelfde AMT-werknemers hetzelfde verhaal meerdere keren beoordelen, werden drie AMT-werknemersbeoordelingen per voorbeeld aangevraagd. Samen met experimenten met betrekking tot de Engelstalige capaciteiten van de werknemers (zie het einde van het artikel) en het uitsluiten van resultaten van laag-inspanningswerknemers (zie ‘Korte tijd’ hieronder), verhoogde dit de totale uitgave aan AMT tot ongeveer $1.500 USD.
Om een gelijk speelveld te creëren, werden alle tests uitgevoerd op weekdagen tussen 11.00-11.30 uur PST.
Resultaten en conclusies
De uitgebreide studie bestrijkt veel terrein, maar de belangrijkste punten zijn als volgt:
Korte tijd
Het artikel vond dat een officieel door Amazon gerapporteerd gemiddelde taakduur van 360 seconden neerkwam op een werkelijke werktijd van slechts 22 seconden, en een mediaan werktijd van alleen 13 seconden – een kwart van de tijd die de snelste Engelse leraar nodig had om de taak te repliceren.

Vanaf dag 2 van de studie: de individuele werknemers (in oranje) besteedden aanzienlijk minder tijd aan elke taak dan de beter betaalde leraren, en (later) de nog beter betaalde Upwork-contractanten. Bron: https://arxiv.org/pdf/2109.06835.pdf
Aangezien AMT geen limiet stelt aan de Human Intelligence Tasks (HITs) die een individuele werknemer kan uitvoeren, zijn er AMT-‘toppers’ ontstaan, met (winstgevende) reputaties voor het voltooien van een hoog aantal taken per experiment. Om te compenseren voor geaccepteerde hits door dezelfde werknemer, hebben de onderzoekers de tijd gemeten tussen opeenvolgende ingediende HITs, door de start- en eindtijd van elke HIT te vergelijken. Op deze manier kwam het tekort tussen AMT’s gerapporteerde WorkTimeInSeconds en de werkelijke tijd die aan de taak werd besteed, in beeld.
Aangezien een dergelijke taak niet kan worden voltooid binnen deze verkorte tijdsbestekken, moesten de onderzoekers compenseren:
‘Aangezien het onmogelijk is om een alinea-lange tekst zorgvuldig te lezen en alle vier eigenschappen te beoordelen in slechts 13 seconden, meten we de impact op gemiddelde beoordelingen wanneer we werknemers filteren die te weinig tijd per HIT besteden… Specifiek verwijderen we beoordelingen van werknemers wiens mediaan tijd onder de 40s ligt (wat een lage lat is), en vinden we dat gemiddeld ongeveer 42% van onze beoordelingen worden gefilterd (variërend van 20%-72% over alle experimenten).’
Het artikel stelt dat de misgerapporteerde werkelijke werktijd in AMT een ‘groot probleem’ is dat doorgaans door onderzoekers die de diensten gebruiken, wordt genegeerd.
Begeleiding noodzakelijk
De bevindingen suggereren verder dat AMT-werknemers niet betrouwbaar kunnen onderscheiden tussen tekst geschreven door een mens en tekst geschreven door een machine, tenzij ze beide teksten naast elkaar zien, wat een typische evaluatiescenario zou compromitteren (waarbij de lezer in staat zou moeten zijn om een oordeel te vellen op basis van een enkel voorbeeld van tekst, ‘echt’ of kunstmatig gegenereerd).
Nonchalanter acceptatie van lage kwaliteit kunstmatige tekst
AMT-werknemers beoordeelden consequent lage kwaliteit GPT-gebaseerde kunstmatige tekst als gelijkwaardig aan hogere kwaliteit, coherente tekst geschreven door mensen, in tegenstelling tot de Engelse leraren, die gemakkelijk het verschil in kwaliteit konden onderscheiden.
Geen voorbereidingstijd, nul context
Het binnentreden van de juiste mindset voor een dergelijke abstracte taak als de evaluatie van authenticiteit komt niet van nature; Engelse leraren hadden 20 taken nodig om hun gevoeligheid te kalibreren aan de evaluatieomgeving, terwijl AMT-werknemers doorgaans geen ‘oriëntatietijd’ kregen, waardoor de kwaliteit van hun input lager was.
Het manipuleren van het systeem
Het rapport stelt dat de totale tijd die AMT-werknemers aan individuele taken besteden, wordt opgeblazen door werknemers die meerdere taken tegelijk aanvaarden en door de taken in verschillende tabs van hun browsers heen rennen, in plaats van zich te concentreren op één taak voor de geregistreerde taakduur.
Land van herkomst is belangrijk
De standaardinstellingen van AMT filteren werknemers niet op land van herkomst, en het rapport merkt op dat eerder onderzoek aangaf dat AMT-werknemers VPN’s gebruiken om rondom geografische beperkingen heen te werken, waardoor niet-moedertaalsprekers zich kunnen voordoen als moedertaalsprekers (in een systeem dat, misschien wat naïef, een werknemers moedertaal gelijkstelt met hun IP-gebaseerde geografische locatie).
De onderzoekers hebben de evaluatietests opnieuw uitgevoerd op AMT met filters die potentieel takers beperkten tot niet-Engelstalige landen, en vonden dat ‘werknemers uit niet-Engelstalige landen coherentie, relevantie en grammatica… aanzienlijk lager beoordeelden dan identiek gekwalificeerde werknemers uit Engelstalige landen’.
Het rapport concludeert:
‘[Expert]beoordelaars zoals linguïsten of taalleraren moeten worden gebruikt wanneer mogelijk, omdat ze al zijn getraind om geschreven tekst te beoordelen, en het is niet veel duurder…’.
Geplaatst op 16 september 2021 – Bijgewerkt op 18 december 2021: Tags toegevoegd












