Andersonin kulma

Amazon Mechanical Turkin puutteet voivat uhata luonnollisen kielen generoimisjärjestelmiä

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Massachusettsin yliopiston tutkimus on asettanut englannin opettajat kilpailemaan Amazon Mechanical Turkin työntekijöiden kanssa arvioimalla luonnollisen kielen generoimisjärjestelmien (NLG) tuotoksia, ja se johtaa siihen, että heikot standardit ja tehtävien “pelailu” AMT-työntekijöiden keskuudessa voivat haitata alan kehitystä.

Raportti johtaa useisiin kritisiin johtopäätöksiin siitä, kuinka laajamittainen ja halpa ulkoistaminen avoimien NLG-arviotehtävien arvioinnista voi johtaa heikkoihin tuloksiin ja algoritmeihin tässä alalla.

Tutkijat kokosivat myös 45 tutkimuksen luettelon, joissa avoimen tekstigeneroinnin tutkimuksessa käytettiin AMT:ä, ja havaitsivat, että “valtaosa” ei raportoinut kriittisiä yksityiskohtia Amazonin joukkorahoituspalvelun käytöstä, mikä teki tutkimuksen tuloksien toistamisen vaikeaksi.

Halpatyövoima

Raportti esittää kritiikkiä sekä Amazon Mechanical Turkin halpatyövoiman luonteesta että (mahdollisesti budjettirajoitettujen) akateemisista projekteista, jotka antavat AMT:lle lisää uskottavuutta käyttämällä ja siteeraamalla sitä tutkimuksessa. Tutkijat huomauttavat:

‘Vaikka AMT on kätevä ja edullinen ratkaisu, havaitsemme, että suuri vaihtelu työntekijöiden välillä, heikko kalibrointi ja kognitiivisesti vaativat tehtävät voivat johtaa tutkijoiden virheellisiin tieteellisiin johtopäätöksiin (esim. että ihmisten kirjoittama teksti on “huonompaa” kuin GPT-2:n).’

Raportti syyttää peliä eikä pelaajia, ja tutkijat huomauttavat:

‘[Joukkorahoitussivuston] työntekijät maksetaan usein liian vähän työstään, mikä vahingoittaa sekä tutkimuksen laatua että, tärkeämpää, näiden joukkorahoitustyöntekijöiden kykyä ansaita riittävä elinkeino.’

Tutkimus paperi, jonka otsikko on Amazon Mechanical Turkin käytön vaarat avoimessa tekstigeneroinnissa, johtaa myös siihen, että “asiantuntijoiden arvioijat” kuten kieltenopettajat ja kielitieteilijät tulisi käyttää arvioimaan avoimia, tekoälyllisiä NLG-sisältöjä, vaikka AMT on halvempaa.

Testitehtävät

Vertailemalla AMT:n suorituskykyä vähemmän aikarajoitettujen, asiantuntija-lukijoiden kanssa tutkijat käyttivät 144 dollaria AMT-palveluihin, jotka käytettiin vertailukokeissa (vaikka paljon enemmän rahaa käytettiin “käyttämättömiin” tuloksiin – ks. alla), ja pyysivät satunnaisia “turkkeja” arvioimaan yhtä 200:sta tekstistä, jotka jaettiin ihmisten kirjoittamiin tekstisisältöihin ja tekoälyllisesti generoituun tekstiin.

Amatöörien opettajien työskenteleminen samassa työssä maksoi 187,50 dollaria, ja heidän ylivoimaisen suorituskykynsä (verrattuna AMT-työntekijöihin) vahvistettiin palkkaamalla Upwork-vapaaehtoisia toistamaan tehtävät, mikä maksoi lisää 262,50 dollaria.

Jokainen tehtävä koostui neljästä arviokriteeristä: kielioppi (‘Miten kieliopillisesti oikein teksti on?’); johdonmukaisuus (‘Miten hyvin lauseet tekstissä sopivat yhteen?’); miellyttävyys (‘Miten miellyttävää teksti on?’); ja asiaankuuluvuus (‘Miten asiaankuuluvaa teksti on?’).

Tekstien generointi

Saadakseen NLG-materiaalia kokeisiin tutkijat käyttivät Facebook AI Researchin 2018 Hierarchical Neural Story Generation datasetiä, joka koostuu 303 358 englanninkielisestä tarinasta, jotka on kirjoittanut käyttäjät suositulla (15 milj+ käyttäjää) r/writingprompts -alustalla, jossa käyttäjien tarinat “siementään” yksittäisillä lauseilla “aiheita” samalla tavalla kuin nykyisissä teksti-kuvageneroinnin käytännöissä – ja tietysti avoimissa luonnollisen kielen generoimisjärjestelmissä järjestelmissä.

200:sta aiheesta valittiin satunnaisesti ja ohjattiin keskikokoisen GPT-2-mallin kautta Hugging-Facen Transformers kirjastoa käyttäen. Näin saatiin kaksi tulosta samasta aiheesta: ihmisten kirjoittamat diskurssiset esseet Reddit-käyttäjiltä ja GPT-2:n generoimat tekstit.

Jotta voidaan estää samaa AMT-työntekijää arvioimasta samaa tarinaa useita kertoja, pyydettiin kolmea AMT-työntekijän arviota kullekin esimerkille. Yhdessä kokeiden kanssa, jotka liittyivät englannin kielen taitoihin (ks. lopussa) ja alihinnan mukaan, tämä lisäsi AMT:n kokonaismenot kuuden tuhannen dollarin verran.

Luoakseen tasapuolisen pelikentän kaikki kokeet suoritettiin arkisin kello 11.00-11.30 PST.

Tulokset ja johtopäätökset

Laaja tutkimus kattaa paljon maata, mutta avainkohtia ovat seuraavat:

Lyhyt aika

Tutkimus osoitti, että Amazonin ilmoittama keskimääräinen tehtävien kestoaika 360 sekuntia oli vain 22 sekuntia, ja mediaani oli vain 13 sekuntia – neljännes siitä ajasta, jonka nopein englannin opettaja käytti tehtävän toistamiseen.

Tutkimuksen toiselta päivältä: yksittäiset työntekijät (oranssissa) käyttivät selvästi vähemmän aikaa kunkin tehtävän arvioimiseen kuin paremmin palkatut opettajat ja myöhemmin vielä paremmin palkatut Upwork-viranomaiset. Lähde: https://arxiv.org/pdf/2109.06835.pdf

Tutkimuksen toiselta päivältä: yksittäiset työntekijät (oranssissa) käyttivät selvästi vähemmän aikaa kunkin tehtävän arvioimiseen kuin paremmin palkatut opettajat ja myöhemmin vielä paremmin palkatut Upwork-viranomaiset. Lähde: https://arxiv.org/pdf/2109.06835.pdf

Koska AMT ei aseta rajoituksia sille, montako tehtävää yksittäinen työntekijä voi ottaa, AMT:n “iso osuus” on kehittynyt, ja heillä on maine siitä, että he suorittavat suuren määrän tehtäviä kokeen aikana. Tutkijat mitasivat aikaa, joka kului peräkkäisten tehtävien välillä, vertaamalla kunkin tehtävän aloitus- ja lopetusaikaa. Tällä tavoin AMT:n ilmoitetun WorkTimeInSeconds ja todellisen tehtävään käytetyn ajan välinen puute tuli näkyviin.

Koska tällaista työtä ei voida suorittaa näissä vähennetyissä aikakehyksissä, tutkijoiden oli korjattava tämä:

‘Koska on mahdotonta lukea huolellisesti yhden paragrafin mittaisen tarinan ja arvioida kaikkia neljää ominaisuutta vain 13 sekunnissa, mitaatemme vaikutusta keskimääräisiin arvosteluihin, kun suodatamme työntekijät, jotka viettävät liian vähän aikaa kunkin tehtävän parissa… Nimenomaan poistamme arviot työntekijöiltä, joiden mediaaniaikaa on alle 40 sekuntia (joka on matala kynnys), ja havaitsemme, että keskimäärin noin 42 % arvostelustamme suodatetaan pois (vaihdellen 20-72 % kaikissa kokeissa).’

Tutkimus väittää, että AMT:n todellisen työajan väärinilmoittaminen on “merkittävä ongelma”, jota tutkijat yleensä ohittavat.

Ohjattu käsittely

Löydökset osoittavat myös, että AMT-työntekijät eivät voi luotettavasti erottaa tekstiä, joka on kirjoitettu ihmisen toimesta, ja tekstiä, joka on kirjoitettu koneella, ellei heillä ole molempia tekstejä rinnakkain, mikä olisi tehnyt tyypillisen arviointitilanteen (jossa lukijan tulisi voida tehdä arvio yhdestä tekstiesimerkistä, “oikeasta” tai tekoälyllisesti generoidusta).

Välinpitämätön hyväksyminen matalalaatuisesta tekoälytekstistä

AMT-työntekijät antoivat jatkuvasti matalalaatuiselle GPT-pohjaiselle tekoälytekstille saman arvosanan kuin korkealaatuiselle, johdonmukaiselle tekstille, jota ihmiset olivat kirjoittaneet, toisin kuin englannin opettajat, jotka pystyivät helposti erottamaan laadun eron.

Ei valmisteluaikaa, ei asiayhteyttä

Oikean mielentilan saavuttaminen abstraktiin tehtävään, kuten aitouden arviointiin, ei tule luonnostaan; englannin opettajien oli tarvittu 20 tehtävää kalibroidakseen arvioympäristönsä, kun taas AMT-työntekijöillä ei ollut “suuntaamisaikaa” ollenkaan, mikä laski heidän syötteen laatua.

Järjestelmän pelaaminen

Raportti väittää, että AMT-työntekijöiden yksittäisten tehtävien suorittamiseen käyttämä kokonaistyöaika on suurempi, koska työntekijät hyväksyvät useita tehtäviä samanaikaisesti ja suorittavat ne eri välilehdissä selaimessaan eikä keskity yhteen tehtävään tallennetun tehtävän keston ajan.

Maan alkuperä on tärkeä

AMT:n oletusasetukset eivät suodattele työntekijöitä maan alkuperän perusteella, ja raportti toteaa aiemman tutkimuksen, joka osoittaa, että AMT-työntekijät käyttävät VPN:ä kiertääkseen maantieteellisiä rajoituksia, mikä mahdollistaa ei-englanninkielisten puhujien esittäytymisen äidinkielisinä (järjestelmässä, joka ehkä liian viattomasti yhdistää työntekijän äidinkielen hänen IP-pohjaiseen maantieteelliseen sijaintiinsa).

Tutkijat suorittivat arviokokeet uudelleen AMT:llä, ja rajoittivat potentiaaliset osallistujat ei-englanninkielisiin maihin, ja havaitsivat, että “työntekijät ei-englanninkielisistä maista antoivat yhtenäisyyden, asiaankuuluvuuden ja kieliopin arvosanat… merkittävästi alempia kuin samalla tasolla olevat työntekijät englanninkielisistä maista”.

Raportti johtaa siihen, että:

‘[Asiantuntija]arvioijat, kuten kieltenopettajat tai kielitieteilijät, tulisi käyttää aina, kun mahdollista, koska he ovat jo koulutettu arvioimaan kirjoitettua tekstiä, ja se ei ole paljon kalliimpaa…’

 

Julkaistu 16. syyskuuta 2021Päivitetty 18. joulukuuta 2021: Lisätty avainsanat

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai