Andersons vinkel
Det ‘usynlige’, ofte misfornøyde arbeidsstokken som bestemmer fremtiden for AI

To nye rapporter, inkludert en studie ledet av Google Research, uttrykker bekymring over at den nåværende trenden med å stole på en billig og ofte maktesløs gruppe globale gig-arbeidere for å lage grunnfakta for maskinlæringsystemer, kan ha store nedstrøms konsekvenser for AI.
Blant en rekke konklusjoner, finner Google-studien at crowdworkers’ egne fordommer sannsynligvis vil bli innbygget i AI-systemene hvis grunnfakta vil bli basert på deres svar; at utbredte urimelige arbeidspraksiser (inkludert i USA) på crowdwork-plattformer sannsynligvis vil degradere kvaliteten på svarene; og at ‘konsensus’-systemet (i realiteten en ‘mini-valg’ for en del grunnfakta som vil påvirke nedstrøms AI-systemer) som nå løser uenigheter, kan faktisk kaste bort de beste og/eller mest informerte svarene.
Dette er de dårlige nyhetene; de verre nyhetene er at nesten alle løsningene er dyre, tidskrevende eller begge deler.
Usikkerhet, tilfeldig avvisning og forbitrelse
Den første studien, fra fem Google-forskere, heter Hvem er grunnfakta? Regnskap for individuelle og kollektive identiteter underliggende datasett-annotering; den andre, fra to forskere ved Syracuse University i New York, heter Opphav og verdi av uenighet blant data-merkere: En kasusstudie av individuelle forskjeller i hate speech-annotering.
Google-studien påpeker at crowdworkers – hvis vurderinger ofte danner den avgjørende grunnlaget for maskinlæringsystemer som kan påvirke våre liv – ofte opererer under en rekke begrensninger som kan påvirke måten de responderer på eksperimentelle oppgaver.
For eksempel tillater Amazon Mechanical Turks nåværende politik at oppdragsgivere (de som gir ut oppgavene) kan avvise en annotators arbeid uten ansvar*:
‘[E]n stor majoritet av crowdworkers (94%) har hatt arbeid som ble avvist eller som de ikke ble betalt for. Likevel beholder oppdragsgiverne full rett over dataene de mottar, uavhengig av om de godtar eller avviser dem; Roberts (2016) beskriver dette systemet som et som “muliggjør lønnstyrning”.
‘I tillegg er avvisning av arbeid og tilbakeholdning av betaling smertefullt fordi avvisninger ofte skyldes uklare instruksjoner og manglende meningsfulle tilbakemeldingskanaler; mange crowdworkers rapporterer at dårlig kommunikasjon negativt påvirker deres arbeid.’
Forskerne anbefaler at forskere som bruker utkontrakterte tjenester for å utvikle datasett, bør vurdere hvordan en crowdwork-plattform behandler sine arbeidere. De påpeker videre at i USA er crowdworkers klassifisert som ‘uavhengige kontraktører’, med arbeidet derfor uregulert, og ikke omfattet av minimumslønnen fastsatt av Fair Labor Standards Act.
Kontekst har betydning
Studien kriticiserer også bruken av ad hoc global arbeidskraft for annoteringsoppgaver, uten å ta hensyn til annotatoren bakgrunn.
Hvor budsjett tillater, er det vanlig for forskere som bruker AMT og lignende crowdwork-plattformer å gi samme oppgave til fire annotatorer, og følge ‘flertallsprinsippet’ på resultater.
Kontekstuell erfaring, argumenterer studien, er merkbart underverdiert. For eksempel, hvis en oppgave relatert til seksisme er tilfeldig fordelt mellom tre enige menn i alderen 18-57 og en uenig kvinne i alderen 29, vinner mennenes dom, bortsett fra i de relativt sjeldne tilfeller hvor forskere legger merke til kvalifikasjonene til annotatorene.
Liknende, hvis en spørsmål om gang-behavior i Chicago er fordelt mellom en kvinne fra en rural område i USA i alderen 36, en mannlig Chicago-boer i alderen 42, og to annotatorer fra henholdsvis Bangalore og Danmark, har personen som sannsynligvis er mest berørt av problemet (Chicago-mannen) bare en fjerdedel andel i utfallet, i en standard utkontraktering-konfigurasjon.
Forskerne påpeker:
‘[Begrepet] “en sannhet” i crowdsourcing-svar er en myte; uenighet mellom annotatorer, som ofte sees på som negativ, kan faktisk gi en verdifull signal. For det andre, siden mange crowdsourced annotator-puljer er socio-demografisk skjeve, er det implikasjoner for hvilke befolkninger som er representert i datasett, samt hvilke befolkninger som møter utfordringene med [crowdwork].
‘Regnskap for skjevheter i annotatordemografi er kritisk for å kontekstualisere datasett og sikre ansvarlig nedstrøms bruk. Kort sagt, det er verdi i å anerkjenne og regnskapsføre for arbeidernes socio-kulturelle bakgrunn — både fra datakvalitetsperspektiv og samfunnsmessig påvirkning.’
Ingen ‘nøytrale’ meninger på kontroversielle emner
Selv der hvor meninger fra fire annotatorer ikke er skjeve, hverken demografisk eller ved noen annen målestokk, uttrykker Google-studien bekymring over at forskere ikke tar hensyn til annotatoren livserfaring eller filosofisk disposisjon:
‘ Mens noen oppgaver stiller objektive spørsmål med et riktig svar (er det et menneskeansikt i et bilde?), stiller ofte datasett spørsmål om relativt subjektive oppgaver uten et universelt riktig svar (er denne teksten offensiv?). Det er viktig å være bevisst på om å stole på annotatoren subjektive vurderinger.’
Med hensyn til dets spesifikke område for å løse problemer med hate speech-merking, påpeker Syracuse-studien at mer kategoriske spørsmål som Er det en katt i dette fotografiet? er merkbart forskjellige fra å spørre en crowdworker om en frase er ‘giftig’:
‘Ved å ta hensyn til kompleksiteten i sosial virkelighet, varierer menneskers oppfattelse av giftighet substansielt. Deres merking av giftig innhold er basert på deres egne oppfattelser.’
Forskere fra Syracuse konkluderer med at:
‘Disse funnene antyder at forsøk på å oppnå annoteringskonsistens blant merker med forskjellige bakgrunner og personligheter for hate speech, kan aldri fullstendig lykkes.’
Dommen kan også være fordomsfull
Dette manglet på objektivitet er sannsynligvis å iterere oppover også, ifølge Syracuse-studien, som argumenterer for at den manuelle inngripen (eller automatiserte politikk, også bestemt av en menneske) som bestemmer ‘vinneren’ av konsensus-avstemninger, også bør være gjenstand for skråping.
Lignende prosessen til forum-moderering, påpeker forfatterne:
‘[E]n samfunns moderatorer kan bestemme skjebnen til både innlegg og brukere i samfunnet ved å fremme eller skjule innlegg, samt ære, skamme eller utestenge brukerne. Moderatorers beslutninger påvirker innholdet som leveres til samfunnets medlemmer og publikum og ved å utvide også påvirker samfunnets erfaring av diskusjonen.
‘Anta at en menneskelig moderator er en samfunnsmedlem som har demografisk homogenitet med andre samfunnsmedlemmer, kan det synes mulig at den mentale skjema de bruker til å vurdere innhold, vil matche de til andre samfunnsmedlemmer.’
Dette gir en viss antydning om hvorfor Syracuse-forskerne har kommet til en så despondent konklusjon når det gjelder fremtiden for hate speech-annotering; implikasjonen er at politikk og vurderinger av uenige crowdwork-meninger ikke bare kan være tilfeldig anvendt i henhold til ‘akseptable’ prinsipper som ikke er nedfelt noen steder (eller ikke kan reduseres til en anvendbar skjema, selv om de eksisterer).
Personene som tar beslutningene (crowdworkerne) er fordomsfulle, og ville være nytteløse for slike oppgaver hvis de ikke var ikke fordomsfulle, siden oppgaven er å gi en verdi-vurdering; personene som dømmer i uenigheter i crowdwork-resultater, tar også verdi-vurderinger når de setter politikk for uenigheter.
Det kan være hundrevis av politikk i bare ett hate speech-detectionsrammeverk, og med mindre hver og en av dem tas helt tilbake til Høyesterett, hvor kan ‘autoritativ’ konsensus oppstå?
Google-forskerne foreslår at ‘[uenighet mellom annotatorer kan inneholde verdifulle nyanser om oppgaven’. Studien foreslår bruk av metadata i datasett som reflekterer og kontekstualiserer uenigheter.
Men det er vanskelig å se hvordan en slik kontekst-spesifik lag av data noen gang kan føre til like-på-like målinger, tilpasse seg kravene til etablerte standardtester, eller støtte noe definitive resultater – bortsett fra i den urealistiske scenariet hvor man antar samme gruppe forskere over påfølgende arbeid.
Utvalg av annotator-pulje
Alt dette antar at det faktisk er budsjett i et forskningsprosjekt for multiple annoteringer som ville føre til en konsensus-avstemning. I mange tilfeller prøver forskere å ‘kuratere’ den utkontrakterte annotator-puljen billigere ved å spesifisere trekk som arbeiderne bør ha, som geografisk plassering, kjønn eller andre kulturelle faktorer, og bytte mangfold mot spesifisitet.
Google-studien hevder at veien fremover fra disse utfordringene kan være å etablere utvidede kommunikasjonsrammeverk med annotatorer, lignende de minimale kommunikasjonene som Uber-appen fasiliteter mellom en sjåfør og en passasjer.
Slik omsorg for annotatorer ville, naturligvis, være et hinder for hyperskala-annoterings-utkontraktering, resulterende i enten mer begrensede og lav-volum datasett som har en bedre begrunnelse for sine resultater, eller en ‘rask’ vurdering av annotatorene involvert, med begrensede detaljer om dem, og karakterisering av dem som ‘egnet for oppgaven’ basert på for lite informasjon.
Det er hvis annotatorene er ærlige.
‘Folkets behagere’ i utkontraktert datasett-merking
Med en tilgjengelig arbeidsstyrke som er underbetalt, under hard konkurranse for tilgjengelige oppgaver, og deprimert av manglende karriere-perspektiver, er annotatorer motivert til å raskt gi ‘riktig’ svar og gå videre til neste mini-oppgave.
Hvis ‘riktig svar’ er noe mer komplisert enn Har katt/Ingen katt, hevder Syracuse-studien at arbeideren sannsynligvis vil prøve å dedusere et ‘akseptabelt’ svar basert på innhold og kontekst av spørsmålet*:
‘Både spredningen av alternative konseptualiseringer og den utbredte bruken av enkle annoteringsmetoder, er argumenterbart hindrer fremgangen av forskning på nett-hate speech. For eksempel, fant Ross og medarbeidere at visning av Twitters definisjon av hatefult oppførsel til annotatorer, førte til at de delvis justerte sine egne meninger med definisjonen. Dette resulterte i svært lav inter-rater-reliabilitet av annoteringene.’
* Min konvertering av studiens inline-citater til lenker.
Publisert 13. desember 2021 – Oppdatert 18. desember 2021: Tags lagt til












