Andersons vinkel
De ‘usynlige’, ofte utilfredse arbejdskraft, der afgør fremtiden for AI

To nye rapporter, herunder en artikel ledet af Google Research, udtrykker bekymring over, at den nuværende tendens til at afhænge af en billig og ofte magtesløs pool af globale gig-arbejdere til at oprette grundsandhed for maskinlæringsystemer kan have store downstream-konsekvenser for AI.
Blandt en række konklusioner finder Google-studiet, at crowdworkernes egne fordomme sandsynligvis vil blive indlejret i de AI-systemer, hvis grundsandhed vil blive baseret på deres svar; at udbredte uretfærdige arbejdspraksisser (herunder i USA) på crowdwork-platforme sandsynligvis vil nedgrade kvaliteten af svarene; og at ‘konsensus’-systemet (effektivt en ‘mini-valg’ for en given grundsandhed, der vil påvirke downstream AI-systemer) som løser uenigheder kan faktisk kassere de bedste og/eller mest informerede svar.
Det er de dårlige nyheder; de værre nyheder er, at næsten alle forbedringerne er dyre, tidskrævende eller begge dele.
Usikkerhed, tilfældig afvisning og bitterhed
Den første artikel, fra fem Google-forskere, hedder Hvis grundsandhed? Regnskab for individuelle og kollektive identiteter underliggende dataset-annotation; den anden, fra to forskere ved Syracuse University i New York, hedder Ursprunget og værdien af uenighed blandt data-mærkere: En case-studie af individuelle forskelle i hadforbrydelses-annotation.
Google-artiklen påpeger, at crowd-arbejdere – hvis vurderinger ofte danner grundlaget for maskinlærings-systemer, der måske senere kan påvirke vores liv – ofte opererer under en række begrænsninger, der kan påvirke, hvordan de responderer på eksperimentelle opgaver.
For eksempel tillader Amazon Mechanical Turks nuværende politikker, at anmodere (de, der giver opgaverne) kan afvise en annotators arbejde uden ansvar*:
‘[E]n stor majoritet af crowd-arbejdere (94%) har haft arbejde, der er blevet afvist eller som de ikke er blevet betalt for. Alligevel har anmodere fuld ret til de data, de modtager, uanset om de accepterer eller afviser det; Roberts (2016) beskriver dette system som et, der “muliggør lønsvind”.
‘Desuden er afvisning af arbejde og tilbageholdelse af betaling smertefuldt, fordi afvisninger ofte skyldes uklare instruktioner og manglende meningsfulde feedback-kanaler; mange crowd-arbejdere rapporterer, at dårlig kommunikation negativt påvirker deres arbejde.’
Forfatterne anbefaler, at forskere, der bruger outsourcede tjenester til at udvikle datasets, skal overveje, hvordan en crowdwork-platform behandler sine arbejdere. De påpeger desuden, at i USA er crowd-arbejdere klassificeret som ‘uafhængige entreprenører’, og arbejdet er derfor ureguleret og ikke dækket af den minimumsløn, der er fastsat i Fair Labor Standards Act.
Kontekst er vigtig
Artiklen kritiserer også brugen af ad hoc global arbejdskraft til annotations-opgaver uden at tage hensyn til annotatoren baggrund.
Hvor budgettet tillader det, er det almindeligt for forskere, der bruger AMT og lignende crowdwork-platforme, at give samme opgave til fire annotatorer og følge ‘flertalsreglen’ for resultaterne.
Kontekstuel erfaring, argumenterer artiklen, er bemærkelsesværdigt underestimeret. For eksempel, hvis en opgave om sexisme tilfældigt distribueres mellem tre enige mænd i alderen 18-57 og en uenig kvinde i alderen 29, vinder mændenes dom, bortset fra i de relativt sjældne tilfælde, hvor forskerne opmærksommer sig på kvalifikationerne hos deres annotatorer.
Lignende, hvis en spørgsmål om bande-adfærd i Chicago distribueres mellem en kvinde fra landet i USA i alderen 36, en mandlig Chicago-beboer i alderen 42, og to annotatorer fra henholdsvis Bangalore og Danmark, har personen, der sandsynligvis er mest berørt af problemet (Chicago-manden), kun en fjerdedel af stemmerne i resultatet, i en standard outsourcing-konfiguration.
Forskerne påpeger:
‘[Begrebet om] “én sandhed” i crowdsourcing-svar er en myte; uenighed mellem annotatorer, der ofte ses som negativ, kan faktisk give en værdifuld signal. For det andet, da mange crowdsourced annotator-pools er socio-demografisk skæve, har det implikationer for, hvilke befolkningsgrupper der er repræsenteret i datasets samt hvilke befolkningsgrupper står over for udfordringerne med [crowdwork].
‘At tage hensyn til skævheder i annotatordemografi er kritisk for at kontekstualisere datasets og sikre ansvarlig downstream-brug. Med andre ord er der værdi i at anerkende og tage hensyn til arbejdernes socio-kulturelle baggrund — både fra datakvalitets- og samfundsindflydelsessynspunkt.’
Ingen ‘neutrale’ meninger om kontroversielle emner
Selv hvor meningerne fra fire annotatorer ikke er skæve, hverken demografisk eller på anden måde, udtrykker Google-artiklen bekymring over, at forskerne ikke tager hensyn til annotatorernes livserfaringer eller filosofiske disposition:
‘ Mens nogle opgaver stiller objektive spørgsmål med et korrekt svar (er der et menneskeansigt på billedet?), stiller mange datasets spørgsmål om subjektive opgaver med ingen universelt korrekt svar (er denne tekst offensiv?). Det er vigtigt at være bevidst om, hvornår man skal stole på annotatorernes subjektive vurderinger.’
Med hensyn til dets specifikke ambition om at løse problemer med hadforbrydelses-mærkning, påpeger Syracuse-artiklen, at mere kategoriske spørgsmål som Er der en kat på dette billede? er bemærkelsesværdigt forskellige fra at spørge en crowd-arbejder, om en sætning er ‘giftig’:
‘At tage hensyn til den sociale virkelighedens rod, varierer menneskers perceptioner af giftighed betydeligt. Deres mærkning af giftigt indhold er baseret på deres egne perceptioner.’
Da personlighed og alder har en ‘væsentlig indflydelse’ på dimensionel mærkning af hadforbrydelse, konkluderer Syracuse-forskerne:
‘Disse resultater antyder, at bestræbelserne på at opnå mærkningskonsistens blandt mærkere med forskellig baggrund og personlighed for hadforbrydelse måske aldrig fuldt ud kan lykkes.’
Dommeren kan også være fordomsfuld
Mangel på objektivitet er sandsynligvis til stede længere oppe i systemet, ifølge Syracuse-artiklen, som argumenterer for, at den manuelle indgriben (eller automatiserede politik, også besluttet af et menneske), der bestemmer ‘vinderen’ af konsensus-afstemninger, også skal være genstand for undersøgelse.
Lignende processen med forum-moderation, påpeger forfatterne*:
‘[E]n fællesskabs moderatorer kan afgøre skæbnen for både indlæg og brugere i deres fællesskab ved at fremme eller skjule indlæg, samt ære, skamme eller bande brugerne. Moderatorernes beslutninger påvirker indholdet, der leveres til fællesskabsmedlemmer og publikum og påvirker også fællesskabets oplevelse af diskussionen.
‘Antag, at en menneskelig moderator er en fællesskabsmedlem, der har demografisk homogenitet med andre fællesskabsmedlemmer, så kan det synes muligt, at den mentale skema, de bruger til at evaluere indhold, vil matche de andre fællesskabsmedlemmers.’
Dette giver en vis antydning af, hvorfor Syracuse-forskerne er nået til en så despondent konklusion om fremtiden for hadforbrydelses-mærkning; antydningen er, at politikker og vurderinger af uenige crowdwork-meninger ikke bare kan anvendes tilfældigt efter ‘acceptable’ principper, der ikke er fastlagt eller ikke kan reduceres til en anvendelig skema, selv hvis de findes.
Menneskene, der træffer beslutninger (crowd-arbejderne), er fordomsfulde, og ville være værdiløse til disse opgaver, hvis de ikke var ikke fordomsfulde, da opgaven er at give en værdi-vurdering; menneskene, der afgør uenigheder i crowdwork-resultater, træffer også værdi-vurderinger, når de fastsætter politikker for uenigheder.
Der kan være hundredvis af politikker i bare ét hadforbrydelses-detections-rammeværk, og medmindre hver og en af dem føres helt tilbage til Højesteret, hvor kan ‘autoritativ’ konsensus opstå?
Google-forskerne foreslår, at ‘[uenighederne mellem annotatorer kan indeholde værdifulde nuancer om opgaven’. Artiklen foreslår brugen af metadata i datasets, der reflekterer og kontekstualiserer uenigheder.
Men det er svært at se, hvordan en sådan kontekst-specifik lag af data kunne føre til lignende målinger, tilpasse sig kravene til etablerede standardtests eller støtte enhver afgørende resultater – bortset fra i den urealistiske scenario, hvor man antager den samme gruppe af forskere på tværs af efterfølgende arbejde.
Kuratering af annotator-poolen
Alt dette antager, at der overhovedet er budget i et forskningsprojekt til multiple annotationer, der ville føre til en konsensus-afstemning. I mange tilfælde forsøger forskerne at ‘kuraterer’ den outsourcede annotations-pool billigere ved at specificere egenskaber, som arbejderne skal have, såsom geografisk beliggenhed, køn eller andre kulturelle faktorer, og handler mangfoldighed for specifikke egenskaber.
Google-artiklen mener, at vejen frem fra disse udfordringer kunne være at etablere udvidede kommunikations-rammer med annotatorer, lignende de minimale kommunikationer, som Uber-appen faciliterer mellem en chauffør og en passager.
Sådan en omhyggelig overvejelse af annotatorer ville naturligvis være en hindring for hyperskala-annotations-udsalg, hvilket ville resultere i enten mere begrænsede og lav-volumen-datasets med en bedre begrundelse for deres resultater eller en ‘hastet’ vurdering af de involverede annotatorer, hvor man kun fik begrænsede oplysninger om dem og karakteriserede dem som ‘egnet til opgaven’ baseret på for lidt information.
Det er, hvis annotatorerne er ærlige.
‘People Pleasers’ i outsourcet dataset-mærkning
Med en tilgængelig arbejdskraft, der er underbetalt, under stærk konkurrence for tilgængelige opgaver og deprimeret af få karriereudsigter, er annotatorer motiveret til at give det ‘rette’ svar og gå videre til den næste mini-opgave.
Hvis ‘det rigtige svar’ er noget mere kompliceret end Har kat/Ingen kat, mener Syracuse-artiklen, at arbejderen sandsynligvis vil forsøge at deducere et ‘acceptabelt’ svar baseret på indholdet og konteksten af spørgsmålet*:
‘Både udbredelsen af alternative konceptualiseringer og den udbredte brug af simplistic annotations-metoder er sandsynligvis hindrende for fremgangen i forskningen om hadforbrydelse på nettet. For eksempel fandt Ross et al. ud, at vise Twitters definition af hadforbrydelse til annotatorer fik dem til delvist at justere deres egne meninger med definitionen. Denne justering resulterede i meget lav inter-rater-reliabilitet af annotations.’
* Min konvertering af artiklens inline-citationer til hyperlinks.
Udgivet 13. december 2021 – Opdateret 18. december 2021: Tags tilføjet












