AI-modeller og plattformer
Ny studie forsøker å forbedre hadetalgoritmer
Sosiale medier, spesielt Twitter, har lenge vært kritisert for hvordan de merker tale og bestemmer hvilke kontoer som skal bli forbudt. Det underliggende problemet har nesten alltid å gjøre med algoritmene de bruker for å overvåke nettinnlegg. Kunstig intelligens-systemer er langt ifra perfekte når det gjelder denne oppgaven, men det pågår kontinuerlig arbeid for å forbedre dem.
Inkludert i dette arbeidet er en ny studie fra University of Southern California som forsøker å redusere visse feil som kan føre til rasistisk bias.
Feil i å gjenkjenne kontekst
En av problemene som ikke får så mye oppmerksomhet, har å gjøre med algoritmer som er ment å stoppe spredningen av hatfulle uttalelser, men som i stedet forsterker rasistisk bias. Dette skjer når algoritmene ikke klarer å gjenkjenne konteksten og ender opp med å merke eller blokkere twit fra minoritetsgrupper.
Det største problemet med algoritmene i forhold til kontekst, er at de er for følsomme overfor visse gruppe-identifiserende termer som “svart”, “homofil” og “transperson”. Algoritmene betrakter disse som hat-tale-klassifiseringer, men de brukes ofte av medlemmer av disse gruppene, og konteksten er viktig.
I et forsøk på å løse dette problemet med kontekst-blindhet, skapte forskerne en mer kontekst-følsom hat-tale-klassifisering. Den nye algoritmen er mindre sannsynlig til å feilmerke en post som hat-tale.
Algoritmen
Forskerne utviklet de nye algoritmene med to nye faktorer i mente: konteksten i forhold til gruppe-identifikatorer, og om det også er andre trekk ved hat-tale som er til stede i innlegget, som for eksempel dehumaniserende språk.
Brendan Kennedy er en datavitenskaps-student og med-forfatter av studien, som ble publisert den 6. juli på ACL 2020.
“Vi ønsker å bringe hat-tale-oppdaging nærmere å være klar for virkelige verden-applikasjoner,” sa Kennedy.
“Hat-tale-oppdaging-modeller bryter ofte sammen, eller genererer dårlige forutsigelser, når de introduseres til virkelige verden-data, som sosiale medier eller andre nett-tekst-data, fordi de er forvrengt av dataene de er trent på å assosiere fremtoningen av sosiale identifikatorer med hat-tale.”
Grunden til at algoritmene ofte er upresise, er at de er trent på ubalanserte datasett med ekstremt høye hat-tale-rater. På grunn av dette, klarer algoritmene ikke å lære hvordan de skal håndtere hva sosiale medier faktisk ser ut i den virkelige verden.
Professor Xiang er en ekspert på naturlig språk-behandling.
“Det er nøkkel for modeller å ikke ignorere identifikatorer, men å matche dem med riktig kontekst,” sa Ren.
“Hvis du lærer en modell fra et ubalansert datasett, begynner modellen å plukke opp underlige mønster og blokkere brukere på en upassende måte.”
For å teste algoritmen, brukte forskerne en tilfeldig sampel av tekst fra to sosiale medier som har en høy rate av hat-tale. Teksten ble først merket av mennesker som fordomsfulle eller dehumaniserende. Den beste modellen ble målt mot forskernes egen modell for å feilmerke ikke-hat-tale, gjennom bruk av 12 500 New York Times-artikler uten hat-tale. Mens den beste modellen kunne oppnå 77% nøyaktighet i å identifisere hat-tale mot ikke-hat-tale, var forskernes modell høyere med 90%.
“Dette arbeidet alene gjør ikke hat-tale-oppdaging perfekt, det er et enormt prosjekt som mange arbeider på, men det gjør inkrementell fremgang,” sa Kennedy.
“I tillegg til å forhindre at sosiale medier-innlegg fra medlemmer av beskyttede grupper blir feilmerket, håper vi at vårt arbeid vil hjelpe til å sikre at hat-tale-oppdaging ikke gjør unødvendig skade ved å forsterke feilaktige assosiasjoner av fordom og dehumanisering med sosiale grupper.”












