AI-modeller og plattformer

Ny studie forsøker å forbedre hadetalgoritmer

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Sosiale medier, spesielt Twitter, har lenge vært kritisert for hvordan de merker tale og bestemmer hvilke kontoer som skal bli forbudt. Det underliggende problemet har nesten alltid å gjøre med algoritmene de bruker for å overvåke nettinnlegg. Kunstig intelligens-systemer er langt ifra perfekte når det gjelder denne oppgaven, men det pågår kontinuerlig arbeid for å forbedre dem.

Inkludert i dette arbeidet er en ny studie fra University of Southern California som forsøker å redusere visse feil som kan føre til rasistisk bias.

Feil i å gjenkjenne kontekst

En av problemene som ikke får så mye oppmerksomhet, har å gjøre med algoritmer som er ment å stoppe spredningen av hatfulle uttalelser, men som i stedet forsterker rasistisk bias. Dette skjer når algoritmene ikke klarer å gjenkjenne konteksten og ender opp med å merke eller blokkere twit fra minoritetsgrupper.

Det største problemet med algoritmene i forhold til kontekst, er at de er for følsomme overfor visse gruppe-identifiserende termer som “svart”, “homofil” og “transperson”. Algoritmene betrakter disse som hat-tale-klassifiseringer, men de brukes ofte av medlemmer av disse gruppene, og konteksten er viktig.

I et forsøk på å løse dette problemet med kontekst-blindhet, skapte forskerne en mer kontekst-følsom hat-tale-klassifisering. Den nye algoritmen er mindre sannsynlig til å feilmerke en post som hat-tale.

Algoritmen

Forskerne utviklet de nye algoritmene med to nye faktorer i mente: konteksten i forhold til gruppe-identifikatorer, og om det også er andre trekk ved hat-tale som er til stede i innlegget, som for eksempel dehumaniserende språk.

Brendan Kennedy er en datavitenskaps-student og med-forfatter av studien, som ble publisert den 6. juli på ACL 2020.

“Vi ønsker å bringe hat-tale-oppdaging nærmere å være klar for virkelige verden-applikasjoner,” sa Kennedy.

“Hat-tale-oppdaging-modeller bryter ofte sammen, eller genererer dårlige forutsigelser, når de introduseres til virkelige verden-data, som sosiale medier eller andre nett-tekst-data, fordi de er forvrengt av dataene de er trent på å assosiere fremtoningen av sosiale identifikatorer med hat-tale.”

Grunden til at algoritmene ofte er upresise, er at de er trent på ubalanserte datasett med ekstremt høye hat-tale-rater. På grunn av dette, klarer algoritmene ikke å lære hvordan de skal håndtere hva sosiale medier faktisk ser ut i den virkelige verden.

Professor Xiang er en ekspert på naturlig språk-behandling.

“Det er nøkkel for modeller å ikke ignorere identifikatorer, men å matche dem med riktig kontekst,” sa Ren.

“Hvis du lærer en modell fra et ubalansert datasett, begynner modellen å plukke opp underlige mønster og blokkere brukere på en upassende måte.”

For å teste algoritmen, brukte forskerne en tilfeldig sampel av tekst fra to sosiale medier som har en høy rate av hat-tale. Teksten ble først merket av mennesker som fordomsfulle eller dehumaniserende. Den beste modellen ble målt mot forskernes egen modell for å feilmerke ikke-hat-tale, gjennom bruk av 12 500 New York Times-artikler uten hat-tale. Mens den beste modellen kunne oppnå 77% nøyaktighet i å identifisere hat-tale mot ikke-hat-tale, var forskernes modell høyere med 90%.

“Dette arbeidet alene gjør ikke hat-tale-oppdaging perfekt, det er et enormt prosjekt som mange arbeider på, men det gjør inkrementell fremgang,” sa Kennedy.

“I tillegg til å forhindre at sosiale medier-innlegg fra medlemmer av beskyttede grupper blir feilmerket, håper vi at vårt arbeid vil hjelpe til å sikre at hat-tale-oppdaging ikke gjør unødvendig skade ved å forsterke feilaktige assosiasjoner av fordom og dehumanisering med sosiale grupper.”

Alex leder Unite.AI sine AI-drevne nyhetsoperasjoner, og kombinerer journalistikk, forskning og automatisering for å støtte rettidig og skalerbar dekning av kunstig intelligens. Arbeidet hans bidrar til å sikre at fremvoksende AI‑utviklinger blir fremhevet effektivt, samtidig som publikasjonens redaksjonelle standarder opprettholdes.