AI-modeller och plattformar
Ny studie försöker förbättra algoritmer för upptäckt av hatprat
Sociala medieföretag, särskilt Twitter, har länge fått kritik för hur de flaggar tal och beslutar vilka konton som ska stängas. Det underliggande problemet har nästan alltid att göra med de algoritmer som de använder för att övervaka onlineinlägg. Artificiell intelligens är långt ifrån perfekt när det gäller denna uppgift, men det pågår ständigt arbete för att förbättra dem.
Bland det arbetet finns en ny studie från University of Southern California som försöker minska vissa fel som kan leda till rasistisk bias.
Misslyckande att känna igen sammanhang
En av de frågor som inte får så mycket uppmärksamhet har att göra med algoritmer som är avsedda att stoppa spridningen av hatiskt tal, men som i själva verket förstärker rasistisk bias. Detta sker när algoritmerna inte kan känna igen sammanhang och i stället flaggar eller blockerar tweets från minoritetsgrupper.
Det största problemet med algoritmerna när det gäller sammanhang är att de är för känsliga för vissa gruppidentifikatorer som “svart”, “homosexuell” och “transgender”. Algoritmerna betraktar dessa som hatprat, men de används ofta av medlemmar i dessa grupper och sammanhanget är viktigt.
I ett försök att lösa detta problem med sammanhangsblindhet skapade forskarna en mer sammanhangskänslig hatpratalgoritm. Den nya algoritmen är mindre benägen att felaktigt märka en post som hatprat.
Algoritmen
Forskarna utvecklade de nya algoritmerna med två nya faktorer i åtanke: sammanhanget i förhållande till gruppidentifikatorerna och om det också finns andra hatprategenskaper i inlägget, som avhumaniserande språk.
Brendan Kennedy är en doktorand i datavetenskap och medförfattare till studien, som publicerades den 6 juli på ACL 2020.
“Vi vill föra hatpratupptäckt närmare att vara redo för verkliga tillämpningar”, sa Kennedy.
“Hatpratupptäcktsmodeller ‘bryts’, eller genererar dåliga förutsägelser, när de introduceras till verkliga data, som sociala medier eller annan online-textdata, eftersom de är fördomade av de data som de tränas på för att associera utseendet av sociala identifikatorer med hatprat.”
Anledningen till att algoritmerna ofta är inkorrekta är att de tränas på obalanserade dataset med extremt höga halter av hatprat. På grund av detta lyckas algoritmerna inte lära sig att hantera vad sociala medier faktiskt ser ut i den verkliga världen.
Professor Xiang är expert på naturligt språkbehandling.
“Det är nyckeln för modeller att inte ignorera identifikatorer, utan att matcha dem med rätt sammanhang”, sa Ren.
“Om du lär en modell från ett obalanserat dataset, börjar modellen att plocka upp konstiga mönster och blockera användare på ett olämpligt sätt.”
För att testa algoritmen använde forskarna ett slumpmässigt urval av text från två sociala medier som har en hög andel hatprat. Texten var först manuellt flaggad av människor som fördomsfull eller avhumaniserande. Den mest avancerade modellen mättes sedan mot forskarnas egen modell för att felaktigt flagga icke-hatprat, genom att använda 12 500 New York Times-artiklar med inget hatprat. Medan de mest avancerade modellerna kunde uppnå 77% noggrannhet i att identifiera hatprat kontra icke-hatprat, var forskarnas modell högre med 90%.
“Detta arbete i sig gör inte hatpratupptäckt perfekt, det är ett stort projekt som många arbetar på, men det gör inkrementellt framsteg”, sa Kennedy.
“Förutom att förhindra att sociala medieinlägg från medlemmar i skyddade grupper censureras på ett olämpligt sätt, hoppas vi att vårt arbete kommer att bidra till att se till att hatpratupptäckt inte skadar i onödan genom att förstärka felaktiga associationer av fördomar och avhumanisering med sociala grupper.”












