Modely a platformy AI

Nová studie se snaží zlepšit algoritmy pro detekci hate speech

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Společnosti provozující sociální média, zejména Twitter, čelily již dlouho kritice za to, jak označují projevy a rozhodují o zrušení účtů. Základní problém téměř vždy souvisí s algoritmy, které používají k monitorování online příspěvků. Systémy umělé inteligence jsou daleko od dokonalosti, pokud jde o tuto úlohu, ale neustále se na nich pracuje, aby je bylo možné zlepšit.

Mezi touto prací je i nová studie z University of Southern California, která se snaží snížit určité chyby, které by mohly vést k rasovým předsudkům.

Nezjištění kontextu

Jedním z problémů, které nedostávají dostatečnou pozornost, je, že algoritmy určené k zastavení šíření nenávistných projevů ve skutečnosti zesilují rasové předsudky. To se stává, když algoritmy nezohledňují kontext a zakazují nebo blokují tweety menšinových skupin.

Největším problémem algoritmů v souvislosti s kontextem je, že jsou příliš citlivé na určitá skupina identifikátorů, jako je “černý”, “gay” a “transgender”. Algoritmy považují tyto identifikátory za klasifikátory nenávistných projevů, ale často je používají členové těchto skupin a kontext je důležitý.

V pokusu o řešení problému slepoty kontextu vytvořili výzkumníci více kontextově citlivý klasifikátor nenávistných projevů. Nový algoritmus je méně pravděpodobně označí příspěvek jako nenávistný projev.

Algoritmus

Výzkumníci vyvinuli nový algoritmus s dvěma novými faktory: kontextem ve vztahu ke skupinovým identifikátorům a zda jsou v příspěvku přítomny další rysy nenávistných projevů, jako je dehumanizující jazyk.

Brendan Kennedy je doktorand počítačové vědy a spolueditor studie, která byla zveřejněna 6. července na ACL 2020.

“Chceme přivést detekci nenávistných projevů blíže k tomu, aby byla připravena pro použití v reálném světě,” řekl Kennedy.

“Modely detekce nenávistných projevů často ‘selhávají’ nebo generují špatné předpovědi, když jsou vystaveny reálným datům, jako jsou sociální média nebo jiná online textová data, protože jsou ovlivněny daty, na kterých byly vyškoleny, aby spojily výskyt sociálních identifikátorů s nenávistnými projevy.”

Důvod, proč jsou algoritmy často nepřesné, je ten, že jsou vyškoleny na nevyvážených datech s extrémně vysokými mírami nenávistných projevů. V důsledku toho algoritmy nezískávají znalosti, jak zvládat to, co sociální média ve skutečnosti vypadají v reálném světě.

Profesor Xiang je odborník na zpracování přirozeného jazyka.

“Je důležité, aby modely neignorovaly identifikátory, ale spojily je s příslušným kontextem,” řekl Ren.

“Pokud naučíte model z nevyváženého datasetu, model začne rozpoznávat podivné vzorce a blokovat uživatele nevhodně.”

K otestování algoritmu použili výzkumníci náhodný vzorek textu ze dvou sociálních médií s vysokou mírou nenávistných projevů. Text byl nejprve ručně označen lidmi jako předsudkový nebo dehumanizující. Model současného stavu byl poté měřen proti modelu výzkumníků pro nevhodné označení ne-nenávistných projevů pomocí 12 500 článků z New York Times bez nenávistných projevů. Zatímco modely současného stavu dosáhly 77% přesnosti při identifikaci nenávistných projevů, model výzkumníků dosáhl 90%.

“Tato práce sama o sobě nedělá detekci nenávistných projevů dokonalou, je to obrovský projekt, na kterém pracuje mnoho lidí, ale dělá postupný pokrok,” řekl Kennedy.

“Kromě prevence toho, aby sociální média příspěvky členů chráněných skupin byly nevhodně cenzurovány, doufáme, že naše práce pomůže zajistit, aby detekce nenávistných projevů nezpůsobovala zbytečné poškození tím, že posiluje falešné asociace předsudků a dehumanizace se sociálními skupinami.”

Alex vede AI‑poháněné zpravodajské operace společnosti Unite.AI, spojující žurnalistiku, výzkum a automatizaci, aby podpořil včasné a škálovatelné pokrytí umělé inteligence. Jeho práce pomáhá zajistit, aby se nové vývoje umělé inteligence rychle objevovaly, a to při zachování redakčních standardů publikace.