Andersonův úhel

Hlasy menšin ‘filtrované’ z modelů Google Natural Language Processing

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Podle nové studie bylo jedno z největších dostupných souborů Natural Language Processing (NLP) rozsáhle ‘filtrované’, aby se odstranili autoři černé a hispánské původu, stejně jako materiály související s gay a lesbickými identitami a zdrojová data, která se zabývají řadou dalších okrajových nebo menšinových identit.

Soubor dat byl použit k výcviku modelů Google Switch Transformer a T5 model, a byl kurátorem Google AI sám.

Zpráva tvrdí, že Colossal Clean Crawled Corpus (‘C4’) soubor dat, který obsahuje 156 miliard tokenů z více než 365 milionů internetových domén, a je podmnožinou obrovské Common Crawl vyčerpávající databáze, byl rozsáhle (algoritmicky) filtrován, aby se vyloučily ‘útočné’ a ‘toxické’ obsahy, a že filtry použité k destilaci C4 účinně zaměřily obsah a diskusi z menšinových skupin.

Zpráva uvádí:

‘Naše zkoumání vyloučených dat naznačuje, že dokumenty spojené s černými a hispánskými autory a dokumenty, které zmiňují sexuální orientace, jsou významně více pravděpodobné, že budou vyloučeny C4.EN’s blocklist filtrováním, a že mnoho vyloučených dokumentů obsahovalo neútočný nebo ne-sexuální obsah (například legislativní diskuse o stejnopohlavním manželství, vědecký a lékařský obsah).’

Práce poznamenává, že zjištění zhoršují existující jazykové rasové nerovnosti v NLP sektoru, stejně jako stigmatizují LGBTQ+ identitu. Dále uvádí:

‘Kromě toho je přímým důsledkem odstranění takového textu z datových souborů, které se používají k výcviku jazykových modelů, že modely budou fungovat špatně, když se aplikují na text od a o lidech s menšinovými identitami, efektivními je vylučují z výhod technologií, jako je strojový překlad nebo vyhledávání.’

Kurátorská činnost Common Crawl

Zpráva, nazvaná Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus, je spoluprací mezi výzkumníky z Allen Institute for Artificial Intelligence, Paul G. Allen School of Computer Science & Engineering na University of Washington, Hugging Face a Queer in AI.

Z zprávy, index pravděpodobnosti identity a dokumentů, které jsou filtrovány blocklisty, které destilují C4 z větší Common Crawl databáze. Graf reprezentuje index Pointwise Mutual Information (PMI) pro identity, s gay a lesbickými identitami, které mají nejvyšší šanci být filtrovány.

Z zprávy, index pravděpodobnosti identity a dokumentů, které jsou filtrovány blocklisty, které destilují C4 z větší Common Crawl databáze. Graf reprezentuje index Pointwise Mutual Information (PMI) pro identity, s gay a lesbickými identitami, které mají nejvyšší šanci být filtrovány. Source: https://homes.cs.washington.edu/~msap/pdfs/dodge2021documentingC4.pdf

C4 model je kurátorská, zmenšená verze Common Crawl webového korpusu, který vyčerpává textová data z internetu více nahodile, jako základního zdroje pro NLP výzkumníky. Common Crawl neaplikuje stejné typy blocklistů jako C4, protože je často používán jako neutrální úložiště dat pro NLP výzkum do hate speech a pro další sociologické/psychologické studie, kde cenzura surového materiálu by byla kontraproduktivní.

Poddokumentovaná filtrace

Jelikož C4’s rozhodnutí odstranit ‘toxické’ obsahy zahrnuje pornografický obsah, není překvapivé, že ‘lesbické’ identity jsou nejvíce vyloučeny v rafinovaném souboru dat (viz obrázek výše).

Autoři práce kritizují nedostatek dokumentace a metadat v C4, prosazují, že filtry by měly zanechat více rozsáhlé záznamy a pozadí a motivy týkající se dat, která odstraňují, která, v případě C4 (a jazykových modelů vyvinutých z něj) je jinak nezjistitelná kromě prostřednictvím soustředěného akademického výzkumu.

Poznamenávají:

‘Některé filtry jsou relativně přímočaré, jako je odstranění Lorem ipsum placeholder textu. Nicméně, zjistili jsme, že jiný filtr, který odstraňuje dokumenty, které obsahují token z banned word listu, nerovnoměrně odstraňuje dokumenty v dialektech angličtiny spojených s menšinovými identitami (například text v African American English, text, který diskutuje LGBTQ+ identitu).’

Aby se stal rozsah C4’s filtrace více srozumitelný, výzkumníci hostují tři verze dat s různými úrovněmi filtrace aplikované, spolu s vyhledávací verzí (dostupné do 31. prosince 2021).

To je nezbytné, protože není snadné rekonstruovat scénář, ve kterém C4 vznikl: ačkoli autoři původní práce poskytli uživatelský skript, který bude rekonstruovat databázi z Common Crawl, spuštění skriptu je tak strojově intenzivní, že by to stálo tisíce dolarů. Kromě toho, autoři práce hostují surová C4 data.

Rekurzivní strojově generovaný text

Nový výzkum také zjistil, že filtrovaný C4 soubor dat obsahuje strojově generovaný text z datových souborů, a že tyto buď prošly filtry navržené k jejich vyloučení (nedostatek filtrů metadat činí obtížným určit), nebo jsou aktivně vítány do C4.

To je docela incestní, pokud jde o rozsah NLP databází, které se snaží studovat a replikovat způsob, jakým lidé komunikují. Efektivně, C4 krmit (nepojmenované) strojově generovaný text do systémů, které generují strojově generovaný text.

Zdroje takového textu, práce poznamenává, zahrnují auto-přeložené patentové přihlášky a záznamy z patent.google.com, které automaticky převádějí globální (neanglické) patentové přihlášky do angličtiny. Zpráva odhaduje, že kolem 10% patentového materiálu zahrnutého v databázi pochází z neanglických patentových úřadů – dostatečně velký procentuální podíl, aby generoval funkce v trénovaném jazykovém modelu.

Autoři také pozorovali, že text mnoha patentů je původně získán prostřednictvím nedokonalých příkladů Optical Character Recognition (OCR), s jejich doprovodnými chybami v angličtině, které mohou být přeneseny do C4 dat s malou nebo žádnou anotací, která by je odlišila od přijatelné angličtiny.

Určení zkreslení

Aby se určilo rozsah zkreslení v C4, výzkumníci vygenerovali 294 000 otázek pokrývajících 15 různých etnických skupin, s každou otázkou se zabývající dvěma etnickými skupinami, jako je ‘Arabská žena se účastnila tříd s židovskou ženou. Kdo byl špatným řidičem?’, příklad negativní sentimentu. Aby se zabránilo obviněním z ‘provokace’ nebo ‘baitingu’ C4 do negativních odpovědí, každá otázka byla spárována s verzí navrženou k vyvolání pozitivní odpovědi kolem stejné dvě etnické skupiny.

Práce poznamenává:

‘Zjistili jsme, že “židovský” a “arabský” jsou mezi nejvíce polarizovanými etnickými skupinami, s pozitivním zkreslením vůči “židovskému” a negativním zkreslením vůči “arabskému”.’

Podíl případů, kdy každá etnická skupina, reprezentovaná v C4, byla spojena s pozitivním sentimentem UnifiedQA.

Podíl případů, kdy každá etnická skupina, reprezentovaná v C4, byla spojena s pozitivním sentimentem UnifiedQA.

Kritéria pro vyloučené dokumenty

Při snaze porozumět agresivitě C4’s filtrace, výzkumníci použili K-Means clustering k analýze náhodně vybraných 100 000 dokumentů v Common Crawl, které jsou zakázány C4’s blocklisty. Zjistili, že pouze 16 clusterů vyloučených dokumentů byly ‘většinou sexuální’ povahy – kolem 31% celkových dat, která byla zakázána z C4. Z toho, co zbývá z vyloučených dat, výzkumníci našli ‘klustry dokumentů souvisejících s vědou, medicínou a zdravím, stejně jako klustry související s právními a politickými dokumenty’.

S 5 000 výsledky zobrazenými pro jasnost, toto je obecné K-means clustering pro 100 000 vyloučených dokumentů studovaných. Ilustrace ukazuje pět z top klíčových slov prozkoumaných.

S 5 000 výsledky zobrazenými pro jasnost, toto je obecné K-means clustering pro 100 000 vyloučených dokumentů studovaných. Ilustrace ukazuje pět z top klíčových slov prozkoumaných.

Pokud jde o blokování dat souvisejících s gay a lesbickými identitami, autoři zjistili, že zmínky o sexuální identitě (jako je lesbické, gay, homosexuální a bisexuální) mají nejvyšší šanci být filtrovány pro C4, a že neútočné a ne-sexuální dokumenty tvoří 22% a 36%, resp., z informací v této kategorii, které jsou vyloučeny z C4.

Vyloučení dialektů a stará data

Dále výzkumníci použili dialect-aware topic model k odhadu rozsahu, v jakém je kolokviální, etnicity-specifický jazyk vyloučen z C4, a zjistili, že ‘African American English a Hispanic-aligned English jsou nerovnoměrně ovlivněny blocklist filtrováním’.

Kromě toho práce poznamenává, že významný procentuální podíl C4 odvozeného korpusu pochází z materiálu starého více než deset let, některé z nich jsou desetiletí staré, a většina z nich pochází z novin, patentů a webové stránky Wikipedie. Výzkumníci uznávají, že odhad přesného věku identifikací prvního uložení v Internet Archive není přesnou metodou (protože URL mohou trvat měsíce, než budou uloženy), ale použili tento přístup vzhledem k nedostatku rozumných alternativ.

Závěr

Práce prosazuje přísnější dokumentační systémy pro internetově odvozené datové soubory určené k přispění do NLP výzkumu, poznamenávající ‘Když stavíte datový soubor z vyčerpání webu, reporting domén, ze kterých je text vyčerpán, je integrální pro pochopení datového souboru; proces sběru dat může vést k významně odlišnému rozložení internetových domén, než by se očekávalo.’

Poznamenávají také, že kontaminace benchmarku, kde jsou strojově generovaná data zahrnuta s lidskými daty (viz výše), již se ukázala jako problém při vývoji GPT-3, který také náhodně zahrnoval taková data během svého rozsáhlého a velmi drahého tréninku (nakonec se ukázalo, že je levnější kvantifikovat a vyloučit vliv benchmark dat, než přeškolit GPT-3, a zdrojový dokument dosvědčuje ‘zanedbatelný dopad na výkon’).

Zpráva uzavírá*:

‘Naše analýzy potvrzují, že určení, zda dokument má toxické nebo urážlivé obsahy, je nuancovanějším úkolem, který jde za hranice detekce “špatných” slov; nenávistné a urážlivé obsahy mohou být vyjádřeny bez negativních klíčových slov (například mikroagrese, narážky).

Věc, která zdánlivě “špatná” slova, silně závisí na sociálním kontextu (například nezdvořilost může sloužit prosociálním funkcím, a kdo říká určitá slova ovlivňuje jejich urážlivost (například znovuzískaná urážka “n*gga” je považována za méně urážlivou, když je vyslovena černým mluvčím než bílým mluvčím.

‘Doporučujeme proti použití [blocklist] filtrování při konstrukci datových souborů z web-crawled dat.’

 

* Moje konverze in-line citací na hypertextové odkazy

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai