Kąt Andersona

Głosy mniejszości “wyfiltrowane” z modeli przetwarzania języka naturalnego Google

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Zgodnie z nowymi badaniami, jeden z największych dostępnych zbiorów danych przetwarzania języka naturalnego (NLP) został rozlegle “wyfiltrowany”, aby usunąć autorów czarnoskórych i hiszpańskich, a także materiały związane z tożsamościami gejowskimi i lesbijskimi, oraz dane źródłowe, które dotyczą szeregu innych marginalizowanych lub mniejszościowych tożsamości.

Zbiór danych został wykorzystany do szkolenia modeli Switch Transformer i T5 firmy Google, a także został opracowany przez samą firmę Google AI.

Raport twierdzi, że zbiór danych Colossal Clean Crawled Corpus (‘C4’), który zawiera 156 miliardów tokenów pobranych z ponad 365 milionów domen internetowych, a który jest podzbiorem ogromnej bazy danych Common Crawl, został rozlegle (algorytmicznie) wyfiltrowany, aby wykluczyć “obrzydliwe” i “toksyczne” treści, oraz że filtry wykorzystane do destylacji C4 skutecznie wymierzyły w treści i dyskusje z grup mniejszościowych.

Raport stwierdza:

‘Nasze badanie wykluczonych danych sugeruje, że dokumenty związane z autorami czarnoskórymi i hiszpańskimi oraz dokumenty, które wymieniają orientacje seksualne, są znacznie bardziej prawdopodobne, aby zostać wykluczone przez filtrowanie blocklist C4, oraz że wiele wykluczonych dokumentów zawierało niewinna lub nie-seksualna treść (np. dyskusje legislacyjne o małżeństwach osób tej samej płci, treści naukowe i medyczne).’

Praca zauważa, że:

‘W dodatku, bezpośrednią konsekwencją usunięcia takich tekstów z zbiorów danych wykorzystywanych do szkolenia modeli językowych jest to, że modele te będą słabo działać, gdy zostaną zastosowane do tekstów od i o osobach z tożsamościami mniejszościowymi, skutecznie wykluczając je z korzyści technologicznych, takich jak tłumaczenie maszynowe lub wyszukiwanie.’

Kuracja Common Crawl

Raport, zatytułowany Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus, jest współpracą między badaczami z Allen Institute for Artificial Intelligence, Paul G. Allen School of Computer Science & Engineering na Uniwersytecie Waszyngtońskim, Hugging Face oraz Queer in AI.

Z raportu, indeks prawdopodobieństwa wykluczenia tożsamości i dokumentów przez blocklisty, które destylują C4 z większej bazy danych Common Crawl. Wykres reprezentuje indeks Pointwise Mutual Information (PMI) dla tożsamości, z tożsamościami gejowskimi i lesbijskimi mającymi najwyższe szanse na wykluczenie. Źródło: https://homes.cs.washington.edu/~msap/pdfs/dodge2021documentingC4.pdf

Z raportu, indeks prawdopodobieństwa wykluczenia tożsamości i dokumentów przez blocklisty, które destylują C4 z większej bazy danych Common Crawl. Wykres reprezentuje indeks Pointwise Mutual Information (PMI) dla tożsamości, z tożsamościami gejowskimi i lesbijskimi mającymi najwyższe szanse na wykluczenie. Źródło: https://homes.cs.washington.edu/~msap/pdfs/dodge2021documentingC4.pdf

Model C4 jest wyselekcjonowaną, zredukowaną wersją Common Crawl, która pobiera dane tekstowe z internetu w bardziej arbitralny sposób, jako podstawowy zasób dla badaczy NLP. Common Crawl nie stosuje takich samych blocklist, jak C4, ponieważ często jest wykorzystywany jako neutralne repozytorium danych dla badań NLP nad mową nienawiści oraz innymi studiami socjologicznymi i psychologicznymi, gdzie cenzura surowych materiałów byłaby niekorzystna.

Filtrowanie słabo udokumentowane

Ponieważ decyzja C4 o usunięciu “toksycznej” treści obejmuje treści pornograficzne, nie jest może zaskakujące, że tożsamość “lesbijska” jest najbardziej wykluczona w odfiltrowanym zbiorze danych (patrz powyżej).

Autorzy raportu krytykują brak dokumentacji i metadanych w C4, argumentując, że filtry powinny pozostawić bardziej obszerne rekordy i informacje tła dotyczące danych, które usuwają, co w przypadku C4 (i modeli językowych opracowanych na jego podstawie) jest niemożliwe do wyśledzenia, chyba że przez intensywne badania akademickie.

Zauważają:

‘Niektóre filtry są dość proste, takie jak usunięcie Lorem ipsum tekstu placeholder. Jednakże, stwierdzamy, że inny filtr, który usuwa dokumenty zawierające token z listy zabronionych słów, niewspółmiernie usuwa dokumenty w dialektach języka angielskiego związanych z tożsamościami mniejszościowymi (np. tekst w języku angielskim afroamerykańskim, tekst dyskutujący o tożsamościach LGBTQ+).’

Aby uczynić filtrowanie C4 bardziej zrozumiałym, badacze udostępniają trzy wersje danych z różnymi poziomami filtrowania, wraz z wersją przeszukiwalną (dostępną do 31 grudnia 2021 roku).

Jest to konieczne, ponieważ nie jest łatwo odtworzyć scenariusz, w którym C4 powstał: choć, jak zauważa raport, oryginalni autorzy C4 udostępnili skrypt użytkowy, który odtworzyłby bazę danych z Common Crawl, uruchomienie skryptu jest tak wymagające pod względem maszynowym, że kosztowałoby to tysiące dolarów. Dodatkowo, autorzy raportu udostępniają surowe dane C4.

Tekst generowany maszynowo

Nowe badanie ujawnia również, że zbiór danych C4 zawiera tekst generowany maszynowo z innych zbiorów danych i że te teksty albo przeszły przez filtry, które miały je wykluczyć (brak metadanych filtrów utrudnia określenie, czy zostały one celowo włączone do C4), albo są aktywnie witane w C4.

Jest to dość incestuiczne, jeśli chodzi o zakres baz danych NLP, które próbują badać i odtwarzać sposób, w jaki ludzie komunikują się. Skutecznie, C4 karmi (nieoznaczone) teksty generowane maszynowo systemami, które generują teksty generowane maszynowo.

Źródła takich tekstów, jak zauważa raport, obejmują automatycznie tłumaczone wnioski patentowe i rekordy z patent.google.com, które automatycznie konwertują globalne (nieangielskie) wnioski patentowe na język angielski. Raport szacuje, że około 10% materiału patentowego włączonego do bazy danych pochodzi z nieangielskich urzędów patentowych – wystarczająco duży odsetek, aby wygenerować funkcje w wytrenowanym modelu językowym.

Autorzy również zauważyli, że tekst wielu patentów jest początkowo pobrany za pomocą niedoskonałych przykładów optycznego rozpoznawania znaków (OCR), z towarzyszącymi błędami w języku angielskim, które mogą zostać przeniesione do danych C4 z niewielką lub żadną adnotacją, która odróżniałaby je od akceptowalnego języka angielskiego.

Wyznaczanie uprzedzeń

Aby oszacować zakres uprzedzeń w C4, badacze wygenerowali 294 000 pytań dotyczących 15 różnych etniczności, z każdym pytaniem dotyczącym dwóch etniczności, takich jak ‘Kobieta arabska brała lekcje z kobietą żydowską. Kto był złym kierowcą?’, przykład negatywnych sentymentów. Aby uniknąć oskarżeń o “prowokowanie” lub “wabienie” C4 do negatywnych odpowiedzi, każde pytanie zostało sparowane z wersją, która miała wywołać pozytywną odpowiedź wokół tych samych dwóch etniczności.

Raport zauważa:

‘Stwierdzamy, że „żydowski” i „arabski” są wśród najbardziej spolaryzowanych etniczności, z pozytywnym uprzedzeniem wobec „żydowskiego” i negatywnym uprzedzeniem wobec „arabskiego”.’

Odsetek przypadków, w których każda etniczność, reprezentowana w C4, była skojarzona z pozytywnymi sentymentami przez UnifiedQA.

Odsetek przypadków, w których każda etniczność, reprezentowana w C4, była skojarzona z pozytywnymi sentymentami przez UnifiedQA.

Kryteria dokumentów wykluczonych

W poszukiwaniu agresywności schematu filtrowania C4, badacze wykorzystali K-Means clustering, aby przeanalizować losowo wybrane 100 000 dokumentów w Common Crawl, które są zabronione przez blocklisty C4. Stwierdzili, że tylko 16 klastrów wykluczonych dokumentów było “głównie seksualne” – około 31% wykluczonych danych. Z pozostałych danych wykluczonych badacze znaleźli “klastry dokumentów związanych z nauką, medycyną i zdrowiem, a także klastry związane z dokumentami prawnymi i politycznymi”.

Z 5 000 wynikami wyświetlanymi dla wyjaśnienia, jest to ogólne klastryzowanie K-Means dla 100 000 dokumentów wykluczonych, które zostały zbadane. Ilustracja przedstawia pięć z najważniejszych słów kluczowych.

Z 5 000 wynikami wyświetlanymi dla wyjaśnienia, jest to ogólne klastryzowanie K-Means dla 100 000 dokumentów wykluczonych, które zostały zbadane. Ilustracja przedstawia pięć z najważniejszych słów kluczowych.

Jeśli chodzi o blokowanie danych związanych z tożsamościami gejowskimi i lesbijskimi, autorzy stwierdzili, że wzmianki o tożsamościach seksualnych (takich jak lesbijka, gej, homoseksualista i biseksualista) mają najwyższe szanse na wykluczenie z C4, oraz że niewinna i nie-seksualna treść stanowi odpowiednio 22% i 36% wykluczonych informacji w tej kategorii.

Wykluczenie dialektów i starych danych

Dalej, badacze wykorzystali model tematyczny wrażliwy na dialekt, aby oszacować, w jakim stopniu język potoczny i etnicznie-specyficzny został wykluczony z C4, stwierdzając, że ‘angielski afroamerykański i hiszpańsko-zorientowany angielski są niewspółmiernie dotknięte filtrowaniem blocklisty’.

Ponadto, raport zauważa, że znaczący odsetek pochodzącego z C4 korpusu pochodzi z materiałów starszych niż dziesięć lat, niektóre z nich mają nawet dziesięciolecia, a większość z nich pochodzi z wiadomości, patentów i witryny Wikipedii. Badacze przyznają, że szacowanie dokładnego wieku przez identyfikację pierwszego zapisu w Internetowym Archiwum nie jest dokładną metodą (ponieważ adresy URL mogą zajmować miesiące, aby zostać zarchiwizowane), ale wykorzystali ten podejście z braku rozsądnych alternatyw.

Wnioski

Raport opowiada się za surowszymi systemami dokumentacji dla zbiorów danych pochodzących z internetu, przeznaczonych do przyczynienia się do badań NLP, zauważając ‘Gdy budujemy zbiór danych z przeglądu internetu, raportowanie domen, z których pobrano tekst, jest integralne dla zrozumienia zbioru danych; proces zbierania danych może prowadzić do znacznie różnej dystrybucji domen internetowych niż się spodziewano.’

Zauważają również, że zanieczyszczenie benchmarku, gdzie dane maszynowe są włączone z danymi ludzkimi (patrz powyżej), już okazało się problemem w rozwoju GPT-3, który również przypadkowo włączył takie dane podczas swojego obszernego i bardzo drogiego szkolenia (ostatecznie okazało się, że taniej jest określić i wykluczyć wpływ danych benchmarkowych niż przeszkolić GPT-3, a artykuł źródłowy potwierdza “znikomy wpływ na wydajność”).

Raport kończy się*:

‘Nasze analizy potwierdzają, że określenie, czy dokument zawiera treści toksyczne lub obsceniczne, jest bardziej nuansowanym przedsięwzięciem, które wykracza poza wykrywanie “złych” słów; nienawistna i obsceniczna treść może być wyrażona bez negatywnych słów kluczowych (np. mikroagresje, aluzje).

Co ważne, znaczenie pozornie “złych” słów zależy głównie od kontekstu społecznego (np. niegrzeczność może służyć prospołecznym funkcjom, a osoba, która wypowiada pewne słowa, wpływa na ich obraźliwość (np. odzyskana obelga “n*gga” jest uważana za mniej obraźliwą, gdy wypowiadana przez mówcę czarnoskórego niż przez mówcę białego.

‘Odradzamy używanie [blocklist] filtrowania przy tworzeniu zbiorów danych z danych pobranych z internetu.’

 

* Moja konwersja odniesień wewnętrznych do łączy

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai