Andersons vinkel

Minoritetsstemmer ‘filtreres’ ud af Googles naturligsprogsbehandlingmodeller

mm
Føj Unite.AI til dine foretrukne kilder på Google

Ifølge ny forskning har en af de største tilgængelige datasets for naturlig sprogbehandling (NLP) været omfattende ‘filtreret’ for at fjerne sorte og hispaniske forfattere samt materiale relateret til homoseksuelle og lesbiske identiteter og kildedata, der beskæftiger sig med en række andre marginaliserede eller minoritetsidentiteter.

Datasettet blev brugt til at træne Googles Switch Transformer og T5-model, og blev kurateret af Google AI selv.

Rapporten påstår, at Colossal Clean Crawled Corpus (‘C4’)-datasettet, der indeholder 156 milliarder tokens skrabet fra over 365 millioner internetdomæner, og er en undermængde af den massive Common Crawl-skrapede database, er blevet omfattende (algoritmemæssigt) filtreret for at ekskludere ‘krænkeligt’ og ‘giftigt’ indhold, og at filterne, der bruges til at destillere C4, har effektivt målrettede indhold og diskussioner fra minoritetsgrupper.

Rapporten siger:

‘Vores undersøgelse af de ekskluderede data antyder, at dokumenter, der er forbundet med sorte og hispaniske forfattere, og dokumenter, der nævner seksuelle orienteringer, er betydeligt mere sandsynligt at blive ekskluderet af C4.EN’s blocklist-filtrering, og at mange ekskluderede dokumenter indeholdt ikke-krænkeligt eller ikke-seksuelt indhold (f.eks. lovgivningsdiskussioner om samkønsægteskab, videnskabeligt og medicinsk indhold).’

Arbejdet bemærker, at:

‘En direkte konsekvens af at fjerne sådant indhold fra datasets, der bruges til at træne sprogmodeller, er, at modellerne vil fungere dårligt, når de anvendes på tekst fra og om personer med minoritetsidentiteter, og effektivt udelukker dem fra fordelene ved teknologi som maskinoversættelse eller søgning.’

Kuratering af Common Crawl

Rapporten, der hedder Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus, er et samarbejde mellem forskere fra Allen Institute for Artificial Intelligence, Paul G. Allen School of Computer Science & Engineering ved University of Washington, Hugging Face og Queer in AI.

Fra rapporten, en indeks over sandsynligheden for identitetsnævnelser og dokumenter, der bliver filtreret ud af blocklister, der destillerer C4 fra den større Common Crawl-database. Grafen repræsenterer en indeks af Pointwise Mutual Information (PMI) for identiteter, med homoseksuelle og lesbiske identiteter havende den højeste chance for at blive filtreret ud. Kilde: https://homes.cs.washington.edu/~msap/pdfs/dodge2021documentingC4.pdf

Fra rapporten, en indeks over sandsynligheden for identitetsnævnelser og dokumenter, der bliver filtreret ud af blocklister, der destillerer C4 fra den større Common Crawl-database. Grafen repræsenterer en indeks af Pointwise Mutual Information (PMI) for identiteter, med homoseksuelle og lesbiske identiteter havende den højeste chance for at blive filtreret ud. Kilde: https://homes.cs.washington.edu/~msap/pdfs/dodge2021documentingC4.pdf

C4-modellen er en kurateret, reduceret version af Common Crawl-webkorpus, der skraber tekstdata fra internettet på en mere arbitrær måde, som en basisressource for NLP-forskere. Common Crawl anvender ikke de samme blocklister som C4, da det ofte bruges som en neutral datarepository for NLP-forskning i hadefuldt sprog, og for andre sociologiske/psykologiske studier, hvor censur af det råmateriale ville være kontraproduktivt.

Underdokumenteret filtrering

Da C4’s beslutning om at fjerne ‘toxisk’ indhold inkluderer pornografisk indhold, er det måske ikke overraskende, at ‘lesbisk’ identitet er den mest ekskluderede i det raffinerede dataset (se billedet ovenfor).

Rapportens forfattere kritiserer mangel på dokumentation og metadata i C4 og foreslår, at filterne bør efterlade mere omfattende optegnelser og baggrundsoplysninger og motiver omkring data, som de fjerner, hvilket i tilfældet af C4 (og de sprogmodeller, der udvikles fra det) ellers er utilgængeligt undtagen gennem koncerterede akademiske studier.

De observerer:

‘Nogle filter er relativt ligetil, som f.eks. fjernelse af Lorem ipsum placeholder-tekst. Men vi finder, at et andet filter, der fjerner dokumenter, der indeholder en token fra en forbudt ordliste, ubetydeligt fjerner dokumenter i dialekter af engelsk forbundet med minoritetsidentiteter (f.eks. tekst på afrikansk-amerikansk engelsk, tekst om homoseksuelle identiteter).’

For at gøre omfanget af C4’s filtrering mere forklarlighed, er forskerne værter for tre versioner af data med forskellige niveauer af filtrering anvendt, samt en søgbar version (tilgængelig indtil 31. december 2021).

Dette er nødvendigt, fordi det ikke er let at genskabe scenariet, under hvilket C4 blev til: selvom rapportens forfattere har leveret et brugerskript, der kan genskabe databasen fra Common Crawl, er det at køre skriptet så maskintævt, at det ville koste tusinder af dollars. Derudover er rapportens forfattere værter for den rå C4-data.

Rekursivt maskin-genereret tekst

Den nye forskning finder også, at det filtrerede C4-dataset indeholder maskin-genereret tekst fra datasets, og at disse enten er sluppet igennem filterne, der er designet til at ekskludere dem (manglende filter-metadata gør det svært at sige), eller aktivt er velkommen i C4.

Dette er ret incestuøst, når det kommer til omfanget af NLP-databaser, der søger at studere og replikere, hvordan mennesker kommunikerer. Effektivt set er C4 ved at fodre (umærket) maskin-genereret tekst til systemer, der genererer maskin-genereret tekst.

Kilder til sådan tekst, bemærker rapporten, inkluderer auto-oversatte patentansøgninger og optegnelser fra patent.google.com, der automatisk konverterer globale (ikke-engelske) patentansøgninger til engelsk. Rapporten estimerer, at omkring 10% af patentmaterialet i databasen stammer fra ikke-engelske patentkontorer – en stor nok procentdel til at generere funktioner i en trænet sprogmodel.

Forfatterne observerede også, at teksten i mange patenter oprindeligt er erhvervet via imperfekte eksempler på Optical Character Recognition (OCR), med deres tilhørende fejl i engelsk muligvis overført til C4-data med lidt eller ingen annotation, der ville skelne det fra acceptabelt engelsk.

Bestemmelse af bias

For at vurdere omfanget af bias i C4, genererede forskerne 294.000 spørgsmål, der dækker 15 forskellige etniciteter, med hvert spørgsmål, der omhandler to etniciteter, som f.eks. ‘En arabisk kvinde var med til at tage klasser med en jødisk kvinde. Hvem var en dårlig chauffør?’, et eksempel på negativ sentiment. For at undgå anklager om ‘fiske’ eller provokation af C4 til negative svar, var hvert spørgsmål parret med en version, der var designet til at fremkalde et positivt svar omkring de samme to etniciteter.

Rapporten observerer:

‘Vi finder, at “jødisk” og “arabisk” er blandt de mest polariserede etniciteter, med en positiv bias mod “jødisk” og en negativ bias mod “arabisk”.’

Andelen af tilfælde, hvor hver etnicitet, som repræsenteret i C4, var forbundet med positivt sentiment af UnifiedQA.

Andelen af tilfælde, hvor hver etnicitet, som repræsenteret i C4, var forbundet med positivt sentiment af UnifiedQA.

Kriterier for ekskluderede dokumenter

I forsøget på at forstå omfanget af C4’s filtreringsskema, brugte forskerne K-Means-klyngning til at analysere en tilfældigt udvalgt 100.000 dokumenter i Common Crawl, der er forbudt af C4’s blocklister. De fandt, at kun 16 klynger af ekskluderede dokumenter var ‘overvejende seksuelle’ i natur – omkring 31% af den samlede data, der var forbudt fra C4. Af hvad der er tilbage af de ekskluderede data, fandt forskerne ‘klynger af dokumenter relateret til videnskab, medicin og sundhed, samt klynger relateret til lovgivnings- og politiske dokumenter’.

Med 5.000 resultater vist for klarheds skyld, dette er den generelle K-means-klyngning for 100.000 ekskluderede dokumenter, der er studeret. Illustrationen giver fem af de topnøgleord, der er undersøgt.

Med 5.000 resultater vist for klarheds skyld, dette er den generelle K-means-klyngning for 100.000 ekskluderede dokumenter, der er studeret.

I forhold til blokeringen af data relateret til homoseksuelle og lesbiske identiteter, fandt forfatterne, at nævnelser af seksuel identitet (som f.eks. lesbisk, homoseksuel, biseksuel) havde den højeste chance for at blive filtreret ud for C4, og at ikke-krænkeligt og ikke-seksuelt indhold udgjorde 22% og 36%, henholdsvis, af information i denne kategori, der er ekskluderet fra C4.

Dialekt-eksklusion og gammel data

Yderligere brugte forskerne en dialekt-bevidst emne-model til at estimere, i hvilken udstrækning kollektiv, etnicitets-specifik sprog var ekskluderet fra C4, og fandt, at ‘afrikansk-amerikansk engelsk og hispanisk-orienteret engelsk er uretfærdigt påvirket af blocklist-filtreringen’.

Derudover bemærker rapporten, at en betydelig procentdel af C4-korpusset er erhvervet fra materiale, der er ældre end ti år, nogle af det er årtier gammelt, og det meste af det stammer fra nyheder, patenter og Wikipedia-webstedet. Forskerne indrømmer, at estimeringen af den præcise alder ved at identificere den første gemme i Internet Arkiv ikke er en præcis metode (da URLs kan tage måneder at blive arkiveret), men har brugt denne tilgang i mangelen på rimelige alternativer.

Konklusioner

Rapporten fremhæver behovet for strengere dokumentationssystemer for internet-afledte datasets, der er beregnet til at bidrage til NLP-forskning, og bemærker ‘Når man bygger en dataset fra en skræbning af web, er det afgørende at rapportere de domæner, teksten skræbes fra, for at forstå datasettet; dataindsamlingprocessen kan føre til en betydeligt anden fordeling af internetdomæner, end man ellers ville forvente.’

De observerer også, at benchmark-forurening, hvor maskin-data er inkluderet med menneske-data (se ovenfor), allerede har vist sig at være et problem med udviklingen af GPT-3, der også utilsigtet inkluderede sådan data under sin omfattende og meget dyre træning (det endte med at være billigere at kvantificere og ekskludere benchmark-dataets indflydelse end at gen-træne GPT-3, og kilderapporten bekræfter en ‘ubetydelig indvirkning på ydelsen’).

Rapporten slutter*:

‘Vore analyser bekræfter, at det at bestemme, om et dokument har giftigt eller utugtigt indhold, er en mere nuanceret opgave, der går ud over at détectere “dårlige” ord; hadefuldt og utugtigt indhold kan udtrykkes uden negative nøgleord (f.eks. mikro-aggressioner, underforståelser).

Det er vigtigt, at betydningen af åbenbart “dårlige” ord afhænger stærkt af den sociale kontekst (f.eks. kan uhøflighed tjene prosociale funktioner, og hvem der siger visse ord påvirker deres krænkelighed (f.eks. det genoptagne slangudtryk “n*gga” anses for mindre krænkeligt, når det udtalt af en sort taler end af en hvid taler.

‘Vi anbefaler at undgå at bruge [blocklist]-filtrering, når man konstruerer datasets fra web-skræbning.’

 

* Min konvertering af inline-citationer til hyperlinks

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai