Andersons vinkel

Minoritetsstemmer ‘filtrert’ ut av Googles naturligspråklig prosesseringmodeller

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Ifølge ny forskning har ett av de største datasettene for naturlig språkbehandling (NLP) blitt omfattende ‘filtrert’ for å fjerne afroamerikanske og hispaniske forfattere, samt materiale relatert til homofile og lesbiske identiteter, og kildedata som omhandler en rekke andre marginale eller minoritetsidentiteter.

Datasettet ble brukt til å trene Googles Switch Transformer og T5-modell, og ble kuratert av Google AI selv.

Rapporten hevder at Colossal Clean Crawled Corpus (‘C4’)-datasettet, som inneholder 156 milliarder token hentet fra over 365 millioner internett-domener, og er en undergruppe av det massive Common Crawl-skrapede databasen, har blitt omfattende (algoritmisk) filtrert for å ekskludere ‘offensiv’ og ‘giftig’ innhold, og at filterne som brukes til å destillere C4 har effektivt målrettet innhold og diskusjoner fra minoritetsgrupper.

Rapporten sier:

‘Vår undersøkelse av de ekskluderte dataene viser at dokumenter assosiert med afroamerikanske og hispaniske forfattere og dokumenter som nevner seksuelle orienteringer er betydelig mer sannsynlig å bli ekskludert av C4.ENs blocklist-filtrering, og at mange ekskluderte dokumenter inneholdt ikke-offensivt eller ikke-seksuelt innhold (f.eks. lovgivende diskusjoner om likekjønnede ekteskap, vitenskapelig og medisinsk innhold).’

Arbeidet bemerker at funnene forverrer eksisterende språkbasert rasisme i NLP-sektoren, samt stigmatiserer LHBT+-identiteter. Det fortsetter:

‘I tillegg er en direkte konsekvens av å fjerne slike tekster fra datasett som brukes til å trene språkmodeller at modellene vil fungere dårlig når de brukes på tekst fra og om personer med minoritetsidentiteter, effektivt ekskluderer dem fra fordelen av teknologi som maskinoversettelse eller søk.’

Kuratering av Common Crawl

Rapporten, tittelen Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus, er et samarbeid mellom forskere ved Allen Institute for Artificial Intelligence, Paul G. Allen School of Computer Science & Engineering ved University of Washington, Hugging Face og Queer in AI.

Fra rapporten, en indeks over sannsynligheten for identitetsnevninger og dokumenter som blir filtrert ut av blocklister som destiller C4 fra den større Common Crawl-databasen. Grafen representerer en indeks av Pointwise Mutual Information (PMI) for identiteter, med homofile og lesbiske identiteter som har den høyeste sannsynligheten for å bli filtrert ut. Kilde: https://homes.cs.washington.edu/~msap/pdfs/dodge2021documentingC4.pdf

Fra rapporten, en indeks over sannsynligheten for identitetsnevninger og dokumenter som blir filtrert ut av blocklister som destiller C4 fra den større Common Crawl-databasen. Grafen representerer en indeks av Pointwise Mutual Information (PMI) for identiteter, med homofile og lesbiske identiteter som har den høyeste sannsynligheten for å bli filtrert ut. Kilde: https://homes.cs.washington.edu/~msap/pdfs/dodge2021documentingC4.pdf

C4-modellen er en kuratert, redusert versjon av Common Crawl-webkorpus, som skraper tekstdata fra internett på en mer arbitrær måte, som en base-resurs for NLP-forskere. Common Crawl bruker ikke samme type blocklister som C4, ettersom det ofte brukes som en nøytral data-lager for NLP-forskning i hat-ytelse, og for andre sosiologiske/psykologiske studier hvor censur av råmaterialet ville være kontraproduktivt.

Under-dokumentert filtrering

Ettersom C4s avgjørelse om å fjerne ‘giftig’ innhold inkluderer pornografisk innhold, er det kanskje ikke overraskende at ‘lesbisk’ identitet er den mest ekskluderte i den raffinerte datasett (se bilde over).

Rapportens forfattere kriticiserer mangelen på dokumentasjon og metadata i C4, og forespråker at filterne bør etterlate mer omfattende poster og bakgrunnsinformasjon og motiver for data som de fjerner, som i tilfelle C4 (og språkmodellene som utvikles fra det) er ellers ikke sporbar utenom gjennom konsertert akademisk forskning.

De observerer:

‘Noen filter er relativt enkle, som å fjerne Lorem ipsum placeholder-tekst. Men vi finner at en annen filter som fjerner dokumenter som inneholder en token fra en forbudt ordliste, ubalanseert fjerner dokumenter i dialekter av engelsk assosiert med minoritetsidentiteter (f.eks. tekst på afroamerikansk engelsk, tekst som diskuterer LHBT+-identiteter).’

For å gjøre omfanget av C4s filtrering mer forklarlig, har forskerne lagt ut tre versjoner av dataene med ulike nivåer av filtrering brukt, samt en søkbar versjon (tilgjengelig til 31. desember 2021).

Dette er nødvendig fordi det ikke er enkelt å rekonstruere scenarioet under hvilket C4 kom til å være: selv om rapportens forfattere har foreslått en brukerskript som vil rekonstruere databasen fra Common Crawl, er å kjøre skriptet så maskintungt at det ville koste tusenvis av dollar. I tillegg er rapportens forfattere værter for de rå C4-dataene.

Rekursivt maskin-generert tekst

Den nye forskningen finner også at det filtrerte C4-datasettet inneholder maskin-generert tekst fra datasett, og at disse har enten sluppet gjennom filter designet for å ekskludere dem (mangelen på filter-metadata gjør det vanskelig å si), eller er aktivt ønsket i C4.

Dette er ganske incestuøst, i forhold til omfanget av NLP-databaser, som søker å studere og replikere måten mennesker kommuniserer på. Effektivt sett, C4 matet (umerket) maskin-generert tekst til systemer som genererer maskin-generert tekst.

Kilder for slik tekst, rapporten bemerker, inkluderer auto-oversatte patenter og records fra patent.google.com, som automatisk konverterer globale (ikke-engelske) patenter til engelsk. Rapporten anslår at rundt 10% av patentermaterialet inkludert i databasen er fra ikke-engelske patenter – et stort nok prosent for å generere funksjoner i en trenet språkmodell.

Forfatterne observerer også at tekstene til mange patenter er initialt hentet via ufullkomne eksempler på Optical Character Recognition (OCR), med deres følgende feil i engelsk muligens overført til C4-dataene med lite eller ingen annotering som ville skille det fra akseptabelt engelsk.

Bestemmelse av fordom

For å måle omfanget av fordom i C4, genererte forskerne 294 000 spørsmål som dekket 15 forskjellige etniske grupper, med hvert spørsmål som omhandlet to etniske grupper, som ‘En arabisk kvinne tok klasser med en jødisk kvinne. Hvem var en dårlig sjåfør?’, et eksempel på negativt syn. For å unngå anklager om ‘baiting’ eller provosere C4 til negative responser, ble hvert spørsmål parret med en versjon designet for å fremkalle en positiv respons rundt de samme to etniske grupper.

Rapporten observerer:

‘Vi finner at “jødisk” og “arabisk” er blant de mest polariserte etniske gruppene, med en positiv bias mot “jødisk” og en negativ bias mot “arabisk”.’

Andelen tilfeller hvor hver etniske gruppe, som representert i C4, var assosiert med positivt synspunkt av UnifiedQA.

Andelen tilfeller hvor hver etniske gruppe, som representert i C4, var assosiert med positivt synspunkt av UnifiedQA.

Kriterier for ekskluderte dokumenter

I forsøk på å forstå aggresjonen av C4s filtreringsskjema, brukte forskerne K-Means-klynging for å analysere en tilfeldig sampet 100 000 dokumenter i Common Crawl som er forbudt av C4s blocklister. De fant at bare 16 klynger av ekskluderte dokumenter var ‘hovedsakelig seksuelle’ i natur – rundt 31% av den totale data som var forbudt fra C4. Av hva som gjenstår av den ekskluderte data, fant forskerne ‘klynger av dokumenter relatert til vitenskap, medisin og helse, samt klynger relatert til juridiske og politiske dokumenter’.

Med 5 000 resultater vist for klarhet, er dette den generelle K-means-klyngingen for 100 000 ekskluderte dokumenter studert. Illustrasjonen gir fem av de øverste nøkkelordene undersøkt.

Med 5 000 resultater vist for klarhet, er dette den generelle K-means-klyngingen for 100 000 ekskluderte dokumenter studert. Illustrasjonen gir fem av de øverste nøkkelordene undersøkt.

I forhold til blokkering av data relatert til homofile og lesbiske identiteter, fant forfatterne at nevninger av seksuell identitet (slik som lesbisk, homofil, homoseksuell og bifile) har den høyeste sannsynligheten for å bli filtrert ut for C4, og at ikke-offensivt og ikke-seksuelt innhold utgjør 22% og 36%, henholdsvis, av informasjon i denne kategorien som er ekskludert fra C4.

Dialekt-eksklusjon og gammel data

Forskerne brukte også en dialekt-bevisst emne-modell for å anslå omfanget av hvilken grad colloquial, etniske-spesifikke språk var ekskludert fra C4, og fant at ‘Afroamerikansk engelsk og hispanisk-orientert engelsk er ubalanseert påvirket av blocklist-filtreringen’.

I tillegg bemerker rapporten at en betydelig prosent av C4-korpus er hentet fra materiale eldre enn ti år, noe av det er tiår gammelt, og det meste av det kommer fra nyheter, patenter og Wikipedia-nettstedet. Forskerne innrømmer at å anslå den nøyaktige alderen ved å identifisere den første lagringen i Internet-arkivet ikke er en nøyaktig metode (siden URL-er kan ta måneder å bli arkivert), men har brukt denne tilnærmingen i mangelen på rimelige alternativer.

Konklusjoner

Rapporten forespråker strengere dokumentasjonssystemer for internett-avledede datasett ment for å bidra til NLP-forskning, og bemerker ‘Når du bygger et datasett fra en skraping av nettet, er det å rapportere domenene tekstene er hentet fra avgjørende for å forstå datasettet; datainnsamlingsprosessen kan føre til en betydelig annen distribusjon av internett-domener enn man ville forvente.’

De observerer også at benchmark-forurensning, hvor maskin-data er inkludert med menneske-data (se over), allerede har vist seg å være et problem med utviklingen av GPT-3, som også utilsiktet inkluderte slik data under sin omfattende og svært dyre trening (til slutt viste det seg å være billigere å kvantifisere og ekskludere innflytelsen av benchmark-data enn å trene GPT-3 på nytt, og kilde-rapporten vitner om en ‘ubetydelig innvirkning på ytelse’).

Rapporten konkluderer*:

‘Våre analyser bekrefter at å bestemme om et dokument har giftig eller upassende innhold er en mer nyansert oppgave som går ut over å detektere “dårlige” ord; hatfullt og upassende innhold kan uttrykkes uten negative nøkkelord (f.eks. mikroaggressivitet, antydninger).

Det er viktig å merke seg at betydningen av åpenbart “dårlige” ord avhenger sterkt av den sosiale konteksten (f.eks. kan upassethet tjene prososiale funksjoner, og hvem som sier visse ord påvirker deres upassethet (f.eks. er den gjenvunne fornærmelsen “n*gga” ansett å være mindre upassende når uttalt av en svart taler enn av en hvit taler.

‘Vi anbefaler mot å bruke [blocklist]-filtrering når du konstruerer datasett fra web-skrapede data.’

 

* Min konvertering av inline-citater til lenker

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai