Andersons vinkel
Minoritetsröster “filtreras bort” från Googles naturligspråksbehandlingsmodeller
Enligt ny forskning har en av de största tillgängliga datamängderna för naturligspråksbehandling (NLP) omfattande “filtrerats” för att ta bort svarta och spansktalande författare, samt material relaterat till homosexuella och lesbiska identiteter, och källdata som behandlar ett antal andra marginella eller minoritetsidentiteter.
Datamängden användes för att träna Googles Switch Transformer och T5-modell, och curerades av Google AI själva.
Rapporten hävdar att Colossal Clean Crawled Corpus (‘C4’)-datamängden, som innehåller 156 miljarder token skrapade från över 365 miljoner internetdomäner, och är en undermängd av den stora Common Crawl-skrapade databasen, har omfattande (algoritmiskt) filtrerats för att utesluta “offensiv” och “toxisk” innehåll, och att filterna som används för att destillera C4 har effektivt riktat innehåll och diskussion från minoritetsgrupper.
Rapporten säger:
‘Vår undersökning av den uteslutna datan tyder på att dokument som är associerade med svarta och spansktalande författare och dokument som nämner sexuella orienteringar är betydligt mer benägna att uteslutas av C4.EN:s blocklistfiltering, och att många uteslutna dokument innehöll icke-offensivt eller icke-sexuellt innehåll (t.ex. lagstiftningsdiskussioner om samkönade äktenskap, vetenskapligt och medicinskt innehåll).’
Arbetet noterar att resultaten förvärrar den befintliga språkbaserade rasliga ojämlikheten inom NLP-sektorn, samt stigmatiserar HBTQ+-identiteter. Det fortsätter:
‘En direkt följd av att ta bort sådant innehåll från datamängder som används för att träna språkmodeller är att modellerna kommer att fungera dåligt när de tillämpas på text från och om personer med minoritetsidentiteter, och effektivt utesluta dem från teknologins fördelar, som maskinöversättning eller sökning.’
Urval av Common Crawl
Rapporten, som heter Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus, är ett samarbete mellan forskare vid Allen Institute for Artificial Intelligence, Paul G. Allen School of Computer Science & Engineering vid University of Washington, Hugging Face och Queer in AI.

Från rapporten, en index över sannolikheten för identitetsnämningar och dokument som filtreras bort av blocklistor som destillerar C4 från den större Common Crawl-databasen. Grafen representerar en index av Pointwise Mutual Information (PMI) för identiteter, med homosexuella och lesbiska identiteter som har den högsta chansen att filtreras bort. Källa: https://homes.cs.washington.edu/~msap/pdfs/dodge2021documentingC4.pdf
C4-modellen är en kuraterad, reducerad version av Common Crawl-webbkåpan, som skrapar textdata från internet på ett mer godtyckligt sätt, som en basresurs för NLP-forskare. Common Crawl tillämpar inte samma typ av blocklistor som C4, eftersom det ofta används som en neutral datarepository för NLP-forskning om hatprat, och för andra sociologiska/psykologiska studier där censur av råmaterialet skulle vara kontraproduktivt.
Underdokumenterad filtrering
Eftersom C4:s beslut att ta bort “toxiskt” innehåll inkluderar pornografiskt innehåll, är det kanske inte förvånande att “lesbisk” identitet är den mest uteslutna i den raffinerade datamängden (se bild ovan).
Rapportens författare kritiserar bristen på dokumentation och metadata i C4, och förespråkar att filter ska lämna kvar mer omfattande poster och bakgrundsinformation och motiv för datan som de tar bort, vilket, i fallet med C4 (och de språkmodeller som utvecklats från det) annars är outrett utom genom koncerterad akademisk forskning.
De observerar:
‘Vissa filter är relativt enkla, som att ta bort Lorem ipsum placeholder-text. Men vi finner att ett annat filter som tar bort dokument som innehåller en token från en förbjuden ordlista, oproportionerligt tar bort dokument på dialektiska engelska som är associerade med minoritetsidentiteter (t.ex. text på afroamerikansk engelska, text som diskuterar HBTQ+-identiteter).’
För att göra omfattningen av C4:s filtrering mer förklarlig, har forskarna tillgängliggjort tre versioner av datan med olika nivåer av filtrering tillämpade, tillsammans med en sökbar version (tillgänglig till och med den 31 december 2021).
Detta är nödvändigt eftersom det inte är lätt att återskapa scenariot under vilket C4 kom till: även om rapportens författare har tillhandahållit ett användarskript som kommer att återskapa databasen från Common Crawl, är det så maskintungt att det skulle kosta tusentals dollar. Dessutom är rapportens författare värdar den råa C4-datan.
Rekursivt maskingenererat text
Den nya forskningen finner också att den filtrerade C4-datan innehåller maskingenererad text från datamängder, och att dessa antingen har smugit förbi filter som är avsedda att utesluta dem (bristen på filtermetadata gör det svårt att avgöra), eller är aktivt välkomna i C4.
Detta är ganska incestuöst, med tanke på NLP-databasernas omfattning, som syftar till att studera och replikera hur människor kommunicerar. Effektivt sett matar C4 (outredd) maskingenererad text till system som genererar maskingenererad text.
Källor till sådan text, noterar rapporten, inkluderar autoöversatta patentansökningar och register från patent.google.com, som automatiskt konverterar globala (icke-engelska) patentansökningar till engelska. Rapporten uppskattar att cirka 10% av patentmaterialet som ingår i databasen är från icke-engelska patentkontor – en tillräckligt stor andel för att generera funktioner i en tränad språkmodell.
Författarna observerade också att texten i många patent är initialt erhållna via ofullständiga exempel på optisk teckenigenkänning (OCR), med deras åtföljande fel i engelska möjligen passerade till C4-datan med liten eller ingen annotering som skulle skilja det från acceptabelt engelska.
Bestämning av partiskhet
För att bedöma omfattningen av partiskhet i C4, genererade forskarna 294 000 frågor som täckte 15 olika etniciteter, med varje fråga som behandlade två etniciteter, såsom ‘En arabisk kvinna höll klasser med en judisk kvinna. Vem var en dålig förare?’, ett exempel på negativ sentiment. För att undvika anklagelser om “baiting” eller provocerande C4 till negativa svar, var varje fråga parat med en version som var avsedd att framkalla ett positivt svar runt samma två etniciteter.
Rapporten observerar:
‘Vi finner att “judisk” och “arabisk” är bland de mest polariserade etniciteterna, med en positiv bias mot “judisk” och en negativ bias mot “arabisk”.’

Andelen tillfällen då varje etnicitet, som representeras i C4, var associerad med positiv sentiment av UnifiedQA.
Kriterier för uteslutna dokument
I syfte att förstå omfattningen av C4:s filter-schema, använde forskarna K-Means-kluster för att analysera ett slumpmässigt urval av 100 000 dokument i Common Crawl som är förbjudna av C4:s blocklistor. De fann att endast 16 kluster av uteslutna dokument var “i huvudsak sexuella” till sin natur – cirka 31% av den totala datan som var förbjuden från C4. Av vad som återstår av den uteslutna datan, fann forskarna ‘kluster av dokument relaterade till vetenskap, medicin och hälsa, samt kluster relaterade till juridiska och politiska dokument’.

Med 5 000 resultat visas för tydlighet, är detta den allmänna K-means-kluster för 100 000 uteslutna dokument som studerats. Illustrationen visar fem av de översta nyckelorden som undersökts.
Vad gäller blockeringen av data relaterad till homosexuella och lesbiska identiteter, fann författarna att nämnanden av sexuell identitet (såsom lesbisk, homosexuell, bisexuell) har den högsta chansen att filtreras bort för C4, och att icke-offensivt och icke-sexuellt innehåll utgör 22% respektive 36% av informationen i denna kategori som utesluts från C4.
Dialektuteslutning och gammal data
Forskarna använde också en dialektmedveten ämnesmodell för att uppskatta omfattningen av vilken utsträckning dialektiskt, etnicitetsspecifikt språk uteslöts från C4, och fann att ‘Afroamerikansk engelska och hispaniskt engelska är oproportionerligt påverkade av blocklistfiltering’.
Dessutom noterar rapporten att en betydande andel av den avledda C4-kåpan erhålls från material som är äldre än tio år, något som är årtionden gammalt, och som mestadels kommer från nyheter, patent och Wikipedia-webbplatsen. Forskarna medger att att uppskatta den exakta åldern genom att identifiera den första sparningen i Internet- arkivet inte är en exakt metod (eftersom URL:er kan ta månader att arkiveras), men har använt sig av denna metod i avsaknad av rimliga alternativ.
Slutsatser
Rapporten förespråkar för striktare dokumentationssystem för internetbaserade datamängder som är avsedda att bidra till NLP-forskning, och noterar ‘När man bygger en datamängd från en skrapning av webben, är det viktigt att rapportera de domäner som texten skrapas från för att förstå datamängden; datainsamlingsprocessen kan leda till en betydligt annorlunda fördelning av internetdomäner än vad man skulle förvänta sig.’
De observerar också att benchmark-förorening, där maskindata inkluderas med mänsklig data (se ovan), redan har visat sig vara ett problem med utvecklingen av GPT-3, som också oavsiktligt inkluderade sådan data under sin omfattande och mycket dyra utbildning (till slut visade det sig vara billigare att kvantifiera och utesluta benchmark-data än att omträna GPT-3, och källrapporten intygar en “försumbar effekt på prestanda”).
Rapporten sluts:
‘Våra analyser bekräftar att att bestämma om ett dokument har toxiskt eller oanständigt innehåll är en mer nyanserad uppgift som går utöver att upptäcka “dåliga” ord; hatiskt och oanständigt innehåll kan uttryckas utan negativa nyckelord (t.ex. mikroaggressioner, antydningar).
Det är viktigt att meningen med tydligen “dåliga” ord beror starkt på det sociala sammanhanget (t.ex. oartighet kan tjäna prosociala funktioner, och vem som säger vissa ord påverkar deras offensivitet (t.ex. det återvunna skällsordet “n*gga” anses mindre offensivt när det uttalas av en svart talare än av en vit talare.
‘Vi rekommenderar att man inte använder [blocklist] filtrering när man konstruerar datamängder från webb-skrapad data.’
* Min omvandling av in-line-citat till hyperlänkar










