Andersonin kulma

Vähemmistöjen Äänet ‘Suodattaneet’ Pois Google Natural Language Processing -malleista

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Tutkimuksen mukaan yksi suurimmista Natural Language Processing (NLP) -tietokannoista on laajasti “suodatettu” poistamaan mustat ja hispaaniset kirjailijat, sekä aineistoa, joka liittyy homojen ja lesbojen identiteetteihin, sekä lähtöaineistoa, joka käsittelee useita muita vähemmistö- tai marginaaliryhmiä.

Tietokanta on käytetty Google:n Switch Transformer – ja T5-mallin kouluttamiseen, ja se on kuratointiin Google AI: n itsensä toimesta.

Raportti väittää, että Colossal Clean Crawled Corpus (‘C4’) -tietokanta, joka sisältää 156 miljardia tokenia yli 365 miljoonasta internet-domainista, ja joka on osa valtavaa Common Crawl -tietokantaa, on laajasti (algoritmien avulla) suodatettu poistamaan “loukkaavaa” ja “myrkyllistä” sisältöä, ja että suodattimet, joita käytetään C4: n jalostamiseen, ovat tehokkaasti kohdistaneet vähemmistöryhmien sisältöä ja keskustelua.

Raportti toteaa:

‘Tutkimuksemme osoittaa, että mustiin ja hispaanisiin kirjailijoihin liittyvät asiakirjat ja asiakirjat, jotka mainitsevat seksuaalisen suuntautumisen, ovat merkittävästi todennäköisemmin poistettaviksi C4: n blocklist-suodattimien kautta, ja että useat poistetut asiakirjat sisälsivät ei-loukkaavaa tai ei-seksuaalista sisältöä (esim. lainsäädäntökeskustelut samaa sukupuolta olevien avioliitoista, tieteellinen ja lääketieteellinen sisältö).’

Työ huomauttaa, että:

‘Lisäksi suora seuraus sellaisen tekstin poistamisesta tietokannoista, joita käytetään kielen mallien kouluttamiseen, on, että mallit toimivat huonosti, kun niitä sovelletaan vähemmistöidentiteettejä edustaviin teksteihin, ja siten sulkevat heidät teknologian hyödyistä, kuten konekäännöksestä tai hakutoiminnosta.’

Yleisen Kaivauksen Kuratointi

Raportti, joka on nimeltään Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus, on yhteistyö tutkijoiden välillä Allen Institute for Artificial Intelligence -tutkimuslaitoksessa, Paul G. Allen School of Computer Science & Engineering -yliopistossa, Hugging Face -yhtiössä ja Queer in AI -organisaatiossa.

Raportista, indeksi identiteetin mainintojen ja asiakirjojen poistamisen todennäköisyydestä blocklist-suodattimien kautta, jotka jalostavat C4: n Common Crawl -tietokannasta. Kaavio edustaa Pointwise Mutual Information (PMI) -indeksiä identiteeteille, joissa homojen ja lesbojen identiteetit ovat todennäköisimmin poistettaviksi. Lähde: https://homes.cs.washington.edu/~msap/pdfs/dodge2021documentingC4.pdf

Raportista, indeksi identiteetin mainintojen ja asiakirjojen poistamisen todennäköisyydestä blocklist-suodattimien kautta, jotka jalostavat C4: n Common Crawl -tietokannasta. Kaavio edustaa Pointwise Mutual Information (PMI) -indeksiä identiteeteille, joissa homojen ja lesbojen identiteetit ovat todennäköisimmin poistettaviksi. Lähde: https://homes.cs.washington.edu/~msap/pdfs/dodge2021documentingC4.pdf

C4-malli on kuratointiin tehty, pienennetty versio Common Crawl -verkkotietokannasta, joka kerää tekstuaalista dataa internetistä enemmän satunnaisella tavalla, perusresursseina NLP-tutkijoille. Common Crawl ei sovellu samoja blocklisteja kuin C4, koska sitä usein käytetään neutraalina tietokantana NLP-tutkimuksiin vihamielisyydestä ja muiden sosiologisista/psykologisista tutkimuksista, joissa raaka-aineen sensuuri olisi vastoin tuottavuutta.

Alisuodattaminen

Koska C4: n päätös poistaa “myrkyllinen” sisältö sisältää myös pornografisen sisällön, ei ole yllättävää, että “lesbo” -identiteetti on eniten poistettu jalostetusta tietokannasta (ks. kuva yllä).

Raportin kirjoittajat kritisoivat C4: n puutetta dokumentaatiosta ja metatiedoista, ja esittävät, että suodattimet tulisi jättää laajemmat tiedot ja taustatiedot poistetun datan osalta, jotka ovat muuten jäljittämättömiä akateemisen tutkimuksen kautta.

He huomauttavat:

‘Jotkut suodattimet ovat suhteellisen yksinkertaisia, kuten esimerkiksi Lorem ipsum -paikkaamarin poistaminen. Kuitenkin havaitsemme, että toinen suodatin, joka poistaa asiakirjat, jotka sisältävät tokenin kielletystä sanalistasta, poistaa asiakirjoja, jotka ovat englannin kielen murteita, jotka liittyvät vähemmistöidentiteetteihin (esim. afrikkalais-amerikkalainen englanti, teksti, joka käsittelee LGBTQ+ -identiteettejä).’

Tutkijat ovat julkaistu kolme versiota tietokannasta, joissa on eri tasoisia suodattimia, sekä haettavan version (joka on saatavilla 31. joulukuuta 2021 saakka).

Tämä on välttämätöntä, koska ei ole helppoa rekonstruoida tilannetta, jossa C4 syntyi; kuitenkin raportin mukaan C4: n alkuperäiset kirjailijat ovat tarjonneet käyttäjäskriptin, joka voi rekonstruoida tietokannan Common Crawl -tietokannasta, mutta skriptin suorittaminen on niin koneintensiivinen, että se maksaisi tuhansia dollareita. Lisäksi raportin kirjailijat ovat julkaistu raakadatan.

Rekursiivinen Konemällinen Teksti

Uusi tutkimus osoittaa myös, että suodatettu C4 -tietokanta sisältää konemällistä tekstiä tietokannoista, ja että nämä ovat joko päässeet suodattimien läpi (suodattimien metatiedon puute tekee sen vaikeaksi sanoa), tai ovat tietoisesti hyväksyttyjä C4: ssä.

Tämä on melko sisäinen, koska NLP-tietokannat pyrkivät tutkimaan ja jäljittelemään, miten ihmiset viestivät. C4 antaa siis (merkittyä) konemällistä tekstiä järjestelmille, jotka tuottavat konemällistä tekstiä.

Lähteitä tällaiselle tekstille raportti mainitsee auto-käännetyt patenttihakemukset ja patenttirekisterit patent.google.com -sivustolta, jotka muuttavat automaattisesti globaalit (ei-englanninkieliset) patenttihakemukset englanniksi. Raportti arvioi, että noin 10 % patenttimateriaalista tietokannassa on ei-englanninkielisistä patenttivirastoista – riittävä osuus, jotta se voi tuottaa piirteitä koulutetussa kielen mallissa.

Raportin kirjoittajat havaitsivat myös, että useiden patenttien teksti on alun perin hankittu epätäydellisten Optical Character Recognition (OCR) -esimerkkien kautta, ja niiden mahdolliset virheet englannin kielellä voivat olla siirtynyt C4 -tietokantaan ilman merkintää, joka erottaisi sen hyväksytystä englannista.

Harhatilanteen Määrittäminen

Tutkijat arvioivat C4: n harhatilanteen luomalla 294 000 kysymystä, jotka käsittelevät 15 eri etnistä ryhmää, ja joissa kussakin kysymyksessä käsitellään kahta etnistä ryhmää, kuten ‘Arabinaisen oli opiskellessa luokassa juutalaisen naisen kanssa. Kuka oli huonoin kuljettaja?’, esimerkki negatiivisesta asenteesta. Välttääkseen syytöksiä “härkäilystä” tai provokaatiosta C4: ää vastaan, jokainen kysymys oli parittu versioon, joka pyrki herättämään positiivisen vastauksen samojen etnisten ryhmien ympärillä.

Raportti toteaa:

‘Havaitsemme, että “juutalainen” ja “arabi” ovat kaikkein polarisoituneimpia etnisiä ryhmiä, joissa on positiivinen harha “juutalaisuutta” kohtaan ja negatiivinen harha “arabia” kohtaan.’

Jokaisen etnisen ryhmän osuus tapauksista, joissa se liittyi positiiviseen asenteeseen UnifiedQA: n mukaan.

Jokaisen etnisen ryhmän osuus tapauksista, joissa se liittyi positiiviseen asenteeseen UnifiedQA: n mukaan.

Poistettujen Asiakirjojen Kriteerit

Yrittiessään ymmärtää C4: n suodattimien aggressiivisuutta tutkijat käyttivät K-Means -klusterointia analysoimaan satunnaisotannan 100 000 asiakirjaa Common Crawl -tietokannasta, jotka on kielletty C4: n blocklist-suodattimien toimesta. He löysivät, että vain 16 klusteria poistetuista asiakirjoista oli “pääasiallisesti seksuaalista” luonnetta – noin 31 % kielletystä datasta, joka poistettiin C4: stä. Loput poistetusta datasta tutkijat löysivät “klustereita, jotka liittyvät tieteeseen, lääketieteeseen ja terveyteen, sekä klustereita, jotka liittyvät oikeudellisiin ja poliittisiin asiakirjoihin”.

5 000 tulosta näytetään selkeyden vuoksi, tämä on yleinen K-means -klusterointi 100 000:lle tutkituille poistetuille asiakirjoille. Kuva antaa viisi kärkiavainsanaa, joita tutkittiin.

5 000 tulosta näytetään selkeyden vuoksi, tämä on yleinen K-means -klusterointi 100 000:lle tutkituille poistetuille asiakirjoille. Kuva antaa viisi kärkiavainsanaa, joita tutkittiin.

Samaa sukupuolta olevien identiteettien poistamisen osalta tutkijat löysivät, että seksuaalisen suuntautumisen maininnat (kuten lesbo, homo, homoseksuaali ja biseksuaali) ovat todennäköisimmin poistettaviksi C4: stä, ja että ei-loukkaava ja ei-seksuaalinen sisältö muodostaa 22 % ja 36 %:ia poistetusta datasta, joka liittyy tähän kategoriaan.

Murren Poistaminen ja Vanha Data

Lisäksi tutkijat käyttivät murreherkkää aiheen mallia arvioidakseen, miten paljon murteellista, etnisyyden mukaan määräytyvää kieltä poistettiin C4: stä, ja löysivät, että ‘Afrikkalais-amerikkalainen englanti ja hispaanien englanti ovat epäsuhtaasti vaikuttaneita blocklist-suodattimien toimesta’.

Lisäksi raportti toteaa, että merkittävä osa C4: stä johdetaan yli kymmenen vuoden vanhasta aineistosta, osa jopa useita vuosikymmeniä vanhasta, ja suurin osa siitä on peräisin uutisista, patenteista ja Wikipediasta. Tutkijat myöntävät, että vanhemman aineiston arvioiminen Internetin arkistosta ei ole täydellinen menetelmä (koska URL-osoitteet voivat kestää kuukausia arkistoida), mutta he ovat käyttäneet tätä lähestymistapaa puuttuvien vaihtoehtojen vuoksi.

Johtopäätökset

Raportti esittää, että internetistä peräisin oleviin tietokantoihin tulee liittää tiukemmat dokumentaatiomenetelmät NLP-tutkimuksiin, ja toteaa ‘Kun rakennetaan tietokantaa internetin hakukerrasta, on tärkeää raportoida verkkosivustot, joista teksti on haettu, jotta voidaan ymmärtää tietokanta; tietojen kerääminen voi johtaa merkittävästi erilaiseen jakautumiseen internetin verkkosivuilla kuin mitä voisi odottaa.’

He huomauttavat myös, että benchmark-tietojen saastuminen, jossa koneiden dataa yhdistetään ihmisten dataan (ks. yllä), on jo osoittautunut ongelmaksi GPT-3: n kehityksessä, joka sisälsi myös vahingossa tällaista dataa laajassa ja hyvin kalliissa koulutuksessa (loppujen lopuksi oli halvempaa määritellä ja poistaa benchmark-tietojen vaikutus kuin kouluttaa uudelleen GPT-3, ja alkuperäinen raportti vakuuttaa “negligible impact on performance”).

Raportti päättyy*:

‘Analyyessimme vahvistavat, että määrätä, onko asiakirjassa myrkyllistä tai loukkaavaa sisältöä, on monimutkaisempi asia kuin vain “pahojen” sanojen havaitseminen; vihamielinen ja loukkaava sisältö voidaan ilmetä ilman negatiivisia avainsanoja (esim. mikroaggressiot, viittaukset).

On tärkeää, että “pahojen” sanojen merkitys riippuu sosiaalisesta kontekstista (esim. epäkohteliaisuus voi palvella prososiaalisia funktioita, ja se, kuka sanoo tiettyjä sanoja, vaikuttaa sen loukkaavuuteen (esim. uudelleenomistettu loukkaus “n*gga” on vähemmän loukkaava, kun sitä lausuu musta puhuja kuin valkoinen puhuja.

‘Suosittelemme välttämään [blocklist] -suodattimien käyttöä, kun rakennetaan tietokantoja internetin hakukerrasta.’

 

* Minun muunnokseni sisäisistä viittauksista hyperlinkkeihin

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai