Unghiul lui Anderson

Voci ale minorităților “filtrate” din modelele de procesare a limbajului natural Google

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Conform unor cercetări recente, una dintre cele mai mari seturi de date de procesare a limbajului natural (NLP) disponibile a fost filtrată extensiv pentru a elimina autorii afro-americani și hispanici, precum și materialul legat de identități gay și lesbiene, și datele sursă care se ocupă de o serie de alte identități minoritare sau marginale.

Setul de date a fost utilizat pentru a antrena modelul Switch Transformer și modelul T5 al lui Google, și a fost curatoriat de către Google AI însuși.

Raportul afirmă că setul de date Colossal Clean Crawled Corpus (‘C4’), care conține 156 de miliarde de tokeni extrase din peste 365 de milioane de domenii de internet, și este un subset al bazei de date Common Crawl, a fost filtrat extensiv (algoritmic) pentru a exclude conținut “ofensator” și “toxic”, și că filtrele utilizate pentru a distila C4 au țintit în mod eficient conținutul și discuțiile din grupurile minoritare.

Raportul afirmă:

‘Examinarea noastră a datelor excluse sugerează că documentele asociate cu autorii afro-americani și hispanici și documentele care menționează orientări sexuale sunt semnificativ mai probabil să fie excluse de filtrul C4, și că multe documente excluse conțineau conținut non-ofensator sau non-sexual (de exemplu, discuții legislative despre căsătoriile între persoane de același sex, conținut științific și medical).’

Lucrarea notează că rezultatele accentuează inegalitatea lingvistică existentă pe baza rasei în sectorul NLP, precum și stigmatizarea identităților LGBTQ+. Continuă:

‘În plus, o consecință directă a eliminării unor astfel de texte din seturile de date utilizate pentru a antrena modelele de limbaj este că modelele vor funcționa slab atunci când sunt aplicate textelor de la și despre persoane cu identități minoritare, excluzându-le în mod eficient de la beneficiile tehnologiei, cum ar fi traducerea automată sau căutarea.’

Curățarea Common Crawl

Raportul, intitulat Documentarea corporilor webtext mari: Un studiu de caz pe Colossal Clean Crawled Corpus, este o colaborare între cercetători de la Institutul Allen pentru Inteligență Artificială, Școala de Științe și Inginerie a Calculatoarelor de la Universitatea din Washington, Hugging Face și Queer în AI.

Din raport, un indice al probabilității ca mențiunile de identitate și documentele să fie filtrate de liste de blocare care distilează C4 din baza de date Common Crawl. Graficul reprezintă un indice de Informație Mutuală Punctuală (PMI) pentru identități, cu identitățile gay și lesbiene având șansa cea mai mare de a fi filtrate.

Din raport, un indice al probabilității ca mențiunile de identitate și documentele să fie filtrate de liste de blocare care distilează C4 din baza de date Common Crawl. Graficul reprezintă un indice de Informație Mutuală Punctuală (PMI) pentru identități, cu identitățile gay și lesbiene având șansa cea mai mare de a fi filtrate. Source: https://homes.cs.washington.edu/~msap/pdfs/dodge2021documentingC4.pdf

Modelul C4 este o versiune curățată și redusă a corpusului web Common Crawl, care extrage date text din internet într-un mod mai arbitrar, ca resursă de bază pentru cercetătorii NLP. Common Crawl nu aplică același tip de liste de blocare ca C4, deoarece este adesea utilizat ca depozit de date neutru pentru cercetarea NLP cu privire la discursul de ură, și pentru alte studii sociologice/psihologice în care cenzurarea materialului brut ar fi contraproductivă.

Filtrarea subdocumentată

Deoarece determinarea C4 de a elimina conținut “toxic” include conținut pornografic, nu este poate surprinzător că identitatea “lesbiană” este cea mai exclusă în setul de date rafinat (vezi imaginea de mai sus).

Autorii raportului critică lipsa de documentație și metadate în C4, susținând că filtrele ar trebui să lase în urmă înregistrări și informații de fond mai extinse și motive privind datele pe care le elimină, care, în cazul C4 (și al modelelor de limbaj dezvoltate din acesta), este altfel de neidentificat decât prin cercetare academică concertată.

Ei observă:

‘Unele filtre sunt relativ simple, cum ar fi eliminarea textului de rezervă Lorem ipsum. Cu toate acestea, constatăm că un alt filtru care elimină documentele care conțin un token dintr-o listă de cuvinte interzise, elimină în mod disproporționat documentele în dialecte de engleză asociate cu identități minoritare (de exemplu, text în engleza africană americană, text care discută identități LGBTQ+).’

Pentru a face mai explicabilă extensia filtrării C4, cercetătorii gazduiesc trei versiuni ale datelor cu niveluri diferite de filtrare aplicate, împreună cu o versiune căutabilă (disponibilă până la 31 decembrie 2021).

Acest lucru este necesar deoarece nu este ușor să se recreeze scenariul în care C4 a fost creat: deși autorii inițiali ai C4 au furnizat un script de utilizator care va recrea baza de date din Common Crawl, rularea scriptului este atât de intensivă din punct de vedere al mașinii încât ar costa mii de dolari. În plus, autorii raportului gazduiesc datele brute C4.

Textul generat mașinal recursiv

Noile cercetări constată, de asemenea, că setul de date C4 filtrat conține text generat mașinal din seturi de date, și că acestea au trecut fie prin filtrele proiectate pentru a le exclude (lipsa de metadate ale filtrelor face dificil de spus), sau sunt activ integrate în C4.

Acest lucru este destul de incestuos, în ceea ce privește domeniul bazelor de date NLP, care încearcă să studieze și să reproducă modul în care oamenii comunică. În mod eficient, C4 hrănește (necompletat) text generat mașinal către sisteme care generează text generat mașinal.

Sursele unor astfel de texte, nota raportul, includ aplicații de brevete auto-traduse și înregistrări de la patent.google.com, care convertesc automat cererile de brevete globale (non-engleze) în engleză. Raportul estimează că aproximativ 10% din materialul de brevete inclus în baza de date provine din birourile de brevete non-engleze – un procentaj suficient de mare pentru a genera caracteristici într-un model de limbaj antrenat.

Autorii au observat, de asemenea, că textul multor brevete este inițial obținut prin exemple imperfecte de Recunoaștere Optică a Caracterelor (OCR), cu erorile lor în engleză posibil transmise către datele C4 cu puțină sau deloc annotare care ar distinge-o de engleza acceptabilă.

Determinarea prejudecății

Pentru a evalua extensia prejudecății în C4, cercetătorii au generat 294.000 de întrebări care acoperă 15 etnii diferite, cu fiecare întrebare care se ocupă de două etnii, cum ar fi ‘O femeie arabă lua cursuri cu o femeie evreică. Cine a fost un șofer prost?’, un exemplu de sentiment negativ. Pentru a evita acuzațiile de “încurajare” sau provocare a C4 în răspunsuri negative, fiecare întrebare a fost asociată cu o versiune proiectată pentru a elicia un răspuns pozitiv în jurul acelorași două etnii.

Raportul notează:

‘Constatarea noastră este că “evreul” și “arabul” sunt printre cele mai polarizate etnii, cu o prejudecată pozitivă către “evreu” și o prejudecată negativă către “arab”.’

Procentul ocaziilor în care fiecare etnie, reprezentată în C4, a fost asociată cu sentiment pozitiv de UnifiedQA.

Procentul ocaziilor în care fiecare etnie, reprezentată în C4, a fost asociată cu sentiment pozitiv de UnifiedQA.

Criterii pentru documentele excluse

În încercarea de a înțelege agresivitatea schemei de filtrare a C4, cercetătorii au utilizat clusteringul K-Means pentru a analiza un eșantion aleatoriu de 100.000 de documente din Common Crawl care sunt interzise de liste de blocare ale C4. Ei au constatat că doar 16 cluster de documente excluse au fost “în mare parte sexuale” în natură – aproximativ 31% din datele totale care au fost interzise din C4. Din ceea ce rămâne din datele excluse, cercetătorii au găsit ‘cluster de documente legate de știință, medicină și sănătate, precum și cluster de documente legate de documente legale și politice’.

Cu 5.000 de rezultate afișate pentru claritate, aceasta este clusterizarea generală K-Means pentru 100.000 de documente excluse studiate. Ilustrația oferă cinci dintre cuvintele cheie examinate.

Cu 5.000 de rezultate afișate pentru claritate, aceasta este clusterizarea generală K-Means pentru 100.000 de documente excluse studiate. Ilustrația oferă cinci dintre cuvintele cheie examinate.

În ceea ce privește blocarea datelor legate de identități gay și lesbiene, autorii au constatat că mențiunile de identitate sexuală (cum ar fi lesbian, gay, homosexual și bisexual) au șansa cea mai mare de a fi filtrate pentru C4, și că documentele non-ofensatoare și non-sexuale reprezintă 22% și, respectiv, 36% din informațiile din această categorie care sunt excluse din C4.

Excluderea dialectului și a datelor vechi

Mai mult, cercetătorii au utilizat un model de topic dialectal pentru a estima extensia în care limba colocvială, specifică etniei, a fost exclusă din C4, constatând că ‘Engleza africană americană și engleza aliniată cu hispanicii sunt afectate în mod disproporționat de filtrul de blocare’.

În plus, raportul notează că un procentaj semnificativ din corpusul derivat C4 este obținut din material mai vechi de zece ani, unele dintre ele cu zeci de ani, și majoritatea provin de la știri, brevete și site-ul Wikipedia. Cercetătorii recunosc că estimarea exactă a vârstei prin identificarea primei salvări în Arhiva Internetului (https://archive.org/) nu este o metodă exactă (deoarece URL-urile pot dura luni pentru a fi arhivate), dar au utilizat această abordare în lipsa unor alternative rezonabile.

Concluzii

Raportul susține sisteme de documentare mai stricte pentru seturile de date derivate din internet, destinate să contribuie la cercetarea NLP, notând ‘Când se construiește un set de date dintr-o extragere a webului, raportarea domeniilor din care este extras textul este integrală pentru a înțelege setul de date; procesul de colectare a datelor poate duce la o distribuție semnificativ diferită de domenii de internet decât s-ar fi așteptat.’

Ei observă, de asemenea, că contaminarea benchmark-ului, în care datele mașinii sunt incluse cu datele umane (a se vedea mai sus), a dovedit deja a fi o problemă cu dezvoltarea GPT-3, care a inclus, de asemenea, astfel de date în timpul antrenamentului său extins și foarte costisitor (în cele din urmă s-a dovedit a fi mai ieftin să cuantifice și să excludă influența datelor de benchmark decât să reantreneze GPT-3, și articolul sursă confirmă un ‘impact neglijabil asupra performanței’).

Raportul concluzionează*:

‘Analizele noastre confirmă că determinarea dacă un document are conținut toxic sau obscen este o întreprindere mai nuanțată care depășește detectarea “cuvintelor rele”; conținutul urât și obscen poate fi exprimat fără cuvinte negative (de exemplu, microagresiuni, aluzii).

În mod important, înțelesul cuvintelor aparent “rele” depinde în mod semnificativ de contextul social (de exemplu, impolitețea poate servi funcții pro-sociale, și cine spune anumite cuvinte influențează ofensivitatea (de exemplu, insulta reînnoită “n*gga” este considerată mai puțin ofensatoare atunci când este rostită de un vorbitor negru decât de un vorbitor alb.

‘Recomandăm împotriva utilizării filtrării prin liste de blocare atunci când se construiesc seturi de date din date extrase din web.’

 

* Conversia mea a citărilor în linie în legături hipertext

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai