Unghiul lui Anderson

Sunt Seturile de Date Hiperscale Sub-Curate Mai Rele Decât Însăși Internetul?

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Cercetători din Irlanda, Regatul Unit și Statele Unite au avertizat că creșterea seturilor de date de antrenare AI hiperscale amenință să propage cele mai rele aspecte ale surselor de internet, susținând că un set de date academic recent lansat prezintă ‘imagini și perechi de text problematice și explicite de viol, pornografie, stereotipuri maligne, insulte rasiale și etnice și alte conținuturi extrem de problematice’.

Cercetătorii cred că o nouă valură de seturi de date multimodale masive sub-curate sau filtrate incorect sunt probabil mai dăunătoare în capacitatea lor de a întări efectele unor astfel de conținuturi negative, deoarece seturile de date păstrează imagini și alte conținuturi care ar fi putut fi eliminate de pe platformele online prin plângeri ale utilizatorilor, moderare locală sau algoritmi.

Ei observă, de asemenea, că poate dura ani – în cazul setului de date ImageNet, un deceniu întreg – pentru ca plângerile privind conținutul setului de date să fie abordate, și că aceste revizuiri ulterioare nu sunt întotdeauna reflectate nici măcar în seturile de date noi derivate din ele.

Articolul, intitulat Seturi de date multimodale: misoginie, pornografie și stereotipuri maligne, provine de la cercetători de la University College Dublin & Lero, University of Edinburgh și șeful științific al platformei de autentificare UnifyID.

Deși lucrarea se concentrează pe lansarea recentă a setului de date CLIP-filtrat LAION-400M, autorii argumentează împotriva tendinței generale de a arunca cantități tot mai mari de date în cadrele de învățare automată, cum ar fi modelul de limbaj neural GPT-3, și susțin că impulsul orientat spre rezultate către o inferență mai bună (și chiar către Inteligența Artificială Generală [AGI]) duce la utilizarea ad-hoc a surselor de date dăunătoare cu supraveghere neglijentă a drepturilor de autor; potențialul de a provoca și promova prejudicii; și capacitatea de a nu numai perpetua date ilegale care ar fi putut dispărea altfel din domeniul public, ci și de a incorpora modelele morale ale unor astfel de date în implementările AI descendente.

LAION-400M

Luna trecută, setul de date LAION-400M a fost lansat, adăugându-se la numărul tot mai mare de seturi de date multimodale și lingvistice care se bazează pe Common Crawl repository, care extrage internetul în mod indiscriminat și transferă responsabilitatea pentru filtrare și curățare proiectelor care utilizează acestea. Setul de date derivat conține 400 de milioane de perechi text-imagine.

LAION-400M este o variantă open source a setului de date WIT (WebImageText) închis al Google AI, lansat în martie 2021, și prezintă perechi text-imagine, unde o imagine din baza de date a fost asociată cu textul însoțitor explicit sau metadate (de exemplu, textul alt al unei imagini dintr-o galerie web). Acest lucru permite utilizatorilor să efectueze recuperarea imaginilor pe baza textului, dezvăluind asocierile pe care le-a format AI-ul subiacent despre aceste domenii (de exemplu, ‘animal’, ‘bicicletă’, ‘persoană’, ‘bărbat’, ‘femeie’).

Relația dintre imagine și text, și similaritatea cosinus care poate încorpora prejudecăți în rezultatele cererilor, sunt în centrul apelului articolului pentru metodologii îmbunătățite, deoarece cererile foarte simple către baza de date LAION-400M pot dezvălui prejudecăți.

De exemplu, imaginea pionierului astronaut american Eileen Collins din biblioteca scitkit-image recuperează două captionuri asociate în LAION-400M: ‘Acesta este un portret al unui astronaut cu drapelul american’ și ‘Acesta este o fotografie a unei gospodine zâmbitoare într-un costum portocaliu cu drapelul american’.

Astronautul american Eileen Collins primește două interpretări foarte diferite ale realizărilor sale ca primă femeie în spațiu sub LAION-400M. Sursă: https://arxiv.org/pdf/2110.01963.pdf

Astronautul american Eileen Collins primește două interpretări foarte diferite ale realizărilor sale ca primă femeie în spațiu sub LAION-400M. Sursă: https://arxiv.org/pdf/2110.01963.pdf

Similaritățile cosinus care fac ca oricare dintre captionuri să fie probabilă sunt foarte aproape una de alta, și autorii susțin că o astfel de proximitate ar face sistemele AI care utilizează LAION-400M relativ probabile să prezinte oricare dintre ele ca o captionă potrivită.

Pornografia Ajunge Din Nou în Top

LAION-400M a făcut disponibilă o interfață de căutare disponibilă, unde debifarea butonului “căutare sigură” dezvăluie amploarea imaginilor și asocierilor textuale pornografice care domină etichetele și clasele. De exemplu, căutarea pentru ‘călugăriță’ (NSFW dacă debifați modul sigur) în baza de date returnează rezultate în principal legate de groază, cosplay și costume, cu foarte puține călugărițe reale disponibile.

Dezactivarea modului Sigur pe aceeași căutare dezvăluie o mulțime de imagini pornografice legate de termen, care împing imaginile non-pornografice în josul paginii de rezultate, dezvăluind amploarea în care LAION-400M a atribuit o greutate mai mare imaginilor pornografice, deoarece acestea sunt prevalente pentru termenul “călugăriță” în sursele online.

Activarea implicită a modului Sigur în interfața de căutare online este înșelătoare, deoarece reprezintă o caracteristică a interfeței, un filtru care nu va fi necesarmente activat în sistemele AI derivate, ci care a fost generalizat în domeniul “călugăriță” într-un mod care nu este atât de ușor de filtrat sau de distins de rezultatele (relativ) SFW în ceea ce privește utilizarea algoritmică.

Articolul prezintă exemple blurate în materialele suplimentare de la sfârșit. Nu pot fi prezentate aici, din cauza limbajului din textul care însoțește fotografiile blurate, dar cercetătorii observă efortul pe care l-au depus pentru a examina și a blura imaginile, și recunosc provocarea de a curăța un astfel de material pentru supravegherea umană a bazelor de date la scară largă:

‘Noi (precum și colegii noștri care ne-au ajutat) am experimentat niveluri variate de disconfort, greață și durere de cap în timpul procesului de investigare a setului de date. În plus, acest tip de muncă se confruntă în mod disproporționat cu critici negative semnificative în sfera academică AI la lansare, ceea ce nu numai că adaugă o povară emoțională suplimentară sarcinii deja grele de a studia și analiza astfel de seturi de date, dar încurajează și mai puțin lucrări similare în viitor, în detrimentul domeniului AI și al societății în general.’

Cercetătorii susțin că, deși curățarea cu ajutor uman este scumpă și are costuri personale asociate, sistemele automate de filtrare proiectate pentru a elimina sau a aborda astfel de material nu sunt clar adecvate pentru această sarcină, deoarece sistemele NLP au dificultăți în izolarea sau discountarea materialului ofensiv care poate domina un set de date extras și ulterior poate fi perceput ca semnificativ din cauza volumului.

Încoronarea Conținutului Interzis și Eliminarea Protecțiilor Drepturilor de Autor

Articolul argumentează că seturile de date sub-curate de acest tip sunt “foarte probabil” să perpetueze exploatarea indivizilor minoritari și abordează dacă proiectele deschise de date similare au dreptul, din punct de vedere legal sau moral, de a transfera răspunderea pentru materialul respectiv asupra utilizatorului final:

‘Indivizii pot șterge datele lor de pe un site web și presupune că au dispărut pentru totdeauna, în timp ce acestea ar putea încă exista pe serverele mai multor cercetători și organizații. Există o întrebare cu privire la cine este responsabil pentru eliminarea acestor date din setul de date? Pentru LAION-400M, creatorii au delegat această sarcină utilizatorului setului de date. Având în vedere că astfel de procese sunt intenționat complexe și că utilizatorul mediu lipsește de cunoștințele tehnice pentru a-și șterge datele, este o abordare rezonabilă?’

Ei susțin, de asemenea, că LAION-400M nu ar putea fi potrivit pentru lansarea sub modelul de licență Creative Common CC-BY 4.0, în ciuda potențialelor beneficii pentru democratizarea seturilor de date la scară largă, care anterior erau domeniul exclusiv al companiilor bine finanțate, cum ar fi Google și OpenAI.

Domeniul LAION-400M afirmă că imaginile din setul de date 'sunt sub drepturile lor de autor' – un mecanism 'passthrough' în mare măsură permis de hotărârile judecătorești și de ghidurile guvernamentale din ultimii ani care aprobă în general extragerea datelor de pe web în scopuri de cercetare. Sursă: https://rom1504.github.io/clip-retrieval/

Domeniul LAION-400M afirmă că imaginile din setul de date ‘sunt sub drepturile lor de autor’ – un mecanism ‘passthrough’ în mare măsură permis de hotărârile judecătorești și de ghidurile guvernamentale din ultimii ani care aprobă în general extragerea datelor de pe web în scopuri de cercetare. Sursă: https://rom1504.github.io/clip-retrieval/

Autorii sugerează că voluntarii din comunitate ar putea aborda unele dintre problemele setului de date, și că cercetătorii ar putea dezvolta tehnici de filtrare îmbunătățite.

‘Cu toate acestea, drepturile subiectului de date rămân neadresate aici. Este iresponsabil și periculos să subestimăm prejudiciile inerente în astfel de seturi de date la scară largă și să încurajăm utilizarea lor în medii industriale și comerciale. Răspunderea schemei de licență sub care se furnizează setul de date revine în întregime creatorului setului de date’.

Problemele Democratizării Datelor Hiperscale

Articolul argumentează că seturile de date visio-lingvistice de această dimensiune, cum ar fi LAION-400M, nu erau disponibile anterior în afara companiilor mari de tehnologie și a instituțiilor de cercetare limitate care dețin resursele pentru a le colecta, curăța și procesa. Ei salută spiritul noii lansări, în timp ce critică execuția.

Autorii susțin că definiția acceptată a “democratizării”, așa cum se aplică seturilor de date deschise hiperscale, este prea limitată și ‘nu ține cont de drepturile, bunăstarea și interesele indivizilor și comunităților vulnerabile, mulți dintre aceștia fiind probabil cei mai afectați de impacturile descendente ale acestui set de date și ale modelelor antrenate pe el’.

Deoarece dezvoltarea modelelor deschise de tip GPT-3 este în cele din urmă destinată a fi distribuită milioanelor (și, prin proxy, poate miliarde) de utilizatori din întreaga lume, și deoarece proiectele de cercetare pot adopta seturi de date înainte ca acestea să fie editate sau eliminate ulterior, perpetuând orice probleme care ar fi trebuit să fie abordate în modificări, autorii argumentează că lansarea neglijentă a seturilor de date sub-curate nu ar trebui să devină o trăsătură obișnuită în învățarea automată deschisă.

Punerea Geniului Înapoi în Sticlă

Unele seturi de date care au fost suprimate mult după ce conținutul lor trecuse, poate irevocabil, în proiecte AI pe termen lung, au inclus setul de date Duke MTMC (Multi-Target, Multi-Camera), care a fost în cele din urmă retras din cauza repetatelor îngrijorări din partea organizațiilor pentru drepturile omului cu privire la utilizarea sa de către autoritățile represive din China; Microsoft Celeb (MS-Celeb-1M), un set de date de 10 milioane de imagini cu fețe “celebre”, care s-a dovedit a include jurnaliști, activiști, factori de decizie și scriitori, a căror expunere a datelor biometrice în lansare a fost puternic criticată; și setul de date Tiny Images, retras în 2020 pentru “prejudecăți, imagini ofensatoare și termeni denigratori”.

În ceea ce privește seturile de date care au fost modificate în loc de retrase după critici, exemplele includ setul de date ImageNet, care, după cum observă cercetătorii, a durat zece ani (2009-2019) pentru a acționa asupra criticilor repetate cu privire la confidențialitate și clase neimaginabile.

Articolul observă că LAION-400M inversează efectiv aceste îmbunătățiri, “ignorând în mare măsură” reviziile menționate anterior în reprezentarea ImageNet în noua lansare, și identifică o tendință mai largă în acest sens*:

‘Acest lucru este evidențiat în apariția unor seturi de date mai mari, cum ar fi setul de date Tencent ML-images (în februarie 2020), care cuprinde majoritatea acestor clase neimaginabile, disponibilitatea continuă a modelelor antrenate pe setul de date complet ImageNet-21k în depozite cum ar fi TF-hub, utilizarea continuă a setului de date ne filtrat ImageNet-21k în ultimele modele SotA (cum ar fi modelele EfficientNetV2 și CoAtNet) ale Google și anunțurile explicite care permit utilizarea preantrenării setului de date ne filtrat ImageNet-21k în concursuri reputabile cum ar fi provocarea LVIS 2021.

‘Subliniem această observație crucială: o echipă de talia ImageNet, care gestionează mai puțin de 15 milioane de imagini, a luptat și a eșuat în aceste încercări de detoxifiere până acum.

‘Scalabilitatea eforturilor atente necesare pentru a detoxifia în mod cuprinzător acest set de date multimodal masiv și modelele descendente antrenate pe acest set de date, care cuprinde potențial miliarde de perechi imagine-text, va fi în mod evident astronomică.’

 

* Conversia mea a citărilor inline ale autorului în legături hipertext.

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai