Unghiul lui Anderson

Un cartel de seturi de date influente domină cercetarea în învățarea automată, sugerează un nou studiu

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Un nou studiu al Universității din California și Google Research a descoperit că un număr mic de seturi de date “de referință” pentru învățarea automată, în mare parte de la instituții occidentale influente și, adesea, de la organizații guvernamentale, domină din ce în ce mai mult sectorul cercetării în inteligența artificială.

Cercetătorii concluzionează că această tendință de a “recurge la” seturi de date deschise foarte populare, cum ar fi ImageNet, ridică o serie de motive practice, etice și chiar politice de îngrijorare.

Printre constatările lor – bazate pe datele de bază ale proiectului comunitar condus de Facebook, Papers With Code (PWC) – autorii susțin că ‘seturile de date utilizate pe scară largă sunt introduse de doar o mână de instituții de elită’, și că această “consolidare” a crescut la 80% în ultimii ani.

‘[Noi] constatăm că există o inegalitate crescândă în utilizarea seturilor de date la nivel global, și că mai mult de 50% din toate utilizările seturilor de date din eşantionul nostru de 43.140 corespund seturilor de date introduse de douăsprezece instituții de elită, în principal occidentale.’

O hartă a utilizărilor seturilor de date non-specifice de sarcină din ultimii zece ani. Criteriul de includere este acolo unde instituția sau compania reprezintă mai mult de 50% din utilizările cunoscute. În partea dreaptă este prezentat coeficientul Gini pentru concentrarea seturilor de date în timp, atât pentru instituții, cât și pentru seturi de date. Sursă: https://arxiv.org/pdf/2112.01716.pdf

O hartă a utilizărilor seturilor de date non-specifice de sarcină din ultimii zece ani. Criteriul de includere este acolo unde instituția sau compania reprezintă mai mult de 50% din utilizările cunoscute. În partea dreaptă este prezentat coeficientul Gini pentru concentrarea seturilor de date în timp, atât pentru instituții, cât și pentru seturi de date. Sursă: https://arxiv.org/pdf/2112.01716.pdf

Instituțiile dominante includ Stanford University, Microsoft, Princeton, Facebook, Google, Institutul Max Planck și AT&T. Patru dintre primele zece surse de seturi de date sunt instituții corporatiste.

Studiul caracterizează, de asemenea, utilizarea crescândă a acestor seturi de date de elită ca ‘un vehicul pentru inegalitate în știință’. Acest lucru se datorează faptului că echipele de cercetare care caută aprobarea comunității sunt mai motivate să obțină rezultate de ultimă oră (SOTA) împotriva unui set de date consistent decât să genereze seturi de date originale care nu au un astfel de statut și care ar necesita ca colegii să se adapteze la metrici noi, în loc de indici standard.

În orice caz, așa cum recunoaște studiul, crearea unui set de date propriu este o întreprindere prohibitiv de scumpă pentru instituții și echipe mai puțin dotate.

‘Validitatea științifică prima facie acordată de evaluarea SOTA este generic confundată cu credibilitatea socială pe care o obțin cercetătorii prin arătarea faptului că pot concura pe un set de date larg recunoscut, chiar dacă un benchmark mai context-specific ar fi mai tehnic adecvat.

‘Noi susținem că aceste dinamici creează un “Efect Matthew” (adică “bogatul devine și mai bogat, iar săracul devine și mai sărac”) în care benchmark-urile de succes și instituțiile de elită care le introduc câștigă o statută disproporționată în domeniu.

Studiul întitulat Reduced, Reused and Recycled: The Life of a Dataset in Machine Learning Research provine de la Bernard Koch și Jacob G. Foster de la UCLA, și Emily Denton și Alex Hanna de la Google Research.

Studiul ridică o serie de probleme cu tendința de consolidare pe care o documentează și a fost întâmpinat cu aprobare generală la Open Review. Un recenzor de la NeurIPS 2021 a comentat că lucrarea este ‘extrem de relevantă pentru oricine este implicat în cercetarea învățării automate.’ și a prevăzut includerea sa ca lectură obligatorie la cursurile universitare.

De la necesitate la corupție

Autorii notează că cultura actuală de “a bate benchmark-ul” a apărut ca o soluție pentru lipsa unor instrumente obiective de evaluare care a determinat interesul și investițiile în IA să scadă pentru a doua oară acum peste treizeci de ani, după declinul entuziasmului pentru noi cercetări în “Sisteme Expert”:

‘Benchmark-urile formalizează, de obicei, o anumită sarcină prin intermediul unui set de date și al unei metrice cantitative de evaluare. Practica a fost introdusă inițial în [cercetarea învățării automate] după “Iarna IA” din anii 1980 de către finanțatorii guvernamentali, care au căutat să evalueze mai exact valoarea obținută din subvenții.’

Studiul susține că avantajele inițiale ale acestei culturi informale de standardizare (reducerea barierelor de participare, metrici consistente și oportunități de dezvoltare mai agile) încep să fie depășite de dezavantajele care apar în mod natural atunci când un corp de date devine suficient de puternic pentru a defini efectiv “condițiile de utilizare” și sfera de influență.

Autorii sugerează, în conformitate cu multe gânduri recente din industrie și din mediul academic pe această temă, că comunitatea de cercetare nu mai pune probleme noi dacă acestea nu pot fi abordate prin seturi de date de benchmark existente.

Ei notează, de asemenea, că aderarea oarbă la acest număr mic de “seturi de date de aur” încurajează cercetătorii să obțină rezultate care sunt supraajustate (adică care sunt specifice setului de date și nu sunt susceptibile de a performa aproape la fel de bine pe date din lumea reală, pe seturi de date academice noi sau originale, sau chiar și necesar pe seturi de date diferite din “standardul de aur”).

‘Având în vedere concentrarea ridicată a cercetării asupra unui număr mic de seturi de date de benchmark, credem că diversificarea formelor de evaluare este deosebit de importantă pentru a evita supraajustarea la seturile de date existente și a nu reprezenta greșit progresul în domeniu.’

Influența guvernamentală în cercetarea viziunii computaționale

Conform studiului, cercetarea în viziunea computațională este afectată în mod semnificativ de sindromul pe care îl descrie, autorii notând că cercetarea în procesarea limbajului natural (NLP) este mult mai puțin afectată. Autorii sugerează că acest lucru se datorează faptului că comunitățile NLP sunt ‘mai coerente’ și mai mari ca mărime, și că seturile de date NLP sunt mai accesibile și mai ușor de curățat, precum și fiind mai mici și mai puțin intensive din punct de vedere al resurselor de date.

‘Interesele corporațiilor, ale statului și ale persoanelor private adesea intră în conflict în viziunea computațională, și în special în ceea ce privește seturile de date de recunoaștere facială (FR)’

Pentru sarcinile de recunoaștere facială, cercetătorii au constatat că incidența seturilor de date pur academice scade dramatic în comparație cu media:

‘[Patru] dintre cele opt seturi de date (33,69% din totalul utilizărilor) au fost finanțate exclusiv de corporații, armata americană sau guvernul chinez (MS-Celeb-1M, CASIA-Webface, IJB-A, VggFace2). MS-Celeb-1M a fost în cele din urmă retras din cauza controversei legate de valoarea confidențialității pentru diferiți stakeholderi.’

Seturile de date de top utilizate în comunitățile de cercetare a generării de imagini și recunoașterii fețelor.

Seturile de date de top utilizate în comunitățile de cercetare a generării de imagini și recunoașterii fețelor.

În graficul de mai sus, așa cum notează autorii, observăm, de asemenea, că domeniul relativ recent al generării de imagini (sau sintezei de imagini) se bazează puternic pe seturi de date existente, mult mai vechi, care nu au fost destinate inițial pentru acest scop.

De fapt, studiul observă o tendință crescândă de “migrație” a seturilor de date departe de scopul lor inițial, punând sub semnul întrebării adecvarea lor pentru nevoile noilor sectoare de cercetare sau a celor periferice, și măsura în care constrângerile bugetare pot “genericiza” sfera ambițiilor cercetătorilor în cadrul mai îngust oferit atât de materialele disponibile, cât și de o cultură atât de obsedată de evaluările anuale ale benchmark-urilor, încât seturile de date noi au dificultăți în a câștiga teren.

‘Rezultatele noastre indică, de asemenea, faptul că seturile de date se transferă în mod regulat între diferite comunități de sarcini. La extrema cea mai extremă, majoritatea seturilor de date de benchmark în circulație pentru anumite comunități de sarcini au fost create pentru alte sarcini.’

În ceea ce privește personalitățile de seamă din învățarea automată (inclusiv Andrew Ng) care au cerut în mod constant mai multă diversitate și curățare a seturilor de date în ultimii ani, autorii susțin sentimentul, dar cred că eforturile de acest fel, chiar dacă sunt de succes, ar putea fi subminate de dependența actuală a culturii de rezultate SOTA și de seturi de date stabilite:

‘Cercetarea noastră sugerează că simpla chemare către cercetătorii învățării automate de a dezvolta mai multe seturi de date și de a schimba structurile de stimulente astfel încât dezvoltarea seturilor de date să fie valorizată și recompensată poate să nu fie suficientă pentru a diversifica utilizarea seturilor de date și a perspectivelor care, în cele din urmă, modelează și stabilesc agenda de cercetare în învățarea automată.

‘Pe lângă stimularea dezvoltării seturilor de date, noi susținem intervenții politice orientate spre echitate care să prioritizeze finanțarea semnificativă a persoanelor din instituții mai puțin dotate pentru a crea seturi de date de înaltă calitate. Acest lucru ar diversifica – dintr-o perspectivă socială și culturală – seturile de date de benchmark utilizate pentru a evalua metodele moderne de învățare automată.’

 

6 decembrie 2021, 16:49 GMT+2 – Corectat posesiv în titlu. – MA

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai