Unghiul lui Anderson

Rezumatele solicitanților de locuri de muncă sunt în mod eficient imposibil de a fi degenerați, cercetătorii AI au descoperit

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Cercetătorii de la Universitatea din New York au descoperit că chiar și cele mai simple modele de Procesare a Limbajului Natural (NLP) sunt destul de capabile să determine genul unui solicitant de loc de muncă dintr-un rezumat “curățat de gen” – chiar și în cazurile în care metodele de învățare automată au fost utilizate pentru a elimina toate indicatorii de gen din document.

În urma unui studiu care a implicat procesarea a 348.000 de rezumate bine potrivite de bărbați și femei, cercetătorii concluzionează:

‘Există o cantitate semnificativă de informații de gen în rezumate. Chiar și după încercări semnificative de a ascunde genul din rezumate, un model simplu Tf-Idf poate învăța să discrimineze între [genuri]. Acest lucru validează empiric preocupările cu privire la modelele care învață să discrimineze genul și să propageze prejudecățile în datele de antrenare în aval.’

Acest rezultat are importanță nu pentru că este realist să se ascundă genul în timpul procesului de selecție și interviu (ceea ce este evident că nu este posibil), ci mai degrabă pentru că ajungerea la acea etapă poate implica o critică bazată pe IA a rezumatului, fără intervenția umană – și HR IA a obținut o reputație compromisă în ceea ce privește prejudecățile de gen în ultimii ani.

Rezultatele studiului cercetătorilor demonstrează cât de rezistent este genul la încercările de a-l ascunde:

Rezultate din lucrarea NYU. Sursă: https://arxiv.org/pdf/2112.08910.pdf

Rezultate din lucrarea NYU. Sursă: https://arxiv.org/pdf/2112.08910.pdf

Rezultatele de mai sus utilizează o metrică de 0-1 Area Under the Receiver Operating Characteristic (AUROC), unde ‘1’ reprezintă o certitudine de 100% a identificării genului. Tabelul acoperă o gamă de opt experimente.

Chiar și în cele mai slabe rezultate (experimentele #7 și #8), unde un rezumat a fost atât de mult “curățat” de informații care ar putea dezvălui genul, încât a devenit inutilizabil, un model NLP simplu, cum ar fi Word2Vec, este încă capabil să identifice cu acuratețe genul, apropiindu-se de 70%.

Cercetătorii comentează:

‘În contextul angajării algoritmice, aceste rezultate implică faptul că, dacă datele de antrenare nu sunt perfect imparțiale, chiar și modelele NLP simple vor învăța să discrimineze genul din rezumate și să propage prejudecățile în aval.’

Autorii sugerează că nu există o soluție legitimă bazată pe IA pentru “degenearea” rezumatelor într-un proces de angajare practic, și că tehniciile de învățare automată care impun activ un tratament corect sunt o abordare mai bună a problemei prejudecăților de gen pe piața muncii.

În termeni de IA, acest lucru este echivalent cu “discriminarea pozitivă”, unde rezumatele care dezvălui genul sunt acceptate ca inevitabile, dar reordonarea este aplicată activ ca o măsură egalitară. Abordări de acest fel au fost propuse de LinkedIn în 2019 și de cercetători din Germania, Italia și Spania în 2018.

Lucrarea științifică se intitulează Limbajul de gen în rezumate și implicațiile sale pentru prejudecățile algoritmice în angajare și este scrisă de Prasanna Parasurama, de la Departamentul de Tehnologie, Operațiuni și Statistică de la NYU Stern Business School, și João Sedoc, Asistent Professor de Tehnologie, Operațiuni și Statistică la Stern.

Prejudecățile de gen în angajare

Autorii subliniază amploarea la care prejudecățile de gen în procedurile de angajare devin literalmente sistematizate, cu manageri de resurse umane care utilizează procese avansate de selecție și procese de învățare automată conduse de algoritmi – și HR IA a obținut o reputație compromisă în ceea ce privește prejudecățile de gen în ultimii ani.

Autorii citează cazul unui algoritm de angajare de la Amazon, care a fost dezvăluit în 2018 că a respins candidatele feminine în mod automat, deoarece a învățat că, istoric, bărbații erau mai probabil să fie angajați

‘Modelul a învățat prin datele istorice de angajare că bărbații erau mai probabil să fie angajați și, prin urmare, a evaluat rezumatele masculine mai bine decât cele feminine. ‘

‘Deși genul candidatului nu a fost inclus explicit în model, acesta a învățat să discrimineze între rezumatele masculine și feminine pe baza informațiilor de gen din rezumate – de exemplu, bărbații erau mai predispuși să utilizeze cuvinte precum “executat” și “capturat”.’

În plus, o cercetare din 2011 a arătat că anunțurile de job care solicită implicit bărbați atrag în mod explicit bărbați și, în același timp, descurajează femeile să aplice pentru post. Digitalizarea și schemele de date mari promit să înshrume aceste practici în sisteme automate, dacă sindromul nu este redresat activ.

Date

Cercetătorii de la NYU au antrenat o serie de modele pentru a clasifica genul utilizând modelarea predictivă. Ei au căutat, de asemenea, să stabilească cât de bine abilitatea modelelor de a prezice genul poate supraviețui eliminării unei cantități din ce în ce mai mari de informații potențial revelatoare de gen, în timp ce încercau să păstreze conținutul relevant pentru aplicație.

Datele au fost extrase dintr-un corp de rezumate de la opt companii IT cu sediul în SUA, fiecare rezumat fiind însoțit de detalii despre nume, gen, ani de experiență, domeniu de expertiză sau studiu și postul pentru care rezumatul a fost trimis.

Pentru a extrage informații contextuale mai profunde din aceste date sub formă de reprezentare vectorială, autorii au antrenat un model Word2Vec. Acesta a fost apoi parsat în tokeni și filtrat, rezultând într-o reprezentare încorporată pentru fiecare rezumat.

Mostrele masculine și feminine au fost potrivite 1-1, iar un subset a fost obținut prin asocierea celor mai buni candidați obiectiv potriviți pentru job, cu o marjă de eroare de 2 ani, în ceea ce privește experiența în domeniu. Astfel, setul de date constă în 174.000 de rezumate masculine și 174.000 de rezumate feminine.

Arhitectură și biblioteci

Cele trei modele utilizate pentru sarcina de clasificare au fost Term Frequency-Inverse Document Frequency (TF-IDF) + Logistic, Word Embeddings + Logistic și Longformer.

Primul model oferă o bază de cuvinte care discriminează genul pe baza diferențelor lexicale. A doua abordare a fost utilizată atât cu un sistem de încorporare a cuvintelor “off-the-shelf”, cât și cu încorporări de cuvinte debiasate de gen.

Datele au fost împărțite 80/10/10 între antrenare, evaluare și testare,

Ca în rezultatele afișate mai sus, biblioteca Longformer bazată pe transformatori, mult mai sofisticată decât abordările anterioare, a fost aproape capabilă să egaleze un rezumat complet “neprotejat” în ceea ce privește capacitatea de a detecta genul din documente care fuseseră activ “curățate” de identificatori de gen cunoscuți.

Experimentele efectuate au inclus studii de ablație a datelor, în care o cantitate din ce în ce mai mare de informații revelatoare de gen a fost eliminată din rezumate, iar modelele testate împotriva acestor documente mai puțin transparente.

Informațiile eliminate au inclus hobby-uri (un criteriu derivat din definiția Wikipedia pentru “hobby-uri”), ID-uri LinkedIn și URL-uri care ar putea dezvălui genul. În plus, termeni precum “fraternitate”, “chelneriță” și “vânzător” au fost eliminați în aceste versiuni mai puțin transparente.

Rezultate suplimentare

În plus față de rezultatele discutate mai sus, cercetătorii de la NYU au descoperit că încorporările de cuvinte debiasate de gen nu au redus capacitatea modelelor de a prezice genul. În lucrare, autorii sugerează amploarea în care genul permează limbajul scris, notând că aceste mecanisme și indicatori nu sunt încă bine înțelese.

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai