Andersons hoek

Sollicitantencurricula Vitae Zijn Effectief Onmogelijk om te Ontgeslacht, AI-onderzoekers Vinden

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Onderzoekers van de New York University hebben ontdekt dat zelfs zeer eenvoudige Natural Language Processing (NLP)-modellen in staat zijn om het geslacht van een sollicitant te bepalen uit een ‘geslachtsloos’ cv – zelfs in gevallen waarin machine learning-methoden zijn gebruikt om alle geslachtsindicatoren uit het document te verwijderen.

Na een studie die de verwerking van 348.000 goed gematchte mannelijke/vrouwelijke cv’s omvatte, concluderen de onderzoekers:

‘[Er] is een aanzienlijke hoeveelheid gegenderde informatie in cv’s. Zelfs na significante pogingen om geslacht uit cv’s te verhullen, kan een eenvoudig Tf-Idf-model leren om te discrimineren tussen [geslachten]. Dit valideert empirisch de zorgen over modellen die leren om geslacht te discrimineren en vooroordelen in de trainingsdata door te geven.’

Deze vinding is belangrijk niet omdat het realistisch mogelijk is om geslacht tijdens het selectie- en interviewproces te verhullen (wat het duidelijk niet is), maar omdat het bereiken van dat stadium mogelijk een AI-gebaseerde beoordeling van het cv met geen mensen in de lus kan omvatten – en HR-AI heeft in recente jaren een besmeurde reputatie voor geslachtsvooroordeel.

Resultaten uit de studie van de onderzoekers laten zien hoe resilient geslacht is voor pogingen tot verhulling:

Resultaten uit het NYU-rapport. Bron: https://arxiv.org/pdf/2112.08910.pdf

Resultaten uit het NYU-rapport. Bron: https://arxiv.org/pdf/2112.08910.pdf

De bovenstaande resultaten gebruiken een 0-1 Area Under the Receiver Operating Characteristic (AUROC)-meting, waarbij ‘1’ een 100% zekerheid van geslachtsidentificatie vertegenwoordigt. De tabel omvat een reeks van acht experimenten.

Zelfs in de slechtst presterende resultaten (experimenten #7 en #8), waarin een cv zo zwaar is ontdaan van geslachtsidentificerende informatie dat het niet meer bruikbaar is, kan een eenvoudig NLP-model zoals Word2Vec nog steeds een nauwkeurige geslachtsidentificatie benaderen van 70%.

De onderzoekers merken op:

‘Binnen de algoritme-huurcontext impliceren deze resultaten dat, tenzij de trainingsdata perfect onbevooroordeeld is, zelfs eenvoudige NLP-modellen zullen leren om geslacht te discrimineren uit cv’s, en vooroordelen door te geven.’

De auteurs impliceren dat er geen legitieme AI-gebaseerde oplossing is voor ‘ontgeslachting’ van cv’s in een praktische wervingspijplijn, en dat machine learning-technieken die actief eerlijke behandeling afdwingen, een betere aanpak zijn voor het probleem van geslachtsvooroordeel op de arbeidsmarkt.

In AI-termen is dit equivalent aan ‘positieve discriminatie’, waarbij geslachtsopenbaarende cv’s als onvermijdelijk worden aanvaard, maar opnieuw rangschikking actief wordt toegepast als een egalitaire maatregel. Benaderingen van deze aard zijn voorgesteld door LinkedIn in 2019, en onderzoekers uit Duitsland, Italië en Spanje in 2018.

Het rapport heet Gegenderde Taal in Cv’s en de Implicaties voor Algoritmische Vooroordeel in Werving, en is geschreven door Prasanna Parasurama, van de afdeling Technologie, Operaties en Statistiek aan de NYU Stern Business School, en João Sedoc, assistent-professor in Technologie, Operaties en Statistiek aan Stern.

Geslachtsvooroordeel in Werving

De auteurs benadrukken de omvang waarop geslachtsvooroordeel in wervingsprocedures systematisch wordt, met HR-managers die geavanceerde algoritmische en machine learning-gedreven ‘selectie’-processen gebruiken die neerkomen op AI-geactiveerde afwijzing op basis van geslacht.

De auteurs citeren het geval van een wervingsalgoritme bij Amazon dat in 2018 bekend werd gemaakt om vrouwelijke sollicitanten op een routineuze manier te hebben afgewezen omdat het had geleerd dat historisch gezien mannen vaker werden aangenomen

‘Het model had door historische wervingsgegevens geleerd dat mannen vaker werden aangenomen, en gaf daarom hogere scores aan mannelijke cv’s dan aan vrouwelijke cv’s.

‘Hoewel het geslacht van de sollicitant niet expliciet in het model was opgenomen, leerde het om te discrimineren tussen mannelijke en vrouwelijke cv’s op basis van de gegenderde informatie in cv’s – bijvoorbeeld, mannen gebruikten vaker woorden als “uitgevoerd” en “gevangen”.’

Bovendien vond onderzoek uit 2011 dat vacatures die impliciet mannen zoeken expliciet mannen aantrekken, en vrouwen ontmoedigen om voor de functie te solliciteren. Digitalisering en big data-schema’s beloven deze praktijken verder in geautomatiseerde systemen in te prenten, als het syndroom niet actief wordt aangepakt.

Gegevens

De NYU-onderzoekers trainden een reeks modellen om geslacht te classificeren met behulp van predictief modeleren. Ze zochten ook naar hoe goed de modellen in staat waren om geslacht te voorspellen nadat steeds meer potentieel geslachtsopenbaarende informatie was verwijderd, terwijl ze probeerden om inhoud relevant voor de sollicitatie te behouden.

De dataset werd gegenereerd uit een verzameling van sollicitantencv’s van acht Amerikaanse IT-bedrijven, met elk cv vergezeld van gegevens over naam, geslacht, jaren ervaring, vakgebied of studie, en de vacature waarvoor het cv was ingediend.

Om dieper contextuele informatie uit deze gegevens te extraheren in de vorm van een vectorweergave, trainden de auteurs een Word2Vec-model. Dit werd vervolgens omgezet in tokens en gefilterd, en uiteindelijk resulteerde het in één ingebedde weergave voor elk cv.

Mannelijke en vrouwelijke monsters werden 1-1 gematcht, en een subset werd gegenereerd door de beste objectief geschikte mannelijke en vrouwelijke sollicitanten te koppelen, met een marge van 2 jaar, in termen van ervaring in hun vakgebied. De dataset bestaat dus uit 174.000 mannelijke en 174.000 vrouwelijke cv’s.

Architectuur en Bibliotheken

De drie modellen die voor de classificatietaken werden gebruikt, waren Term Frequency-Inverse Document Frequency (TF-IDF) + Logistic, Word Embeddings + Logistic, en Longformer.

Het eerste model biedt een baseline die geslacht discrimineert op basis van lexicaal verschil. De tweede benadering werd zowel met een standaardwoordembeddingsysteem als met geslachtsneutrale woordembeddings gebruikt.

De gegevens werden gesplitst in 80/10/10 tussen training, evaluatie en testen,

Zoals te zien is in de bovenstaande resultaten, was de transformer-gebaseerde Longformer-bibliotheek, die aanzienlijk geavanceerder is dan de eerdere benaderingen, bijna in staat om een volledig ‘ongebufferd’ cv te evenaren in termen van zijn vermogen om geslacht te detecteren uit documenten die actief waren ontdaan van bekende geslachtsindicatoren.

De uitgevoerde experimenten omvatten data-ablatiestudies, waarbij een toenemende hoeveelheid geslachtsopenbaarende informatie uit de cv’s werd verwijderd, en de modellen werden getest tegen deze meer terughoudende documenten.

Verwijderde informatie omvatte hobby’s (een criterium afgeleid van de Wikipedia-definitie van ‘hobby’s’), LinkedIn-IDs en URLs die geslacht konden onthullen. Bovendien werden termen zoals ‘broederschap’, ‘serveerster’ en ‘verkoper’ verwijderd in deze spaarzamere versies.

Aanvullende Resultaten

In aanvulling op de bovenstaande resultaten vonden de NYU-onderzoekers dat gegenderde woordembeddings de capaciteit van de modellen om geslacht te voorspellen niet verlaagden. In het rapport hinten de auteurs naar de mate waarin geslacht geschreven taal doordringt, en merken op dat deze mechanismen en signaalgevers nog niet goed worden begrepen.

Schrijver over machine learning, domeinspecialist in humane beeldsynthese. Voormalig hoofd van onderzoeksinhoud bij Metaphysic.ai, tot de opheffing ervan in DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai