Andersonův úhel

Životopisy uchazečů o práci jsou prakticky nemožné zbavit pohlaví, zjistili výzkumníci z oblasti umělé inteligence

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Výzkumníci z New York University zjistili, že i velmi jednoduché modely zpracování přirozeného jazyka (NLP) jsou schopny určit pohlaví uchazeče o práci z “zbaveného pohlaví” životopisu – i v případech, kdy byly použity metody strojového učení k odstranění všech indikátorů pohlaví z dokumentu.

Po studii, která zahrnovala zpracování 348 000 dobře sladěných mužských a ženských životopisů, výzkumníci dospěli k závěru:

‘Existuje významné množství genderově specifických informací v životopisech. I přes významné pokusy o zakrytí pohlaví v životopisech může jednoduchý model Tf-Idf naučit rozlišovat mezi pohlavími. To empiricky potvrzuje obavy o modelech, které se učí rozlišovat pohlaví a šířit předpojatost v trénovacích datech.’

Zjištění má význam nejen proto, že je realisticky možné skrýt pohlaví během procesu výběru a pohovoru (což clearly není možné), ale také proto, že samotný výběr může zahrnovat kritiku životopisu pomocí umělé inteligence bez lidského zásahu – a HR umělá inteligence v posledních letech získala pošramocenou pověst pro genderovou předpojatost.

Výsledky studie výzkumníků demonstrují, jak odolné je pohlaví vůči pokusům o zakrytí:

Výsledky z práce NYU. Zdroj: https://arxiv.org/pdf/2112.08910.pdf

Výsledky z práce NYU. Zdroj: https://arxiv.org/pdf/2112.08910.pdf

Výsledky výše používají metriku 0-1 Oblast pod křivkou přijímacího operativního charakteru (AUROC), kde ‘1’ představuje 100% jistotu identifikace pohlaví. Tabulka pokrývá osm experimentů.

I v nejhorších výsledcích (experimenty #7 a #8), kde byl životopis tak výrazně zbaven informací o pohlaví, že se stal nepoužitelným, je jednoduchý model NLP, jako je Word2Vec, stále schopen přesně identifikovat pohlaví, a to až na 70%.

Výzkumníci komentují:

‘V kontextu algoritmického náboru tyto výsledky implikují, že pokud nejsou trénovací data dokonale nezávislá, i jednoduché modely NLP se naučí rozlišovat pohlaví z životopisů a šířit předpojatost dále.’

Autoři naznačují, že neexistuje legální řešení pro “zbavení pohlaví” životopisů v praktickém náborovém procesu, a že metody strojového učení, které aktivně vynucují spravedlivé zacházení, jsou lepší přístup k problému genderové předpojatosti na trhu práce.

V kontextu umělé inteligence je to ekvivalent “pozitivní diskriminace”, kde jsou životopisy, které odhalují pohlaví, přijaty jako nevyhnutelné, ale jsou aplikovány re-rankovací opatření jako egalitární opatření. Přístupy této povahy byly navrženy společností LinkedIn v roce 2019 a výzkumníky z Německa, Itálie a Španělska v roce 2018.

Práce článku se jmenuje Genderový jazyk v životopisech a jeho implikace pro algoritmickou předpojatost v náboru a byla napsána Prasannou Parasuramou, z oddělení technologie, operací a statistiky na NYU Stern Business School, a Joãem Sedocem, asistentem profesora technologie, operací a statistiky na Stern.

Předpojatost pohlaví v náboru

Autoři zdůrazňují rozsah, v jakém se předpojatost pohlaví v náborových postupech stává literálně systémovou, s manažery lidských zdrojů, kteří používají pokročilé algoritmické a strojově-naučené “screeningové” procesy, které se rovnají AI-podporovanému odmítnutí na základě pohlaví.

Autoři citují případ náborového algoritmu společnosti Amazon, který byl odhalen v roce 2018, že odmítl ženské uchazečky rutinním způsobem, protože se naučil, že historicky byli muži častěji přijímáni

‘Model se naučil z historických náborových dat, že muži byli častěji přijímáni, a proto ohodnotil mužské životopisy vyšší než ženské. ‘

‘Ačkoli pohlaví uchazeče nebylo explicitně zahrnuto do modelu, naučil se rozlišovat mezi mužskými a ženskými životopisy na základě genderově specifických informací v životopisech – například muži byli častěji používali slova jako “provedl” a “zachytil”.’

Kromě toho výzkum z roku 2011 ukázal, že inzeráty, které implicitně požadují muže explicitně přitahují muže a odrazují ženy od přihlášení se na tuto pozici. Digitalizace a velké datové schéma slibují dále zvěčnit tyto postupy do automatizovaných systémů, pokud nebude tento syndrom aktivně řešen.

Data

Výzkumníci z NYU trénovali řadu modelů pro klasifikaci pohlaví pomocí prediktivního modelování. Kromě toho se snažili zjistit, jak dobře je schopnost modelů předpovídat pohlaví odolná vůči odstranění větších a větších množství potenciálně genderově-specifických informací, zatímco se snažili zachovat obsah relevantní pro přihlášku.

Dataset byl získán z těla uchazečských životopisů z osmi amerických IT společností, s každým životopisem doprovázeným údaji o jménu, pohlaví, letech zkušeností, oboru odbornosti nebo studia a cílové pracovní pozici, pro kterou byl životopis odeslán.

Pro extrakci hlubších kontextových informací z tohoto dat byly autoři trénovali model Word2Vec. Tento model byl poté rozdělen na tokeny a filtrován, nakonec se vyvinul do jedné vestavěné reprezentace pro každý životopis.

Mužské a ženské vzorky byly sladěny 1:1 a získán podmnožina tím, že se spárovaly nejlepší objektivní ženské a mužské uchazeči, s marží chyby 2 roky, vzhledem k zkušenostem v jejich oboru. Takže dataset sestává z 174 000 mužských a 174 000 ženských životopisů.

Architektura a knihovny

Tři modely použité pro klasifikační úlohu byly Term Frequency-Inverse Document Frequency (TF-IDF) + Logistic, Word Embeddings + Logistic a Longformer.

První model nabízí základnu pro rozlišení pohlaví na základě lexikálních rozdílů. Druhý přístup byl použit jak s off-the-shelf word embeddings systémem, tak s gender-debiasovanými word embeddings.

Data byla rozdělena 80/10/10 mezi trénování, vyhodnocení a testování,

Jako je vidět z výsledků výše, transformer-založený Longformer knihovna, která je mnohem sofistikovanější než předchozí přístupy, byla téměř schopna dosáhnout completely “nezabezpečeného” životopisu vzhledem k jeho schopnosti detekovat pohlaví z dokumentů, které byly aktivně zbaveny známých genderových identifikátorů.

Experimenty zahrnovaly data-ablace studie, kde bylo odstraněno stále více genderově-specifických informací z životopisů a modely byly testovány proti těmto více zdrženlivým dokumentům.

Odstraněné informace zahrnovaly koníčky (kritérium odvozené z definice “koníčků” z Wikipedie), LinkedIn ID a URL, které by mohly odhalit pohlaví. Kromě toho byly odstraněny termíny, jako je “bratrstvo”, “číšnice” a “prodejce”, v těchto méně obsáhlých verzích.

Další výsledky

Kromě výsledků diskutovaných výše, výzkumníci z NYU zjistili, že debiased word embeddings nesnižují schopnost modelů předpovídat pohlaví. V článku autoři naznačují rozsah, v jakém pohlaví proniká do psaného jazyka, a uvádějí, že tyto mechanismy a signifikátory nejsou dosud dobře pochopeny.

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai