Anderson’un Açısı

İş Başvuru Belgeleri Etkili Bir Şekilde Cinsiyetsiz Hale Getirilemez, AI Araştırmacıları Buldu

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

New York Üniversitesi’nden araştırmacılar, çok basit Doğal Dil İşleme (NLP) modellerinin, bir “cinsiyetten arındırılmış” özgeçmişten iş başvurusu yapan kişinin cinsiyetini belirleme konusunda oldukça yetenekli olduğunu keşfettiler – özellikle de makine öğrenimi yöntemleri belgeden tüm cinsiyet belirteçlerini kaldırmak için kullanıldığında.

348.000 iyi eşleştirilmiş erkek/kadın özgeçmişini içeren bir çalışmanın ardından araştırmacılar şu sonuca varıyorlar:

‘Özgeçişlerde önemli miktarda cinsiyetle ilgili bilgi vardır. Cinsiyeti özgeçişlerden gizleme girişimlerine rağmen, basit bir Tf-Idf modeli cinsiyetler arasında ayrım yapmayı öğrenebilir. Bu, modellerin cinsiyetle ilgili ayrımcılık öğrenmesi ve eğitim verilerini aşağı akışta yaymasıyla ilgili endişeleri empirik olarak doğrular.’

Bu bulgu, gerçekçi olarak cinsiyeti başvuru ve görüşme sürecinde gizlemenin mümkün olmadığından değil, bu aşamaya ulaşmak için insan müdahalesi olmadan AI tabanlı bir özgeçmiş eleştirisi içerebileceğinden önemlidir – ve HR AI son yıllarda cinsiyet ayrımcılığı konusunda lekelenmiş bir üne sahip olmuştur.

Araştırmacıların çalışmasının sonuçları, cinsiyetin gizleme girişimlerine karşı nasıl dayanıklı olduğunu gösteriyor:

NYU makalesinden sonuçlar. Kaynak: https://arxiv.org/pdf/2112.08910.pdf

NYU makalesinden sonuçlar. Kaynak: https://arxiv.org/pdf/2112.08910.pdf

Yukarıdaki sonuçlar, 0-1 Alıcı İşlem Özelliği Eğrisi Alanı (AUROC) ölçütü kullanır, burada ‘1’ cinsiyet tanımlamasının %100 güvenini temsil eder. Tablo sekiz deney kapsar.

En kötü performans gösteren sonuçlarda bile (deneyler #7 ve #8), bir özgeçmişin cinsiyet belirteçlerinden o kadar ağır bir şekilde arındırılmış olması, kullanılmaz hale gelmesi, basit bir NLP modeli gibi Word2Vec hala yaklaşık %70’lik bir cinsiyet tanımlama doğruluğuna ulaşabilir.

Araştırmacılar şunları söylüyor:

‘Algoritmik işe alım bağlamında, bu sonuçlar, eğitim verilerinin mükemmel şekilde önyargılı olmadığı sürece, basit NLP modellerinin cinsiyeti özgeçişlerden ayırt etmeyi öğreneceğini ve önyargıyı aşağı akışta yayacağını ima eder.’

Yazarlar, pratik bir işe alım pipeline’ında özgeçişlerin “cinsiyetsizleştirilmesi” için meşru bir AI tabanlı çözüm olmadığına ve cinsiyet ayrımcılığını iş piyasasındaki sorununa karşı daha iyi bir yaklaşımın, adil muameleyi aktif olarak uygulayan makine öğrenimi teknikleri olduğunu ima ediyorlar.

AI terimlerinde, bu, cinsiyet belirten özgeçişlerin kaçınılmaz olarak kabul edildiği, ancak eşitsizlik karşıtı bir önlem olarak yeniden sıralamanın aktif olarak uygulandığı “pozitif ayrımcılık” anlamına gelir. Bu tür yaklaşımlar, 2019’da LinkedIn tarafından ve 2018’de Alman, İtalya ve İspanya’dan araştırmacılar tarafından önerilmiştir.

Makale başlıklı Özgeçişlerde Cinsiyetle İlişkilendirilmiş Dil ve Algoritmik İşe Alımda Önyargı İçin Önemi ve NYU Stern Business School’un Teknoloji, Operasyonlar ve İstatistik bölümünden Prasanna Parasurama ve Stern’den Teknoloji, Operasyonlar ve İstatistik Yardımcı Profesörü João Sedoc tarafından yazılmıştır.

İşe Alımda Cinsiyet Ayrımcılığı

Yazarlar, işe alım prosedürlerinde cinsiyet ayrımcılığının sistemleştirilme ölçeğini vurguluyorlar, bu da HR yöneticilerinin, AI tabanlı “eleme” süreçleri kullanarak, cinsiyete dayalı olarak AI tarafından ermögülen bir reddetme işlemine yol açıyor.

Yazarlar, 2018’de ortaya çıkan ve kadın adayları otomatik olarak reddeden bir Amazon işe alım algoritmasına atıfta bulunuyorlar

‘Model, tarihsel işe alım verilerini öğrenerek, erkeklerin daha fazla işe alındığını öğrendi ve bu nedenle erkek özgeçişlerini kadın özgeçişlerinden daha yüksek puanladı. ‘

‘Aday cinsiyeti modelde açıkça dahil edilmese de, özgeçişlerdeki cinsiyetle ilgili bilgilere dayanarak erkek ve kadın özgeçişleri arasında ayrım yapmayı öğrendi – örneğin, erkekler “yürütme” ve “ele geçirme” gibi kelimeleri kullanma olasılığı daha yüksekti.’

Ek olarak, 2011’den bir araştırmada, erkeklere açıkça hitap eden iş ilanlarının, erkeklere açıkça çekici geldiği ve kadınların bu iş için başvurmasını caydırabileceği bulundu. Dijitalleşme ve büyük veri şemaları, bu uygulamaları otomatik sistemlere daha da yerleştirecektir, eğer bu durum aktif olarak düzeltilmezse.

Veri

NYU araştırmacıları, cinsiyeti sınıflandırmak için öngörülü modelleme kullanarak bir dizi modeli eğitti. Ayrıca, modellerin cinsiyeti öngörme yetisinin, giderek artan miktarda potansiyel olarak cinsiyet belirteçlerini kaldırma girişimlerine rağmen, nasıl dayanıklı kalabileceğini belirlemeye çalıştılar.

Veri seti, sekiz ABD merkezli IT şirketinden başvuru özgeçişlerinden oluşuyordu, her özgeçiş ad, cinsiyet, deneyim yılı, uzmanlık veya çalışma alanı ve özgeçişin gönderildiği hedef iş ilanının ayrıntılarıyla birlikte veriliyordu.

Bu verilerden daha derin bağlamsal bilgileri çıkarmak için, yazarlar bir Word2Vec modeli eğitti. Bu daha sonra tokenlere ayrıldı ve filtrelendi, sonunda her özgeçiş için bir gömme temsilini çözerek.

Erkek ve kadın örnekleri 1-1 oranında eşleştirildi ve en iyi objektif iş uygunluğu olan erkek ve kadın adayların bir alt kümesi, deneyimdeki marjinal hata payı 2 yıl olarak belirlendi. Böylece veri seti 174.000 erkek ve 174.000 kadın özgeçişinden oluşuyor.

Mimari ve Kütüphaneler

Sınıflandırma görevi için kullanılan üç model, Terim Sıklığı-Ters Belge Sıklığı (TF-IDF) + Lojistik, Kelime Gömme + Lojistik ve Longformer idi.

İlk model, leksikal farklılıklara dayalı olarak cinsiyeti ayıran bir kelime torbası temelini sunar. İkinci yaklaşım, hem hazır bir kelime gömme sistemiyle hem de cinsiyetten arındırılmış kelime gömmeleriyle kullanıldı.

Veriler eğitim, değerlendirme ve test için 80/10/10 olarak bölündü,

Yukarıda görüldüğü gibi, daha sofistike bir yaklaşım olan Longformer kütüphanesi, neredeyse tamamen “korunmasız” bir özgeçişin cinsiyeti tanımlama yeteneklerine eşit olabilecek, bilinçli olarak cinsiyet belirteçlerinden arındırılmış belgelerden cinsiyeti tanımlayabiliyordu.

Deneyler arasında, giderek artan miktarda cinsiyet belirteçlerinin kaldırılmasıyla gerçekleştirilen veri-bozulma çalışmaları ve bu daha az açık belgelerle modellerin test edilmesi yer aldı.

Kaldırılan bilgiler arasında hobiler (Vikipedi’nin “hobiler” tanımından türetilen bir ölçüt), LinkedIn ID’leri ve cinsiyeti ortaya çıkarabilecek URL’ler bulunuyordu. Ayrıca, “kardeşlik”, “garson” ve “satıcı” gibi terimlerin bu daha az açık sürümlerinden çıkarıldı.

Ek Sonuçlar

Yukarıda tartışılan sonuçlara ek olarak, NYU araştırmacıları, önyargılı kelime gömmelerinin modellerin cinsiyeti öngörme yeteneğini düşürmediğini buldu. Makalede, yazarlar, dilin cinsiyetle nasıl iç içe geçtiğini ve bu mekanizmaların ve işaretleyicilerin henüz iyi anlaşılmadığını ima ediyorlar.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai