Anderson’un Açısı

‘Irksal Kategorizasyon’ Çıktısı için CLIP Tabanlı Görüntü Sentezleme Sistemleri

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

ABD’den yapılan yeni bir araştırmada, çok övgü alan DALL-E serisinin arkasındaki popüler bilgisayar vizyonu modellerinden biri olan ve birçok diğer görüntü oluşturma ve sınıflandırma modelinin, hipodesan – ırk kategorizasyonu kuralına (ayrıca ‘bir damla’ kuralı olarak da bilinir) eğilim gösterdiği bulundu. Bu kural, bir kişinin küçük bir miktar ‘karışık’ (yani beyaz olmayan) genetik soyu olan bir kişiyi tamamen ‘azınlık’ ırk kategorisine koyar.

Hipodesan, insanlık tarihinin en çirkin bölümlerini karakterize ettiğinden, yeni makalenin yazarları, bilgisayar vizyonu araştırmaları ve uygulamalarında böyle eğilimlerin daha fazla dikkat çekmesini öneriyorlar. Özellikle de destekleyici çerçevenin, her ay लगभग bir milyon kez indirilen ve aşağı akış çerçevelerinde ırksal önyargıyı daha da yayabilecek bir çerçeve olduğunu belirtiyorlar.

Çalışılan mimari, Karşılaştırmalı Dil Görüntü Ön Eğitimi (CLIP) adlı çok modelli bir makine öğrenimi modelidir. CLIP, internetten alınan görüntü/kapak çiftleri üzerinde eğitim yaparak anlamsal ilişkiler öğrenir – bu, etiketleme maliyetini azaltan yarı gözetimli bir yaklaşımdır, ancak oluşturulan kapakların önyargısını yansıtabilir.

Makaleden:

‘Sonuçlarımız, CLIP gömme alanında hipodesan için kanıt sağlar, bu önyargı daha çok kadın görüntülerine uygulanır. Sonuçlar ayrıca, CLIP’in görüntüleri ırksal veya etnik etiketlere White’dan sapma temelinde bağladığını ve White’ı varsayılan olarak kullandığını gösterir.’

Makale ayrıca, bir görüntünün valens ilişkisinin (görüntünün ‘iyi’ veya ‘kötü’ şeyler ile ilişkili olma eğilimi) ‘azınlık’ ırksal etiketlerinden daha yüksek olduğunu ve CLIP’in önyargılarının, modelin eğitildiği İngilizce Wikipedia gibi ABD merkezli literatür yansıttığını buldu.

CLIP’in apparent hipodesan desteğinin etkileri hakkında yorum yapan yazarlar:

‘CLIP’in ilk kullanımlarından biri, DALL-E adlı sıfır-atış görüntü oluşturma modelini eğitmekti. CLIP mimarisinin daha büyük, kamuya açık olmayan bir sürümü, DALL-E 2 modelinin eğitimi için kullanıldı. Mevcut araştırmanın bulgularıyla uyumlu olarak, DALL-E 2 modelinin kartında belirtilen Riskler ve Sınırlamalar notu, modelin “Beyaz geçiş yapan insanları överek görüntüler ürettiğini” belirtir.

‘Bu kullanımlar, CLIP tarafından öğrenilen önyargıların modelin gömme alanının ötesine yayılma potansiyelini gösterir, çünkü özellikler diğer üst düzey AI modellerinin anlamsal oluşumunu yönlendirmek için kullanılır.’

‘Dahası, CLIP ve benzer modellerin sıfır-atış ayarında görüntü ve metin arasındaki ilişkilendirmeye ilişkin ilerlemeler nedeniyle, çok modelli mimarilerin, arama motorları da dahil olmak üzere yaygın olarak kullanılan internet uygulamalarının geleceğinin temeli olarak tanımlanmıştır.’

‘Sonuçlarımız, böyle modellerin doğal dil denetiminden neler öğrendiğine dikkat edilmesi gerektiğini gösterir.’

Makale, Evidence for Hypodescent in Visual Semantic AI olarak adlandırılmış ve Washington Üniversitesi ve Harvard Üniversitesi’nden üç araştırmacı tarafından yazılmıştır.

CLIP ve Kötü Etkiler

Araştırmacılar, çalışmanın CLIP’te hipodesan analizi yapan ilk çalışma olduğunu belirtiyorlar, ancak önceki çalışmalar, CLIP iş akışının, büyük ölçüde denetimsiz web türetilen verilerden eğitim aldığından, düşük kaliteli veri setlerini temsil edebileceğini, kadınları temsil etmekte yetersiz kalabileceğini, suistimal edici içerik üretebileceğini ve anlamsal önyargı (örneğin, anti-müslüman sentiment) gösterebileceğini kanıtlamıştır.

CLIP’in orijinal makalesi, sıfır-atış ayarında CLIP’in yalnızca %58,3’ü people ile White ırksal etiketini FairFace veri setinde birleştirdiğini kabul etti. Araştırmacılar, FairFace’in Amazon Mechanical Turk çalışanları tarafından olası önyargıyla etiketlendiğini gözlemledi ve “insanların White olarak algılandığı halde CLIP’in bir başka ırkla ilişkilendirdiği insanların önemli bir azınlığı” olduğunu belirttiler.

Devam ediyorlar:

‘Tersi görünmüyor, çünkü FairFace veri setindeki diğer ırksal veya etnik etiketlerle ilişkili bireylerin, CLIP tarafından bu etiketlerle ilişkilendirildiği görülüyor. Bu sonuç, CLIP’in sosyal bilimciler tarafından tanımlanan “hipodesan” kuralını öğrendiğini gösterir: çok ırklı soyu olan bireyler, daha az ayrıcalıklı ebeveyn grubuna ait olmaya daha eğilimlidir.’

‘Diğer bir deyişle, bir Siyah ve bir Beyaz ebeveynin çocuğu daha Siyah olarak algılanır; bir Asya ve bir Beyaz ebeveynin çocuğu daha Asya olarak algılanır.’

Makale, CLIP’in hipodesan sergilediğini, insanları çok ırklı kimliklere sahip olarak “çoban”ladığını, White’ı varsayılan ırk olarak kullandığını ve ırksal azınlıkların daha fazla “kötü” kavramlarla ilişkili olduğunu gösteren üç temel bulguya sahiptir.

Yöntem ve Veri

Araştırmacılar, CLIP’in çok ırklı konulara nasıl davrandığını belirlemek için, daha önce kullanılan bir morflama tekniği kullanarak bireylerin ırksal özelliklerini değiştirdiler. Fotoğraflar, Chicago Face Database adlı bir psikolojik çalışma veri setinden alındı.

Yeni makalenin ek malzemelerindeki ırksal olarak değiştirilmiş CFD görüntülerinden örnekler. Kaynak: https://arxiv.org/pdf/2205.10764.pdf

Yeni makalenin ek malzemelerindeki ırksal olarak değiştirilmiş CFD görüntülerinden örnekler. Kaynak: https://arxiv.org/pdf/2205.10764.pdf

Araştırmacılar, yalnızca ‘nötr ifade’ görüntülerini veri setinden seçti, önceki çalışmayla tutarlı olmak için. StyleGAN2-ADA adlı Generative Adversarial Network’u ( FFHQ üzerinde eğitilmiş) kullanarak yüzlerin ırksal özelliklerini değiştirdiler ve bir ırktan diğerine geçişi gösteren ara görüntüler oluşturdular (yukarıdaki örnek görüntülere bakın).

Önceki çalışmayla tutarlı olarak, araştırmacılar, veri setindeki Siyah, Asya ve Latin olarak kendini tanımlayan kişilerin yüzlerini Beyaz olarak etiketlenen yüzlerle değiştirdiler. Bu işlemde 19 ara aşama üretildi. Toplam 21.000 1024x1024px görüntü, bu yöntem kullanılarak oluşturuldu.

Araştırmacılar, her bir ırksal morflama setindeki 21 görüntüden her biri için CLIP’in projeksiyonlu görüntü gömme alanını elde etti. Ardından, her görüntüye CLIP’ten bir etiket istediler: ‘çok ırklı’, ‘iki ırklı’, ‘karışık ırk’ ve ‘kişi’ (son etiket ırkı içermiyordu).

Kullanılan CLIP sürümü, CLIP-ViT-Base-Patch32 uygulamasıydı. Yazarlar, bu modelin, makale yazıldığı ayda bir milyondan fazla kez indirildiğini ve Transformers kütüphanesinden indirilen tüm CLIP modellerinin %98’ini oluşturduğunu belirtiyorlar.

Testler

Araştırmacılar, CLIP’in potansiyel hipodesan eğilimini test etmek için, her bir morflanmış görüntü dizisi için CLIP tarafından atanan ırksal etiketi not ettiler.

Bulgulara göre, CLIP, yaklaşık %50’lik geçiş noktasında, insanları ‘azınlık’ kategorilerine koyma eğilimindedir.

CLIP, %50'lik karıştırma oranında, 1000 morflanmış kadın görüntüsünü Asya (%89,1), Latina (%75,8) ve Siyah (%69,7) etiketleriyle ilişkilendirir, buna karşılık eşdeğer bir Beyaz etiketi kullanmaz.

CLIP, %50’lik karıştırma oranında, 1000 morflanmış kadın görüntüsünü Asya (%89,1), Latina (%75,8) ve Siyah (%69,7) etiketleriyle ilişkilendirir, buna karşılık eşdeğer bir Beyaz etiketi kullanmaz.

Sonuçlar, kadın konuların CLIP altında hipodesana daha eğilimli olduğunu, ancak yazarların, bu olgunun, kadın görüntülerinin web türetilen etiketlerinde görünümünün vurgulanması nedeniyle olabileceğini öne sürdü.

Hipodesan, %50’lik ırksal geçişte Asya-Beyaz erkek morflama dizisi veya Latino-Beyaz erkek morflama dizisinde gözlemlenmedi, ancak CLIP, %55’lik karıştırma oranında %67,5’lik durumlarda Siyah etiketi atanmasına daha yüksek bir kozinüs benzerliği gösterdi.

Çok ırklı, iki ırklı ve karışık ırk etiketlerinin ortalama kozinüs benzerliği. Sonuçlar, CLIP'in, görüntüde algılanan etnik kökenine göre White'dan daha az sıklıkla ırksal karışımı White'a değil, etnik kökenine atfettiğini gösterir.

Çok ırklı, iki ırklı ve karışık ırk etiketlerinin ortalama kozinüs benzerliği. Sonuçlar, CLIP’in, görüntüde algılanan etnik kökenine göre White’dan daha az sıklıkla ırksal karışımı White’a değil, etnik kökenine atfettiğini gösterir.

İdeal hedef, CLIP’in ara ırksal karışımları doğru olarak ‘karışık ırk’ olarak sınıflandırmasıdır, ancak CLIP, bir ‘eşiğin’ üzerinde, konuyu tamamen beyaz olmayan etikete atanma eğilimindedir.

CLIP, bazı ara morflama adımlarına gerçekten ‘karışık ırk’ etiketini atar, ancak sonunda, konuyu azınlık katkı ırğına sınıflandırma eğilimindedir.

Valens açısından, yazarlar CLIP’in çarpık yargısını not eder:

‘Ortalama valens ilişkisi (kötü veya hoş olmayan ile ilişkili olma eğilimi) Siyah-Beyaz erkek morflama dizisi boyunca karıştırma oranıyla değişir, öyle ki CLIP, CFD gönüllüleri olarak kendini Siyah olarak tanımlayan yüzlerle benzer yüzler için hoş olmayan şeyler ile ilişkili olur.’

Valens sonuçları - testler, azınlık gruplarının CLIP'te White etiketli konulardan daha fazla olumsuz kavramlarla ilişkili olduğunu gösterir. Yazarlar, bir görüntünün hoş olmayan ilişkilendirme oranının, modelin görüntüyü Siyah etiketi ile ilişkilendirdiği olasılıkla arttığını iddia eder.

Valens sonuçları – testler, azınlık gruplarının CLIP’te White etiketli konulardan daha fazla olumsuz kavramlarla ilişkili olduğunu gösterir. Yazarlar, bir görüntünün hoş olmayan ilişkilendirme oranının, modelin görüntüyü Siyah etiketi ile ilişkilendirdiği olasılıkla arttığını iddia eder.

Makale şöyle diyor:

‘Kanitler, bir görüntünün valensinin ırksal ilişki ile ilişkili olduğunu gösterir. Daha somut olarak, sonuçlarımız, modelin bir görüntüyü Siyah bir birey olarak ne kadar kesin bir şekilde ilişkilendirdiğiyle, görüntünün hoş olmayan gömme alanıyla ilişkili olduğunu gösterir.’

Ancak, Asya yüzleri için ngược bir korelasyon bulunur. Yazarlar, bu olgunun, web kaynaklı verilerin ABD kültüründeki Asya topluluklarına yönelik olumlu algılarını yansıtabileceğini öne sürer. Yazarlar şöyle diyor:

‘Asya metin etiketiyle hoşluk arasındaki korelasyonu gözlemlemek, “model azınlık” stereotipine karşılık gelebilir, burada Asya kökenli insanlar, Amerikan kültürüne asimilasyonları ve yükselişleri nedeniyle övülür ve hatta “iyi davranış” ile ilişkilendirilir.’

Son objetivo, CLIP’in White’ı ‘varsayılan kimlik’ olarak görüp görmediğini incelemektir. Sonuçlar, gömme alanında bir kutupluluk olduğunu gösterir, bu da CLIP’in White olarak kabul edilmesi zor olabileceğini ima eder.

21.000 görüntü için kozinüs benzerliği.

21.000 görüntü için kozinüs benzerliği.

Yazarlar şöyle diyor:

‘Kanitler, CLIP’in White’ı varsayılan ırk olarak kodladığını gösterir. Bu, White kozinüs benzerlikleri ile kişi kozinüs benzerliklerinin diğer herhangi bir ırksal veya etnik grup için daha güçlü korelasyonu ile desteklenir.’

 

*Yazarların satır içi alıntılarını hyperlinklere çevirdim.

İlk olarak 24 Mayıs 2022’de yayınlandı.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai