Погляд Anderson

Виклик “Расової Категоризації” для Систем Синтезу Зображень на основі CLIP

mm
Додайте Unite.AI до бажаних джерел у Google

Нові дослідження з США показали, що одна з популярних моделей комп’ютерного бачення, яка лежить в основі серії DALL-E, а також багатьох інших моделей генерації та класифікації зображень, демонструє доведену тенденцію до гіподесценту – правила расової категоризації (також відомого як “правило однієї краплі”), яке категоризує людину з навіть незначною кількістю “змішаної” (тобто не-каucasоїдної) генетичної лінії повністю в категорію “меншина” расової класифікації.

Відтак, гіподесцент характеризував деякі з найгірших розділів людської історії, автори нової статті пропонують, що такі тенденції в дослідженнях комп’ютерного бачення та реалізації повинні отримати більше уваги, не в останню чергу через те, що підтримуюча основа, яка використовується майже мільйон разів на місяць, могла б ще більше поширити та закріпити расові упередження в подальших рамках.

Архітектура, яку вивчають у новій роботі, – це Контрастне мовно-образове передавання (CLIP), багатомодальна модель машинного навчання, яка вивчає семантичні асоціації шляхом навчання на парах зображень/підписів, взятих з інтернету – напівнаглядовий підхід, який зменшує значні витрати на маркування, але який, ймовірно, відображатиме упередження людей, які створили підписи.

З статті:

‘Наші результати надають докази гіподесценту в просторі вкладення CLIP, упередження, яке застосовується сильніше до зображень жінок. Результати далі вказують на те, що CLIP асоціює зображення з расовими або етнічними мітками на основі відхилення від білої раси, з білою як замовчуваною.

Стаття також виявила, що асоціація валентності зображення (його тенденція бути асоційованим з “добрими” або “поганими” речами) помітно вища для “меншинних” расових міток, ніж для каucasоїдних міток, і припускає, що упередження CLIP відображають упередження американського корпусу літератури (англійська Вікіпедія), на якому була навчена основа.

Коментуючи наслідки очевидної підтримки гіподесценту CLIP, автори заявляють*:

‘[Одним з] перших застосувань CLIP було навчання моделі нульової генерації зображень DALL-E. Більша, не публічна версія архітектури CLIP була використана в навчанні DALL-E 2. У відповідності з результатами цієї роботи, опис ризиків та обмежень у моделі DALL-E 2 зазначає, що вона “генерує зображення, які схильні надмірно представляти людей, які білізуються”.

‘Такі застосування демонструють потенційну можливість для упереджень, вивчених CLIP, поширення за межі простору вкладення моделі, оскільки її особливості використовуються для формування семантики в інших моделях штучного інтелекту.

‘Крім того, завдяки досягненням, здійсненим CLIP та подібними моделями для асоціації зображень та тексту в нульовому режимі, багатомодальні архітектури були описані як основа для майбутнього широко використовуваних інтернет-застосунків, включаючи пошукові системи.

‘Наші результати вказують на те, що додаткова увага до того, що такі моделі вивчають з природної мовної нагляду, є виправданою.’

Стаття називається Докази гіподесценту у візуальному семантичному штучному інтелекті, і походить від трьох дослідників Університету Вашингтона та Гарвардського університету.

CLIP і погані впливи

Хоча дослідники стверджують, що їхня робота є першою аналізом гіподесценту в CLIP, попередні роботи продемонстрували, що робочий процес CLIP, залежний від значною мірою ненаглядового навчання з підкураторських веб-даних, недостатньо представляє жінок, може виробляти образливі контенти, і може демонструвати семантичну упередженість (таку як анти-мусульманські настрої) у своєму кодувальнику зображень.

Оригінальна стаття, яка представила CLIP, погодилася з тим, що в нульовому режимі CLIP асоціює лише 58,3% людей з білою расовою міткою в FairFace наборі даних. Зауважуючи, що FairFace була позначена з можливим упередженням працівниками Amazon Mechanical Turk, автори нової статті заявляють, що “істотна меншина людей, яких інші люди сприймають як білих, асоціюється з іншою расовою міткою, ніж біла, CLIP”.

Вони продовжують*:

‘Вивернути не здається правдою, оскільки особи, які сприймаються як належні до інших расових або етнічних міток у наборі даних FairFace, асоціюються з цими мітками CLIP. Це результат свідчить про можливість того, що CLIP вивчив правило “гіподесценту”, як описано соціологами: особи з багаторасовою спадщиною більш схильні бути сприйняті та категоризовані як належні до меншинної або менш avantajованої батьківської групи, ніж до більш легітимної більшості або avantajованої батьківської групи.

‘Іншими словами, дитина чорного та білого батьків сприймається як більш чорна, ніж біла; і дитина азіатського та білого батьків сприймається як більш азіатська, ніж біла.’

Стаття має три центральні висновки: що CLIP демонструє гіподесцент, “згону” людей з багаторасовими ідентичностями в меншинну расову категорію, яка застосовується до них; що “білий – це замовчувана раса в CLIP”, і що конкуруючі раси визначаються їхнім “відхиленням” від білої категорії; і що упередженість валентності (асоціація з “поганими” поняттями) корелює з тим, наскільки особа категоризується в меншинну расову групу.

Метод і дані

Для визначення того, як CLIP поводиться з багаторасовими суб’єктами, дослідники використали раніше прийнятий метод морфінгу для зміни раси зображень осіб. Фотографії були взяті з Чиказької бази даних облич, набору, розробленого для психологічних досліджень, пов’язаних з расою.

Приклади з морфованих зображень CFD, представлених у додатковому матеріалі статті. Джерело: https://arxiv.org/pdf/2205.10764.pdf

Приклади з морфованих зображень CFD, представлених у додатковому матеріалі статті. Джерело: https://arxiv.org/pdf/2205.10764.pdf

Дослідники обрали лише зображення з “нейтральним виразом” з набору даних, щоб залишатися послідовними з попередньою роботою. Вони використали мережу генеративних суперниць StyleGAN2-ADA (навчена на FFHQ) для зміни раси облич осіб, і створили проміжні зображення, які демонструють прогрес від однієї раси до іншої (див. приклади вище).

Послідовно з попередньою роботою, дослідники змінили обличчя осіб, які самі ідентифікували себе як чорних, азіатів та латиноамериканців, у обличчя тих, хто ідентифікував себе як білих. У процесі було створено 19 проміжних стадій. Усього було створено 21 000 зображень розміром 1024×1024 пікселя для проекту цим методом.

Дослідники потім отримали проєктоване вкладення зображення для CLIP для кожного з 21 зображень у кожному расовому морфі. Після цього вони попросили мітку для кожного зображення з CLIP: “багаторасовий”, “бірасовий”, “змішана раса” і “особа” (остання мітка, яка виключає расу).

Версія CLIP, яку використовували, була реалізацією CLIP-ViT-Base-Patch32. Автори зазначають, що ця модель була завантажена понад мільйон разів у місяць, перед тим як вони написали свою статтю, і становить 98% завантажень будь-якої моделі CLIP з бібліотеки Transformers.

Тести

Для перевірки потенційної схильності CLIP до гіподесценту дослідники відзначили расову мітку, призначену CLIP кожному зображенню у градієнті морфованих зображень для кожного індивіда.

За даними результатів, CLIP схильний групувати людей у “меншинні” категорії біля 50% відмітки переходу.

При 50% змішаному співвідношенні, де суб'єкт рівний походженню/цільовій расі, CLIP асоціює більшу кількість з 1000 морфованих жіночих зображень з азіатськими (89,1%), латиноамериканськими (75,8%) та чорними (69,7%) мітками, ніж з еквівалентною білою міткою.

При 50% змішаному співвідношенні, де суб’єкт рівний походженню/цільовій расі, CLIP асоціює більшу кількість з 1000 морфованих жіночих зображень з азіатськими (89,1%), латиноамериканськими (75,8%) та чорними (69,7%) мітками, ніж з еквівалентною білою міткою.

Результати показують, що жіночі суб’єкти більш схильні до гіподесценту під CLIP, ніж чоловіки, хоча автори припускають, що це може бути через те, що веб-дані, отримані з підписів, які характеризують жіночі зображення, підкреслюють зовнішність суб’єкта більше, ніж у випадку з чоловіками, і що це може мати зсувний ефект.

Гіподесцент на 50% расового переходу не спостерігався для азіатсько-білого чоловічого або латиноамерикансько-білого чоловічого морф-серіалу, тоді як CLIP призначив вищу косинусну схожість чорній мітці в 67,5% випадків при 55% змішаному співвідношенні.

Середня косинусна схожість міток Багаторасовий, Бірасовий і Змішана раса. Результати вказують на те, що CLIP діє як一种

Середня косинусна схожість міток Багаторасовий, Бірасовий і Змішана раса. Результати вказують на те, що CLIP діє як一种 “вододільна” категоризація при різних відсотках расової суміші, менше часто призначає таку расову суміш білої (‘особа’, у раціоналі експериментів) ніж етнічності, яка сприймається в зображенні.

Ідеальний об’єкт, згідно зі статтею, полягає в тому, щоб CLIP категоризував проміжні расові суміші точно як “змішану расу”, а не визначав “точку перелому”, при якій суб’єкт так часто відносять повністю до не-білій расової категорії.

До певної міри CLIP призначає проміжні морфологічні кроки з міткою Змішана раса (див. графік вище), але врешті-решт демонструє середній перевагу категоризації суб’єктів їх меншинною внесковою расою.

У термінах валентності автори зазначають зсувний суд CLIP:

‘[Середня] валентна асоціація (асоціація з неприємністю або поганим vs. з приємністю або добрим) варіює з змішаним співвідношенням над чорно-білим чоловічим морф-серіалом, так що CLIP кодує асоціації з неприємністю для облич, найбільш схожих з волонтерами CFD, які самі ідентифікують себе як чорних.’

Результати валентності - тести показують, що меншинні групи більш асоційовані з негативними поняттями в архітектурі зображення/пару, ніж білі мітки. Автори стверджують, що асоціація неприємності зображення збільшується з ймовірністю того, що модель асоціює зображення з чорною міткою.

Результати валентності – тести показують, що меншинні групи більш асоційовані з негативними поняттями в архітектурі зображення/пару, ніж білі мітки. Автори стверджують, що асоціація неприємності зображення збільшується з ймовірністю того, що модель асоціює зображення з чорною міткою.

Стаття зазначає:

‘Докази свідчать про те, що валентність зображення корелює з расовою [асоціацією]. Конкретніше, наші результати свідчать про те, що чим більш впевнена модель в тому, що зображення відображає чорну особу, тим більш асоційована з неприємним простором вкладення зображення.’

Однак результати також вказують на негативну кореляцію в разі азіатських облич. Автори припускають, що це може бути через те, що веб-дані, отримані з позитивних культурних сприймань азіатських людей та спільнот, передані через дані.
Автори зазначають*:

‘Спостереження кореляції між приємністю та ймовірністю азіатської текстової мітки може відповідати стереотипу “модельної меншини”, згідно з яким люди азіатського походження хваляться за свою мобільність та інтеграцію в американську культуру, і навіть асоційовані з “добрим поведінкою”.’

Відносно кінцевої мети, щоб перевірити, чи біла – це “замовчувана ідентичність” з точки зору CLIP, результати вказують на вбудовану полярність, свідчачи про те, що під цією архітектурою досить складно бути “трохи білим”.

Косинусна схожість по 21 000 зображень, створених для тестів.

Косинусна схожість по 21 000 зображень, створених для тестів.

Автори коментують:

‘Докази свідчать про те, що CLIP кодує білу як замовчувану расу. Це підтримується сильнішою кореляцією між білими косинусними схожостями та особовими косинусними схожостями, ніж для будь-якої іншої расової або етнічної групи.’

 

*Моє перетворення внутрішніх цитат авторів у гіперпосилання.

Перша публікація 24 травня 2022 року.

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai