Взгляд Anderson
Вызов “Расовая категоризация” для систем синтеза изображений на основе CLIP

Новые исследования из США показывают, что одна из популярных моделей компьютерного зрения, лежащая в основе серии DALL-E, а также многих других моделей генерации и классификации изображений, демонстрирует доказуемую тенденцию к гиподесценции – правилу расовой категоризации (также известному как “правило одной капли”), которое категоризирует человека с даже небольшим количеством “смешанной” (т.е. не-каucasoidной) генетической линии полностью в “миноритарную” расовую категорию.
Поскольку гиподесценция характеризовала некоторые из самых темных глав в истории человечества, авторы новой статьи предлагают, что такие тенденции в исследованиях компьютерного зрения и их реализации должны получить больше внимания, не в последнюю очередь потому, что поддерживающая основа в вопросе, скачанная почти миллион раз в месяц, может дальнейшим образом распространять и продвигать расовую предвзятость в последующих основах.
Архитектура, изучаемая в новой работе, – это Contrastive Language Image Pretraining (CLIP), многомодальная модель машинного обучения, которая учится семантическим ассоциациям путем обучения на парах изображений и подписей, полученных из интернета – полусупervised подход, который снижает значительную стоимость маркировки, но который, вероятно, отражает предвзятость людей, создавших подписи.
Из статьи:
‘Наши результаты предоставляют доказательства гиподесценции в пространстве вложения CLIP, предвзятости, применяемой более сильно к изображениям женщин. Результаты进一步 указывают на то, что CLIP ассоциирует изображения с расовыми или этническими метками на основе отклонения от белого, с белым как стандартом.’
Статья также показывает, что валентная ассоциация изображения (его тенденция быть ассоциированным с “хорошими” или “плохими” вещами) заметно выше для “миноритарных” расовых меток, чем для каucasoidных меток, и предполагает, что предвзятости CLIP отражают US-центричный корпус литературы (английский язык Википедии), на котором была обучена основа.
Комментируя последствия очевидной поддержки гиподесценции CLIP, авторы заявляют*:
‘[Среди] первых использований CLIP было обучение модели нулевого выстрела DALL-E. Более крупная, непубличная версия архитектуры CLIP была использована в обучении DALL-E 2. Согласно результатам настоящего исследования, в модели DALL-E 2 “производятся изображения, которые склонны переоценивать людей, которые прошли белую ассимиляцию”.
‘Такие использования демонстрируют потенциал для предвзятостей, выученных CLIP, распространиться за пределы пространства вложения модели, поскольку ее особенности используются для формирования семантики в других современных моделях ИИ.
‘Более того, благодаря в частности достижениям, достигнутым CLIP и подобными моделями для ассоциации изображений и текста в нулевом выстреле, многомодальные архитектуры были описаны как основа для будущего широко используемых интернет-приложений, включая поисковые системы.
‘Наши результаты указывают на то, что дополнительное внимание к тому, что такие модели учатся из естественного языкового надзора, является оправданным.’
Статья называется Доказательства гиподесценции в визуальной семантической ИИ, и исходит от трех исследователей Университета Вашингтона и Гарвардского университета.
CLIP и плохие влияния
Хотя исследователи утверждают, что их работа является первой анализом гиподесценции в CLIP, предыдущие работы продемонстрировали, что рабочий процесс CLIP, зависящий от в основном несупervised обучения из недооцененных веб-деривированных данных, недооценивает женщин, может производить официозный контент, и может демонстрировать семантическую предвзятость (такую как анти-мусульманское настроение) в своем изображении кодировщика.
Оригинальная статья, представившая CLIP, признала, что в нулевом выстреле CLIP ассоциирует только 58,3% людей с белой расовой меткой в FairFace наборе данных. Учитывая, что FairFace была помечена с возможной предвзятостью работниками Amazon Mechanical Turk, авторы новой статьи заявляют, что ‘значительная меньшинство людей, которые воспринимаются другими людьми как белые, ассоциируются с расовой меткой, отличной от белой, CLIP.’.
Они продолжают:
‘Обратное не кажется истинным, поскольку люди, которые воспринимаются как принадлежащие к другим расовым или этническим меткам в наборе данных FairFace, ассоциируются с этими метками CLIP. Этот результат предполагает возможность того, что CLIP выучил правило “гиподесценции”, как описано социальными учеными: люди с многорасовой наследственностью более вероятно воспринимаются и категоризируются как принадлежащие к меньшинству или менее благоприятной родительской группе, чем к равно законной большинству или благоприятной родительской группе.
‘Иными словами, ребенок черного и белого родителя воспринимается как более черный, чем белый; и ребенок азиатского и белого родителя воспринимается как более азиатский, чем белый.’
Статья имеет три основных вывода: что CLIP демонстрирует гиподесценцию, “сгоняя” людей с многорасовыми идентичностями в меньшинство, вносящее вклад в расовую категорию; что ‘белый является стандартной расой в CLIP’, и что конкурирующие расы определяются их ‘отклонением’ от белой категории; и что валентная предвзятость (ассоциация с “плохими” понятиями) коррелирует с тем, насколько человек категоризируется в расовое меньшинство.
Метод и данные
Чтобы определить, как CLIP относится к многорасовым субъектам, исследователи использовали ранее принятую морфную технику для изменения расы изображений людей. Фотографии были взяты из Chicago Face Database, набора, разработанного для психологических исследований, связанных с расой.

Примеры из расово-морфированных изображений CFD, представленных в дополнительном материале новой статьи. Источник: https://arxiv.org/pdf/2205.10764.pdf
Исследователи выбрали только изображения с “нейтральным выражением” из набора данных, чтобы оставаться последовательными с предыдущей работой. Они использовали сеть Generative Adversarial Network StyleGAN2-ADA (обученную на FFHQ) для изменения расы лиц, и создали промежуточные изображения, демонстрирующие прогресс от одной расы к другой (см. примеры изображений выше).
Согласно предыдущей работе, исследователи морфировали лица людей, которые идентифицировали себя как черные, азиаты и латиноамериканцы в наборе данных, в лица людей, которые идентифицировали себя как белые. Девятнадцать промежуточных стадий были произведены в процессе. Всего было создано 21 000 изображений размером 1024×1024 пикселей для этого проекта.
Исследователи затем получили проектированное изображение вложения для CLIP для каждого из 21 изображений в каждом расовом морфе. После этого они запросили метку для каждого изображения из CLIP: ‘многорасовый’, ‘бирасовый’, ‘смешанная раса’, и ‘человек’ (последняя метка, исключающая расу).
Использованная версия CLIP была CLIP-ViT-Base-Patch32 реализацией. Авторы отмечают, что эта модель была скачана более миллиона раз в месяц, предшествующий написанию их исследования, и составляет 98% скачиваний любой модели CLIP из Transformers библиотеки.
Тесты
Чтобы протестировать потенциальную склонность CLIP к гиподесценции, исследователи отметили расовую метку, присвоенную CLIP каждому изображению в градиенте морфированных изображений для каждого человека.
Согласно результатам, CLIP склоняется к группировке людей в “меньшинственные” категории около 50% отметки перехода.

При 50% соотношении смешивания, где субъект равен исходной/целевой расе, CLIP ассоциирует большее количество из 1000 морфированных женских изображений с азиатскими (89,1%), латиноамериканскими (75,8%) и черными (69,7%) метками, чем с эквивалентной белой меткой.
Результаты показывают, что женские субъекты более склонны к гиподесценции под CLIP, чем мужчины, хотя авторы гипотезируют, что это может быть потому, что веб-деривированные и несупervised метки, характеризующие женские изображения, склонны подчеркивать внешность субъекта более, чем в случае мужчин, и что это может иметь искажающий эффект.
Гиподесценция на 50% расового перехода не наблюдалась для азиатско-белого мужского или латиноамериканского-белого мужского морф-серии, в то время как CLIP присвоил более высокую косинусную подобие черной метке в 67,5% случаев при 55% соотношении смешивания.

Средняя косинусная подобие многорасовых, бирасовых и смешанных расовых меток. Результаты указывают на то, что CLIP работает своего рода “водоразделом” категоризацией при различных процентах расового смешивания, реже присваивая такое расовое смешивание белой (‘человек’, в обосновании экспериментов) метке, чем этнической метке, воспринимаемой в изображении.
Идеальный объект, согласно статье, заключается в том, что CLIP должен категоризировать промежуточные расовые смешивания точно как “смешанную расу”, а не определять “точку перехода”, в которой субъект так часто полностью присваивается не-белой метке.
В определенной степени CLIP присваивает промежуточным морф-шагам смешанную расу (см. график выше), но в конечном итоге демонстрирует среднюю предпочтение категоризировать субъектов как их меньшинство, вносящее вклад в расу.
В отношении валентности авторы отмечают искаженное суждение CLIP:
‘[Средняя] валентная ассоциация (ассоциация с неприятными или плохими понятиями) варьируется с соотношением смешивания по черно-белому мужскому морф-сериалу, так что CLIP кодирует ассоциации с неприятными понятиями для лиц, наиболее похожих на волонтеров CFD, которые идентифицируют себя как черные.’

Результаты валентности – тесты показывают, что меньшинственные группы более ассоциируются с негативными понятиями в архитектуре изображения/пары, чем белые метки. Авторы утверждают, что ассоциация неприятности изображения увеличивается с вероятностью того, что модель ассоциирует изображение с черной меткой.
Статья гласит:
‘Доказательства указывают на то, что валентность изображения коррелирует с расовой ассоциацией. Более конкретно, наши результаты указывают на то, что чем более модель уверена, что изображение отражает черного человека, тем более ассоциируется изображение с неприятным пространством вложения.’
Однако результаты также указывают на отрицательную корреляцию в случае азиатских лиц. Авторы предполагают, что это может быть связано с передачей (через веб-источники данных) положительных культурных восприятий азиатских людей и сообществ в США. Авторы заявляют*:
‘Наблюдение за корреляцией между приятностью и вероятностью азиатской текстовой метки может соответствовать стереотипу “модели меньшинства”, когда люди азиатского происхождения хвалятся за свою восходящую мобильность и ассимиляцию в американскую культуру, и даже ассоциируются с “хорошим поведением”.’
В отношении окончательной цели, чтобы изучить, является ли белый “стандартной идентичностью” с точки зрения CLIP, результаты указывают на встроенную полярность, предполагая, что в этой архитектуре довольно трудно быть “немного белым”.

Косинусная подобие по 21 000 изображениям, созданным для тестов.
Авторы комментируют:
‘Доказательства указывают на то, что CLIP кодирует белый как стандартную расу. Это подтверждается более сильными корреляциями между белыми косинусными подобиями и косинусными подобиями человека, чем для любой другой расовой или этнической группы.’
*Мое преобразование встроенных цитат авторов в гиперссылки.
Опубликовано впервые 24 мая 2022 года.












