Взгляд Anderson

Изменение пола и расы в результатах поиска изображений с помощью машинного обучения

mm
Добавьте Unite.AI в избранные источники в Google

Исследовательское сотрудничество между UC San Diego и Adobe (ADBE ) Research предложило инновационное и активное решение проблемы отсутствия расового и гендерного разнообразия в результатах поиска изображений для традиционно доминирующих профессий: использование Генеративных Соперничающих сетей (GAN) для создания не реальных изображений “предвзятых” профессий, где пол и/или раса субъекта изменены.

В этом примере из новой статьи исследователи ввели характеристики для желаемой фотографии, которая либо не представлена в типичном корпусе доступных изображений, либо представлена в неподходящем виде (например, сексуализированном или в каком-либо другом неподходящем представлении). Источник

В этом примере из новой статьи исследователи ввели характеристики для желаемой фотографии, которая либо не представлена в типичном корпусе доступных изображений, либо представлена в неподходящем виде (например, сексуализированном или в каком-либо другом неподходящем представлении). Источник

В новой статье под названием Генерация и контроль разнообразия в поиске изображений авторы предлагают, что существует предел тому, насколько переранжирование может исправить несбалансированность предвзятых классов изображений/функций, таких как сантехник, оператор машины, инженер-программист и многие другие – и что увеличение расового и гендерного разнообразия с помощью синтетических данных может быть способом решения этой проблемы.

‘Погоня за утопическим миром требует предоставления пользователям контента возможности представить любую профессию с разными расовыми и гендерными характеристиками. Ограниченный выбор существующего контента для определенных комбинаций профессии, расы и пола представляет собой проблему для поставщиков контента. Текущие исследования, связанные с предвзятостью в поиске, в основном сосредоточены на алгоритмах переранжирования.

‘Однако эти методы не могут создавать новый контент или изменять общее распределение защищенных атрибутов в фотографиях. Чтобы решить эти проблемы, мы предлагаем новую задачу высококачественной генерации изображений с учетом нескольких атрибутов из несбалансированных наборов данных. ‘

Для этого авторы экспериментировали с различными системами синтеза изображений на основе GAN, в конечном итоге остановившись на архитектуре, основанной на StyleGan2.

Из дополнительных материалов статьи, два примера 'уравнивания' изображений профессий, в этих случаях 'плотник' и 'оператор машины'. Источник

Из дополнительных материалов статьи, два примера ‘уравнивания’ изображений профессий, в этих случаях ‘плотник’ и ‘оператор машины’. Источник

Недостаточно или неподходяще представлено

Исследователи формулируют проблему в терминах реального поискового запроса результатов поиска ‘сантехник’* на Google Image search, наблюдая, что результаты поиска изображений доминируются молодыми белыми мужчинами.

Из статьи, выборочные результаты поиска 'сантехник' в Google Image search, январь 2021.

Из статьи, выборочные результаты поиска ‘сантехник’ в Google Image search, январь 2021.

Авторы отмечают, что подобные признаки предвзятости встречаются для ряда профессий, таких как ‘административный помощник’, ‘уборщик’ и ‘оператор машины’, с соответствующими предвзятостями для возраста, пола и расы.

‘Неудивительно, что из-за такой социальной предвзятости некоторые комбинации расы и пола могут иметь мало или совсем нет изображений в репозитории контента. Например, когда мы искали ‘женщина-чернокожая (или афроамериканская) оператор машины’ или ‘мужчина-азиатский административный помощник’, мы не нашли соответствующих изображений на [Google Image search]. ‘

‘Кроме того, в редких случаях определенные комбинации пола и расы могут привести к тому, что люди будут изображены неподходящим образом. Мы наблюдали такое поведение для поисковых запросов, таких как ‘женщина-азиатка-сантехник’ или ‘женщина-чернокожая (или афроамериканская) охранник.’ ‘

Статья ссылается на другое академическое сотрудничество из 2014 года, где исследователи собрали лучшие 400 результатов поиска изображений для 96 профессий. Это исследование показало, что женщины составляли только 37% результатов, а антистереотипные изображения только 22%. Исследование 2019 года из Йельского университета показало, что пять лет увеличили эти проценты только до 45% и 30% соответственно.

Кроме того, исследование 2014 года классифицировало сексуализацию отдельных лиц в определенных профессиях в результатах поиска изображений как Сексуальная проблема плотника, с такими неподходящими классификациями, которые потенциально могут исказить результаты для распознавания профессий.

Большая картина

Основной проблемой для авторов было создание системы синтеза изображений на основе GAN, способной выдавать изображения с разрешением 1024×1024, поскольку, на текущем уровне развития GAN и систем синтеза изображений на основе кодировщиков/декодировщиков, 512×512 является довольно роскошным. Все, что выше, обычно получается путем увеличения окончательного вывода, за счет времени и вычислительных ресурсов, и за счет аутентичности сгенерированных изображений.

Однако авторы утверждают, что более низкие разрешения не могут ожидать получить признание в поиске изображений, и экспериментировали с различными框ами GAN, которые могли бы быть способны выдавать изображения высокого разрешения по требованию, на приемлемом уровне аутентичности.

Когда было решено принять StyleGan2, стало очевидным, что проекту потребуется больший контроль над подфункциями сгенерированного вывода (такими как раса, профессия и пол), чем позволяет стандартная установка. Поэтому авторы использовали многоклассовую условность для дополнения процесса генерации.

Архитектура специфицирующего генератора изображений, которую авторы утверждают, не специфична для StyleGAN2, но может быть применена к ряду генераторных框ов.

Архитектура специфицирующего генератора изображений, которую авторы утверждают, не специфична для StyleGAN2, но может быть применена к ряду генераторных框ов.

Чтобы контролировать факторы расы, пола и профессии, архитектура вводит однократное кодирование этих сконкатенированных характеристик в вектор y. После этого используется сетка прямого распространения, чтобы внедрить эти функции, чтобы они не были проигнорированы во время генерации.

Авторы отмечают, что существуют жесткие ограничения на степень, в которой StyleGAN2 может быть манипулирован таким образом, и что более тонкие попытки изменить результаты привели к худшему качеству изображений, и даже к коллапсу режима.

Эти средства, однако, не решают неявные проблемы предвзятости в архитектуре, которые исследователи должны были решить, переусам플ировав недопредставленные сущности из набора данных, но без риска переобучения, которое повлияет на гибкость сгенерированных потоков изображений.

Следовательно, авторы адаптировали StyleGAN2-ADA, который использует адаптивную аугментацию дискриминатора (ADA), чтобы предотвратить переобучение дискриминатора.

Генерация и оценка данных

Поскольку целью проекта является генерация новых, синтетических данных, исследователи приняли методологию проекта 2014 года, выбрав ряд целевых профессий, которые демонстрируют высокую расовую и гендерную предвзятость. Профессии были выбраны на основе степени воспринимаемой предвзятости в результатах поиска изображений, а также потому, что большинство из них содержат некоторый вид визуальной компоненты, закодированной для профессии, такой как униформа или присутствие специального оборудования или среды.

Авторы выбрали эти профессии не только на основе степени воспринимаемой предвзятости в результатах поиска изображений, но и потому, что большинство из них содержат некоторый вид визуальной компоненты, закодированной для профессии, такой как униформа или присутствие специального оборудования или среды.

Набор данных был сформирован из 10 000 изображений из библиотеки Adobe Stock, обычно получая оценку 95% или выше при попытке классифицировать профессию.

Поскольку многие изображений не были полезны для целевой задачи (т.е. они не содержали людей), была необходима ручная фильтрация. После этого использовался классификатор на основе ResNet32, предварительно обученный на FairFace, для маркировки изображений по полу и расе, получая среднюю точность 95,7% для пола и 81,5% для расы. Таким образом исследователи получили метки изображений для атрибутов Пол: Мужской, Женский, Раса: Белый, Черный, Азиатский и Другие расы.

Модели были построены в TensorFlow с использованием StyleGAN2 и StyleGAN2-ADA в качестве основных сетей. Предварительная подготовка была проведена с предварительно обученными весами StyleGAN2 на наборе данных Flickr-Faces-HQ (FFHQ), дополненном 34 000 изображениями, специфичными для профессий, которые авторы собрали в отдельный набор данных, который они назвали Uncurated Stock-Occupation HQ (U-SOHQ).

Пример HIT из оценки Amazon Mechanical Turk.

Пример HIT из оценки Amazon Mechanical Turk.

Изображения были сгенерированы под четырьмя конфигурациями архитектуры, с Uniform+, который в конечном итоге получил лучшие оценки как в FID (автоматической оценке), так и в последующей оценке работниками Amazon Mechanical Turk. В сочетании с точностью классификации авторы использовали это в качестве основной метрики для своей собственной метрики, озаглавленной Оценка совпадения атрибутов.

Оценка человека сгенерированных изображений, полученных разными методами, с методом Uniform+, который оказался наиболее убедительным, и в конечном итоге стал основой для нового набора данных.

Оценка человека сгенерированных изображений, полученных разными методами, с методом Uniform+, который оказался наиболее убедительным, и в конечном итоге стал основой для нового набора данных.

Статья не указывает, будет ли Stock-Occupation-HQ, полный набор данных, полученный из Uniform+, доступен публично, но указывает, что он содержит 8 113 изображений высокого качества (1024×1024).

Диффузия

Новая статья не явно касается того, как синтетические, ‘пересмотренные’ изображения могут быть введены в обращение. Предположительно, засев новых (бесплатных) наборов данных компьютерного зрения с переоцененными изображениями того типа, который создали авторы, решит проблему предвзятости, но также может представить препятствия для других типов исследований, которые стремятся оценить гендерное и расовое включение в ‘реальных’ сценариях, в ситуации, когда синтетические изображения смешиваются с реальными изображениями.

Синтетические базы данных, такие как та, которую создали исследователи, могут быть, предположительно, доступны бесплатно в качестве достаточно высококачественных изображений, используя эту экономию средств как движущую силу диффузии.

Проект не решает проблему предвзятости, основанной на возрасте, которая, предположительно, является потенциальной темой интереса в будущих исследованиях.

 

* Поиск, проведенный 5 января 2022 года, поиск, упомянутый в статье, был проведен в январе 2021 года.

 

Опубликовано впервые 5 января 2022 года.

Автор в области машинного обучения, специалист по синтезу человеческих изображений. Бывший руководитель отдела исследовательского контента в Metaphysic.ai, до его объединения с Brahma.ai от DNEG.
Веб‑сайт: martinanderson.ai
Контакт: martin@martinanderson.ai