Погляд Anderson

Зміна статі та расової належності в результатах пошуку зображень за допомогою машинного навчання

mm
Додайте Unite.AI до бажаних джерел у Google

Дослідницьке співробітництво між UC San Diego та Adobe (ADBE ) Research запропонувало інноваційне та проактивне рішення проблеми нестачі расової та статевої різноманітності в результатах пошуку зображень для традиційно WASP-домінантних професій: використання Генеративних суперницьких мереж (GAN) для створення нереальних зображень “упереджених” професій, де стать і/або расова належність суб’єкта змінюється.

У цьому прикладі з нової статті дослідники ввели характеристики бажаного зображення, яке або не представлено в типовому корпусі доступного матеріалу зображень, або представлено недопустимим чином (наприклад, сексуалізовано або іншим недопустимим чином). Джерело

У цьому прикладі з нової статті дослідники ввели характеристики бажаного зображення, яке або не представлено в типовому корпусі доступного матеріалу зображень, або представлено недопустимим чином (наприклад, сексуалізовано або іншим недопустимим чином). Джерело

У новій статті під назвою Генерування та контроль різноманітності в результатах пошуку зображень автори пропонують, що існує обмеження щодо того, наскільки перерейтинг може виправити дисбаланс упереджених класів зображень/функцій, таких як сантехнік, оператор машин, інженер-програміст та багатьох інших – і що збільшення расової та статевої різноманітності за допомогою синтетичних даних може бути способом вирішення цієї проблеми.

‘Погоня за утопічним світом вимагає надання користувачам можливості представляти будь-яку професію з різними расовими та статевими характеристиками. Обмежений вибір існуючого контенту для певних комбінацій професії, раси та статі представляє собою виклик для постачальників контенту. Поточні дослідження, пов’язані з упередженням у пошуку, здебільшого зосереджені на алгоритмах перерейтингу.

‘Однак, ці методи не можуть створити новий контент або змінити загальну розподілення захищених атрибутів у фотографіях. Для вирішення цих проблем ми пропонуємо нове завдання генерації високоякісних зображень з умовою кількох атрибутів з несбалансованих наборів даних. ‘

Для цього автори експериментували з різними системами синтезу зображень на основі GAN, врешті зупинившись на архітектурі, заснованій на StyleGan2.

З додаткових матеріалів статті, два приклади 'збалансування' зображень професій, у цих випадках, 'тесля' і 'оператор машин'. Джерело

З додаткових матеріалів статті, два приклади ‘збалансування’ зображень професій, у цих випадках, ‘тесля’ і ‘оператор машин’. Джерело

Недостатньо або неправильно представлені

Дослідники формулюють проблему у вигляді реального результату пошуку для сантехніка* у пошуку зображень Google, спостерігаючи, що результати пошуку зображень домінують молоді білі чоловіки.

З статті, вибрані результати для 'сантехніка' у пошуку зображень Google, січень 2021.

З статті, вибрані результати для ‘сантехніка’ у пошуку зображень Google, січень 2021.

Автори відзначають, що подібні ознаки упередження відбуваються для ряду професій, таких як ‘адміністративний помічник’, ‘чистильник’ і ‘оператор машин’, з відповідними упередженнями щодо віку, статі та раси.

‘Не дивно, що через таке соціальне упередження деякі комбінації раси та статі можуть мати мало або жодних зображень у репозиторії контенту. Наприклад, коли ми шукали ‘жінку-афроамериканку-оператора машин’ або ‘чоловіка-азійського адміністративного помічника’, ми не знайшли відповідних зображень у пошуку зображень Google.

‘Крім того, у рідкісних випадках певні комбінації статі та раси можуть призвести до того, що особи будуть зображені недопустимим чином. Ми спостерігали це поведінку для запитів пошуку, таких як ‘жіноча азіатська сантехніка’ або ‘жіноча чорна (або афроамериканська) охоронниця.’

Стаття цитує інше академічне співробітництво з 2014 року, де дослідники зібрали верхні 400 результатів пошуку зображень для 96 професій. Ця робота показала, що жінки становили лише 37% результатів, а антистереотипні зображення – лише 22%. Дослідження 2019 року з Єльського університету показало, що за п’ять років ці відсотки зросли лише до 45% і 30% відповідно.

Крім того, дослідження 2014 року класифікувало сексуалізацію осіб у певних професіях у результатах пошуку зображень як Сексуальна проблема теслі, з такими недопустимими класифікаціями, які потенційно можуть викривити результати для розпізнавання професій.

Глобальна картина

Основним викликом для авторів було створення системи синтезу зображень на основі GAN, здатної виводити зображення роздільності 1024×1024, оскільки, на поточному рівні розвитку GAN і систем синтезу зображень на основі кодувача/декодувача, 512×512 є досить розкошево. Все, що вище, мало б бути отримано шляхом збільшення кінцевого виводу, при певній витраті часу та ресурсів обробки, і при певному ризику для автентичності згенерованих зображень.

Однак автори стверджують, що нижчі роздільності не могли б сподіватися на успіх у пошуку зображень, і експериментували з різними рамками GAN, які могли б бути здатними виводити зображення високої роздільності на вимогу, на прийнятному рівні автентичності.

Коли було вирішено采用 StyleGan2, стало очевидним, що проекту буде потрібно більший контроль над підфункціями згенерованого виводу (такими як раса, професія та стать), ніж це дозволяє стандартна установка. Тому автори використали багатокласову умовність для посилення процесу генерації.

Архітектура специфірованого генератора зображень, яку автори стверджують, не є специфічною для StyleGAN2, але може бути застосована до ряду рамок генерації.

Архітектура специфірованого генератора зображень, яку автори стверджують, не є специфічною для StyleGAN2, але може бути застосована до ряду рамок генерації.

Для контролю факторів раси, статі та професії архітектура вводить однократне кодування цих з’єднаних характеристик у вектор y. Після цього використовується мережа прямого поширення для впровадження цих функцій, щоб вони не були проігноровані під час генерації.

Автори відзначають, що існують жорсткі обмеження щодо того, наскільки StyleGAN2 може бути маніпульований таким чином, і що більш тонкі спроби змінити результати призвели до гіршої якості зображень, і навіть колапс режиму.

Ці засоби, однак, не розв’язують проблеми імпліцитного упередження в архітектурі, які дослідники мали вирішити шляхом пере вибірки недопредставлених сутностей з набору даних, але без ризику переобучення, яке вплинуло б на гнучкість згенерованих потоків зображень.

Отже, автори адаптували StyleGAN2-ADA, який використовує адаптивне доповнення дискримінатора (ADA), щоб запобігти переобученню дискримінатора.

Генерація та оцінка даних

Оскільки метою проекту є генерація нових, синтетичних даних, дослідники прийняли методологію проекту 2014 року, вибравши ряд цільових професій, які демонструють високу расову та статеву упередженість. Професії були вибрані на основі ступеня сприйнятої упередженості в результатах пошуку зображень, а також тому, що більшість з них містять певний візуальний компонент, закодований для професії, такий як уніформа, або присутність конкретного обладнання чи середовищ.

Автори обрали ці професії не лише на основі ступеня сприйнятої упередженості в результатах пошуку зображень, але також тому, що більшість з них містять певний візуальний компонент, закодований для професії, такий як уніформа, або присутність конкретного обладнання чи середовищ.

Набір даних був створений на основі 10 000 зображень з бібліотеки Adobe Stock, зазвичай отримуючи оцінку 95% або вище при спробі класифікувати професію.

Оскільки багато зображень не були корисними для цільової задачі (тобто вони не містили людей), була необхідна ручна фільтрація. Після цього використовувалася класифікаторна мережа ResNet32, попередньо навчена на FairFace, для маркування зображень за статтю та расою, отримуючи середню точність 95,7% для статі та 81,5% для раси. Таким чином дослідники отримали маркування зображень для атрибутів Стать: Чоловік, Жінка, Раса: Білий, Чорний, Азійський та інші раси.

Моделі були побудовані в TensorFlow за допомогою StyleGAN2 та StyleGAN2-ADA як основних мереж. Переднавчання проводилось з попередньо навченими вагами StyleGAN2 на наборі даних FFHQ, доповнених 34 000 зображень, специфічних для професій, які автори зібрали в окремий набір даних, який вони назвали Uncurated Stock-Occupation HQ (U-SOHQ).

Приклад HIT з оцінки людини на Amazon Mechanical Turk.

Приклад HIT з оцінки людини на Amazon Mechanical Turk.

Зображення були згенеровані під чотирма конфігураціями архітектури, з Uniform+, який нарешті отримав найкращі оцінки як в FID (автоматична оцінка), так і в подальшій оцінці працівниками Amazon Mechanical Turk. У поєднанні з точністю класифікації автори використали це як основну метрику для своєї власної метрики, названої Оцінка збігання атрибутів.

Оцінка людини згенерованих зображень різними методами, з методом Uniform+, який виявився найбільш переконливим, і згодом став основою для нового набору даних.

Оцінка людини згенерованих зображень різними методами, з методом Uniform+, який виявився найбільш переконливим, і згодом став основою для нового набору даних.

Стаття не зазначає, чи буде набір даних Stock-Occupation-HQ, повний набір даних, отриманий з Uniform+, відкритий для загального доступу, але зазначає, що він містить 8 113 зображень високої роздільності (1024×1024).

Дифузія

Нова стаття явно не займається тим, як синтезовані, “перебалансировані” зображення можуть бути введені в циркуляцію. Принаймні, введення нових (безкоштовних) наборів даних комп’ютерного зору з виправленими зображеннями такого типу, як створені авторами, могло б вирішити проблему упередженості, але також могло б створити перешкоди для інших типів досліджень, які намагаються оцінити статеву та расову інклюзивність у “реальних” сценаріях, у випадку, коли синтетичні зображення змішані з реальними зображеннями.

Синтетичні бази даних, такі як та, яку створили дослідники, могли б бути зроблені доступними безкоштовно у вигляді зображень високої роздільності, використовуючи цю економію коштів як двигун дифузії.

Проект не займається віковим упередженням, яке, ймовірно, є потенційною темою інтересу в майбутніх дослідженнях.

 

* Пошук, проведений 5 січня 2022 року, пошук, цитований у статті, був проведений у січні 2021 року.

 

Перша публікація 5 січня 2022 року.

Автор у галузі машинного навчання, фахівець у сфері синтезу зображень людей. Колишній керівник дослідницького контенту в Metaphysic.ai, до його злиття з Brahma.ai, що належить DNEG.
Веб‑сайт: martinanderson.ai
Контакт: martin@martinanderson.ai