Моделі та платформи ШІ
Інформатиків розбирають упередженість у штучному інтелекті
Інформатиків з Принстонського та Стенфордського університетів зараз розбирають проблеми упередженості у штучному інтелекті (AI). Вони працюють над методами, які призведуть до більш справедливих наборів даних, що містять зображення людей. Дослідники тісно співпрацюють з ImageNet, який є базою даних понад 13 мільйонів зображень. Протягом останнього десятиліття ImageNet допоміг просунути комп’ютерне бачення. З допомогою своїх методів дослідники потім рекомендували покращення для бази даних.
ImageNet включає зображення об’єктів, ландшафтів та людей. Дослідники, які створюють алгоритми машинного навчання для класифікації зображень, використовують ImageNet як джерело даних. Через величезний розмір бази даних було необхідно використовувати автоматизовану збірку зображень та краудсорсинг анотації зображень. Тепер команда ImageNet працює над виправленням упередженостей та інших проблем. Зображення часто містять людей, які є непередбачуваними наслідками конструкції ImageNet.
Ольга Русаківська є співавтором та асистентом професора комп’ютерних наук у Принстоні.
“Комп’ютерне бачення зараз працює дуже добре, що означає, що воно використовується всюди в різних контекстах”, – сказав він. “Це означає, що зараз час говорити про те, який вплив воно має на світ і думати про ці питання справедливості”.
У новій роботі команда ImageNet систематично визначила невізуальні концепції та категорії, що містять образливі категорії. Ці категорії включали расові та сексуальні характеристики, і команда запропонувала видалити їх з бази даних. Команда також розробила інструмент, який дозволяє користувачам вказувати та отримувати набори зображень людей, і це можна зробити за віком, гендерною ідентичністю та кольором шкіри. Метою є створення алгоритмів, які більш справедливо класифікують обличчя та діяльність людей на зображеннях.
Робота дослідників була представлена 30 січня на конференції Association for Computing Machinery з питань справедливості, підзвітності та прозорості в Барселоні, Іспанія.
“Є велика потреба в тому, щоб дослідники та лабораторії з основними технічними знаннями в цій сфері брали участь у таких розмовах”, – сказала Русаківська. “Враховуючи реальність, що нам потрібно зібрати дані у великому масштабі, враховуючи реальність, що це буде зроблено за допомогою краудсорсингу, оскільки це найефективніший та найбільш усталений канал, як ми можемо зробити це справедливим способом – без упередженості? Основний повідомлення цієї роботи полягає у конструктивних рішеннях”.
ImageNet був запущений у 2009 році групою інформатиків з Принстона та Стенфорда. Це було призначено для використання як ресурс для академічних дослідників та викладачів. Створення системи було очолено випускником та членом факультету Принстона Фей-Фей Лі.
ImageNet став такою великою базою даних позначених зображень завдяки використанню краудсорсингу. Одним з основних платформ, які використовувалися, був Amazon (AMZN ) Mechanical Turk (MTurk), і працівники отримували оплату за верифікацію кандидатських зображень. Це спричинило деякі проблеми, і були багато упередженостей та неправильних категоризацій.
Ведучий автор Кайю Янг є аспірантом комп’ютерних наук.
“Коли ви просите людей верифікувати зображення, вибравши правильні з великого набору кандидатів, люди відчувають тиск, щоб вибрати деякі зображення, і ці зображення часто є тими, які мають відмінні або стереотипні риси”, – сказав він.
Перша частина дослідження полягала у фільтрації потенційно образливих або чутливих категорій осіб з ImageNet. Образливі категорії визначалися як ті, які містять нецензурну лексику або расові чи гендерні образи. Однією з таких чутливих категорій була класифікація людей за їхньою сексуальною орієнтацією чи релігією. Дванадцять аспірантів з різних背景ів були залучені до анотації категорій, і їм було наказано позначити категорію чутливою, якщо вони були не впевнені в ній. Близько 54% категорій були видалені, або 1593 з 2932 категорій осіб у ImageNet.
Працівники MTurk потім оцінювали “зображуваність” залишених категорій за шкалою від 1 до 5. 158 категорій були класифіковані як безпечні та зображувані, з оцінкою 4 або вище. Цей фільтрований набір категорій включав понад 133 000 зображень, які можуть бути дуже корисними для навчання алгоритмів комп’ютерного бачення.
Дослідники вивчили демографічну репрезентацію людей на зображеннях, і рівень упередженості в ImageNet був оцінений. Зміст з пошукових систем часто надають результати, які надмірно представляють чоловіків, людей з світлою шкірою та дорослих у віці від 18 до 40 років.
“Люди виявили, що розподіли демографічних показників у результатах пошуку зображень дуже упереджені, і це причина, чому розподіл у ImageNet також упереджений”, – сказав Янг. “У цій роботі ми спробували зрозуміти, наскільки упередженим це є, і також запропонували метод для балансування розподілу”.
Дослідники розглянули три атрибути, які також охороняються законом США про недискримінацію: колір шкіри, гендерна ідентичність та вік. Працівники MTurk потім анотували кожен атрибут кожної особи на зображенні.
Результати показали, що вміст ImageNet має значну упередженість. Найменш представлені були люди з темною шкірою, жінки та дорослі старші 40 років.
Був розроблений веб-інтерфейсний інструмент, який дозволяє користувачам отримувати набір зображень, демографічно збалансованих так, як вибрав користувач.
“Ми не хочемо казати, який є правильний спосіб балансувати демографію, оскільки це не дуже проста проблема”, – сказав Янг. “Розподіл міг би бути різним у різних частинах світу – розподіл кольорів шкіри в США відрізняється від країн Азії, наприклад. Тому ми залишаємо це питання нашому користувачеві, і просто надаємо інструмент для отримання збалансованого підмножини зображень”.
Команда ImageNet зараз працює над технічними оновленнями своєї апаратури та бази даних. Вони також намагаються реалізувати фільтрацію категорій осіб та інструмент ребалансування, розроблений у цій роботі. ImageNet буде перезапущений з оновленнями, разом із закликом до зворотної зв’язку від спільноти дослідників комп’ютерного бачення.
Робота також була написана аспірантом Принстона Клінтом Квінамі та асистентом професора комп’ютерних наук Джією Денгом. Дослідження було підтримано Національним науковим фондом.












