Погляд Anderson

Стиснення JPEG збільшує помилку розпізнавання обличчя для осіб не-євроヘїдної зовнішності, дослідження показало

mm
Додайте Unite.AI до бажаних джерел у Google
Main image: DALL-E 2.

Нове дослідження з Великої Британії дійшло до висновку, що техніки стиснення з втратами в зображеннях JPEG можуть мати негативний вплив на ефективність систем розпізнавання обличчя, роблячи такі системи більш схильними до неправильної ідентифікації особи не-євроヘїдної зовнішності.

У статті зазначається:

‘Через розширений експериментальний набір, ми демонструємо, що загальні підходи до стиснення зображень мають більш виражений негативний вплив на результати розпізнавання обличчя для певних расових фенотипових категорій, таких як темніший тон шкіри (до 34,55%).’

Результати також вказують на те, що хрома-субдискретизація, яка зменшує кольорову інформацію (а не яскравість) по секціям зображення обличчя, збільшує рівень помилкової ідентифікації (FMR) по ряду тестових наборів даних, багато з яких є стандартними репозиторіями для комп’ютерного зору.

Оперції хрома-субдискретизації над вихідним зображенням, з різними швидкостями, мають виражений вплив на ступінь збереження деталей і ступінь, у якій субтони просто 'змішуються' одне з одним, жертвуючи деталями та визначаючи особливості. Будь ласка, зверніть увагу, що це зображення самому може бути предметом стиснення, і зверніться до джерельної статті для точного розрізнення. Джерело: https://arxiv.org/pdf/2208.07613.pdf

Оперції хрома-субдискретизації над вихідним зображенням, з різними швидкостями, мають виражений вплив на ступінь збереження деталей і ступінь, у якій субтони просто ‘змішуються’ одне з одним, жертвуючи деталями та визначаючи особливості. Будь ласка, зверніть увагу, що це зображення самому може бути предметом стиснення, і зверніться до джерельної статті для точного розрізнення. Джерело: https://arxiv.org/pdf/2208.07613.pdf

Хрома-субдискретизація застосовується як додаткова економічна міра при стисненні JPEG, оскільки люди менш здатні сприймати зменшення складності та діапазону кольорових смуг, ніж системи комп’ютерного зору, які сприймають ці ‘агрегації’ набагато буквальніше, ніж ми.

Дослідники нового дослідження виявили, що видалення хрома-субдискретизації з процесу стиснення зменшує цей негативний ефект на 15,95%, хоча не повністю усуває проблему.

Студія також стверджує, що навчання на незстиснутих (або менш стиснутих) даних не вирішить проблему, якщо зображення часу висновку стиснуті. Ефективно, це означає, що навчання моделі розпізнавання обличчя на менш стиснутих зображеннях не вирішить упередженість, якщо остаточна модель виробництва буде годуватися зображеннями, які мають зазначені проблеми стиснення.

Автори повідомляють*:

‘[Використання] втратного стиснення зображень під час висновку негативно впливає на результати сучасних підходів до розпізнавання обличчя на підмножині расових фенотипових груп (тобто темніший тон шкіри, монолідний тип ока) і що його вплив присутній незалежно від того, чи використовуються стиснуті зображення для навчання моделі.’

Стаття підкреслює наслідки стиснення зображень на дослідження комп’ютерного зору, які були описані у деяких деталях у студії 2021 року університету Меріленду та Facebook AI.

Це складна проблема для усунення; навіть якщо проблеми зберігання та пропускної здатності, які роблять стиснення необхідним, були усунені за одну ніч, і навіть якщо всі низькоякісні зображення, які населяють двадцять чи більше років наборів даних у цій галузі, були раптово перествиснені з високоякісних джерел при кращій швидкості, це представляло б ‘сброс’ безперервності академічних інструментів бенчмаркінгу за останні кілька десятиліть. Спільнота CV, по суті, призвикла до цієї проблеми, до тієї міри, що вона представляє помітний технічний борг.

Расова упередженість у розпізнаванні обличчя (FR) стала гарякою медіа-темою за останні роки, спонукаючи злагоджену зусилля у дослідницькій спільноті усунути її з постраждалих систем. Однак залежність глобального дослідницького органу від надміру обмеженого числа ‘золотих стандартних’ наборів даних, багато з яких або не расово збалансовані або погано позначені в цьому відношенні, посилює проблему.

Дослідники нової статті також відзначають розбіжність між стандартами отримання зображень та стандартами, встановленими загальним набором бенчмарків розпізнавання обличчя, заявляючи*:

‘[Існуючі] стандарти отримання зображень для систем розпізнавання обличчя, такі як ISO/IEC 19794-5 і ICAO 9303, пропонують як зображенні (тобто освітлення, окулювання), так і суб’єктні (тобто поза, вираз, аксесуари) стандарти якості, щоб забезпечити якість зображення обличчя. ‘

‘Відповідно, зображення обличчя також повинні зберігатися за допомогою стандартів втратного стиснення зображень, таких як JPEG або JPEG2000; і повинні бути ідентифіковані за статтю, кольором очей, кольором волосся, виразом, властивостями (тобто окулярами), кутами пози (yaw, pitch, and roll) і позиціями орієнтирів. ‘

‘Однак загальні бенчмарки розпізнавання обличчя не відповідають стандартам ISO/IEC 19794-5 і ICAO 9303. Крім того, зразки в дикій природі часто отримуються під різними камерними та екологічними умовами, щоб викликати запропоновані рішення. ‘

‘Незважаючи на це, більшість зображень обличчя в таких наборах даних стиснені за допомогою втратного стиснення JPEG.’

Автори нової роботи заявляють, що їхні майбутні зусилля будуть спрямовані на вивчення впливу втратної квантизації зображень на різні рамки розпізнавання обличчя, а також на пропонування можливих методів поліпшення справедливості цих систем.

Нова стаття називається Чи впливає втратне стиснення зображень на расову упередженість у розпізнаванні обличчя?, і походить від трьох дослідників Імперського коледжу Лондона, разом з одним з бібліотеки глибокого аналізу обличчя InsightFace library.

Дані та методи

Для своїх експериментів дослідники використовували бібліотеки ImageMagick і libjpeg, щоб створити версії вихідних даних зображень на різних рівнях стиснення.

Для початкового огляду впливу стиснення автори вивчили вплив співвідношення пікової сигнал-шум (PSNR) на чотири різні рівні стиснення JPEG на наборі даних Racial Faces in-the-Wild (RFW).

Бали PSNR для набору даних Racial Faces-in-the-Wild, демонструючи ступінь, у якій стиснення може впливати на можливості розпізнавання для стиснутих зображень.

Бали PSNR для набору даних Racial Faces-in-the-Wild, демонструючи ступінь, у якій стиснення може впливати на можливості розпізнавання для стиснутих зображень.

Серед інших тестів вони провели дослідження на расово не збалансованому наборі даних, а також на расово збалансованому. Для расово збалансованого набору вони використовували функцію Additive Angular Margin Loss (ArcFace) з ResNet101v2, на оригінальному наборі даних VGGFace2, який містить 3,3 мільйона зображень, що представляють 8631 расово не збалансованих суб’єктів.

Для тестування дослідники використовували набір даних RFW. Система була навчена чотири рази, на чотирьох різних рівнях стиснення, що призвело до чотирьох моделей ArcFace.

Для расово збалансованого набору ті ж самі рамки були спочатку використані на оригінальному вирівняному наборі даних BUPT-Balanced, який містить 28 000 облич, збалансованих по чотирьох групах Африканська, Азіатська, Індійська і Євроヘїдна, кожна з яких представлена 7000 зображень. Як і у випадку з расово не збалансованим набором даних, чотири моделі ArcFace були отримані таким чином.

Крім того, дослідники відтворили вплив стиснутих і нестиснутих даних під час навчання, видалення хрома-субдискретизації, щоб виміряти її вплив на результати.

Результати

Рівень помилкової ідентифікації (FMR) по цих згенерованих наборах даних був потім вивчений. Критерії, які дослідники шукали, були попередньо визначені фенотипи, пов’язані з расовими характеристиками Тип шкіри (1, 2, 3, 4, 5 або 6), Тип повік (монолідний/інший), Форма носа (широкий/вузький), Форма губ (пухкі/малі), Тип волосся (пряме/хвилеве/кудряве/лідерне) і Колір волосся – метрики, взяті з статті 2019 року Вимірювання прихованої упередженості у розпізнаванні обличчя через расові фенотипи.

У статті зазначається:

‘Ми спостерігаємо, що для всіх вибраних рівнів стиснення q = {5, 10, 15, 95}, рівень помилкової ідентифікації збільшується, коли застосовується додаткове втратне стиснення, демонструючи, що рівень стиснення 5 (найвищий рівень стиснення) призводить до найбільш значного зниження результатів FMR, тоді як рівень стиснення 95 (найнижчий рівень стиснення) не призводить до жодних помітних відмінностей у результатах FMR.’

Зразок з обширних таблиць результатів статті, які занадто великі та численні, щоб їх тут відтворити – зверніться до джерельної статті для кращого розрізнення та повних результатів. Тут ми бачимо діапазон результатів FMR для набору даних VGGFace2, у діапазоні, який включає незстиснуте або мало стиснуте якість.

Зразок з обширних таблиць результатів статті, які занадто великі та численні, щоб їх тут відтворити – зверніться до джерельної статті для кращого розрізнення та повних результатів. Тут ми бачимо діапазон результатів FMR для набору даних VGGFace2, у діапазоні, який включає незстиснуте або мало стиснуте якість.

У статті зазначається:

‘Загалом, наше оцінювання показує, що використання втратних стиснутих зображень обличчя під час висновку зменшує результати більш значно для певних фенотипів, включаючи темніший тон шкіри, широкий ніс, кудряве волосся та монолідний тип ока по всіх інших фенотипових особливостях. ‘

‘Однак використання стиснутих зображень під час навчання робить отримані моделі більш стійкими та обмежує погіршення результатів, зустрінутої нижчу продуктивністю серед певних расово-орієнтованих підгруп, залишається. Крім того, видалення хрома-субдискретизації покращує рівень помилкової ідентифікації для певних фенотипових категорій, які більше постраждали від втратного стиснення.’

 

* Моє перетворення внутрішніх цитат авторів у гіперпосилання.

Перше опубліковане 22 серпня 2022 року.

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai