Взгляд Anderson
Сжатие JPEG увеличивает ошибку распознавания лиц для некавказoidных лиц, показало исследование

Новое исследование из Великобритании пришло к выводу, что методы сжатия с потерями в изображениях JPEG могут негативно влиять на эффективность систем распознавания лиц, что делает такие системы более склонными к неправильной идентификации лица некавказoidного человека.
В статье говорится:
‘Через обширную экспериментальную установку мы демонстрируем, что общие подходы к сжатию изображений с потерями имеют более выраженное негативное влияние на производительность распознавания лиц для определенных расовых фенотипических категорий, таких как более темные тона кожи (до 34,55%).’
Результаты также показывают, что хрома-сабсэмплинг, который уменьшает информацию о цвете (а не о яркости) по секциям изображения лица, увеличивает коэффициент ложного совпадения (FMR) по диапазону тестированных наборов данных, многие из которых являются стандартными репозиториями для компьютерного зрения.

Операции хрома-сабсэмплинга над исходным изображением, с различными скоростями, имеют явное влияние на степень, в которой сохраняются детали, и степень, в которой подтоны просто ‘сливаются’ друг с другом, жертвуя деталями и определяя особенности. Пожалуйста, обратите внимание, что это изображение само по себе может быть подвержено сжатию, и обратитесь к исходной статье для точного разрешения. Источник: https://arxiv.org/pdf/2208.07613.pdf
Хрома-сабсэмплинг применяется в качестве дополнительной экономической меры в сжатии JPEG, потому что люди менее способны воспринимать уменьшение сложности и диапазона цветовых полос, чем системы компьютерного зрения, которые воспринимают эти ‘агрегации’ гораздо более буквально, чем мы.
Исследователи нового исследования обнаружили, что удаление хрома-сабсэмплинга из процесса сжатия уменьшает это негативное влияние до 15,95%, хотя и не полностью устраняет проблему.
Исследование также утверждает, что обучение на несжатых (или менее сжатых) данных не решит проблему, если изображения, используемые во время вывода, сжаты. По сути, это означает, что обучение модели распознавания лиц на менее сжатых изображениях не решит предвзятость, если окончательная модель производства будет получать изображения, имеющие указанные проблемы сжатия.
Авторы сообщают*:
‘Использование сжатия с потерями во время вывода отрицательно влияет на производительность современных подходов к распознаванию лиц на подмножестве расовых фенотипических групп (т.е. более темные тона кожи, монолидная форма глаз) и что его влияние присутствует независимо от того, используются ли сжатые изображения для обучения модели.’
Статья подчеркивает последствия сжатия изображений для сектора исследований компьютерного зрения, которые были подробно описаны в исследовании 2021 года Университета Мэриленда и Facebook AI.
Это сложная проблема для исправления; даже если бы проблемы хранения и пропускной способности, которые делают сжатие необходимым, были устранены за одну ночь, и если бы все низкокачественные изображения, которые населяют двадцать или более лет наборов данных в секторе, были вдруг пересжаты с лучшей скоростью из высококачественных источников, это представило бы ‘сброс’ непрерывности академических инструментов бенчмаркинга за последние несколько десятилетий. Сообщество CV, по сути, пришло к соглашению с этой проблемой, до такой степени, что это представляет собой значительный технический долг.
Расовая предвзятость в распознавании лиц (FR) стала актуальной темой в СМИ в последние годы, что привело к согласованным усилиям в исследовательском сообществе по устранению ее из затронутых систем. Однако зависимость мирового исследовательского сообщества от избыточно ограниченного числа ‘золотых стандартных’ наборов данных, многие из которых либо не расово сбалансированы, либо плохо помечены в этом отношении, усугубляет проблему.
Исследователи нового исследования также отмечают диссонанс между стандартами сбора изображений и стандартами, установленными общим набором бенчмарков распознавания лиц, заявив*:
‘Существующие стандарты сбора изображений для систем распознавания лиц, такие как ISO/IEC 19794-5 и ICAO 9303, предлагают как изображение-ориентированные (т.е. освещение, заслонение), так и субъект-ориентированные (т.е. поза, выражение, аксессуары) стандарты качества, чтобы гарантировать качество изображения лица. ‘
‘Соответственно, изображения лиц также должны храниться с использованием стандартов сжатия с потерями, таких как JPEG или JPEG2000; и быть идентифицируемыми по полу, цвету глаз, цвету волос, выражению, свойствам (т.е. очкам), углам поворота (yaw, pitch и roll) и положению ориентиров.’
‘Однако общие бенчмарки распознавания лиц не соответствуют стандартам ISO/IEC 19794-5 и ICAO 9303. Кроме того, в дикой природе образцы часто получаются в различных условиях камеры и окружающей среды, чтобы бросить вызов предложенным решениям. ‘
‘Тем не менее, большинство образцов изображений лиц в таких наборах данных сжимаются с помощью сжатия JPEG с потерями.’
Авторы нового исследования заявляют, что их будущие усилия будут направлены на изучение влияния сжатия с потерями на различные фреймворки распознавания лиц и предложат возможные методы для улучшения справедливости этих систем.
Новая статья озаглавлена Влияет ли сжатие с потерями на расовую предвзятость в распознавании лиц?, и исходит от трех исследователей Имперского колледжа Лондона, вместе с одним из InsightFace библиотеки глубокого анализа лиц библиотеки.
Данные и метод
Для своих экспериментов исследователи использовали библиотеки ImageMagick и libjpeg для создания версий исходных изображений с различными уровнями сжатия.
Для первоначального обзора эффектов сжатия авторы изучили влияние пиковой сигнал-шумовой отношения (PSNR) на четыре различных уровня сжатия JPEG на наборе данных Racial Faces in-the-Wild (RFW).

Оценки PSNR для набора данных Racial Faces-in-the-Wild, демонстрирующие степень, в которой сжатие может повлиять на возможности распознавания для сжатых изображений.
Среди других тестов они провели исследования на расово несбалансированном наборе данных и на расово сбалансированном наборе данных. Для расово сбалансированного набора они использовали функцию Additive Angular Margin Loss (ArcFace) с ResNet101v2 на исходном VGGFace2 наборе данных, который содержит 3,3 миллиона изображений с 8631 расово несбалансированными объектами.
Для тестирования исследователи использовали набор данных RFW. Система была обучена четыре раза, на четырех различных уровнях сжатия, в результате чего получились четыре модели ArcFace.
Для расово сбалансированного набора данных были использованы те же фреймворки, которые изначально были использованы на исходном выровненном BUPT-Balanced наборе данных, который содержит 28 000 лиц, сбалансированных по четырем группам Африканская, Азиатская, Индийская и Кавказская, каждая раса представлена 7000 изображениями. Как и в случае с расово несбалансированным набором данных, были получены четыре модели ArcFace.
Кроме того, исследователи воспроизвели эффекты сжатых и несжатых данных путем удаления хрома-сабсэмплинга, чтобы измерить его влияние на производительность.
Результаты
Коэффициент ложного совпадения (FMR) по этим сгенерированным наборам данных был затем изучен. Критерии, которые исследователи искали, были предопределенными фенотипами, связанными с расовыми характеристиками Тип кожи (1, 2, 3, 4, 5 или 6), Тип век (монолидный/другой), Форма носа (широкий/узкий), Форма губ (полные/маленькие), Тип волос (прямые/волнистые/кудрявые/лысые), и Цвет волос – метрики, взятые из статьи 2019 года Измерение скрытой предвзятости в распознавании лиц через расовые фенотипы.
В статье говорится:
‘Мы наблюдаем, что для всех выбранных уровней сжатия q = {5, 10, 15, 95} FMR увеличивается, когда применяется дополнительное сжатие с потерями, демонстрируя, что уровень сжатия 5 (самый высокий уровень сжатия) приводит к наиболее значительному снижению производительности FMR, в то время как уровень сжатия 95 (самый низкий уровень сжатия) не приводит к заметным различиям в производительности FMR.’

Пример из обширных результатов статьи, которые слишком велики и многочисленны, чтобы воспроизвести здесь – пожалуйста, обратитесь к исходной статье для лучшего разрешения и полных результатов. Здесь мы видим диапазон производительности FMR по все более деградированным/сжатым изображениям лиц для VGGFace2, в диапазоне, который включает несжатое или мало сжатое качество.
Статья заключает:
‘В целом, наша оценка показывает, что использование сжатых с потерями образцов изображений лиц во время вывода снижает производительность более значительно для определенных фенотипов, включая темный тон кожи, широкий нос, кудрявые волосы и монолидные глаза по всем другим фенотипическим особенностям. ‘
‘Однако использование сжатых изображений во время обучения делает полученные модели более устойчивыми и ограничивает снижение производительности, которое встречается: более низкая производительность среди определенных расово-ориентированных подгрупп остается. Кроме того, удаление хрома-сабсэмплинга улучшает FMR для определенных фенотипических категорий, которые более подвержены сжатию с потерями.’
* Мое преобразование внутренних цитат авторов в гиперссылки.
Опубликовано впервые 22 августа 2022 года.












