Взгляд Anderson
Решение проблемы артефактов JPEG в наборах данных компьютерного зрения

Новое исследование Университета Мэриленда и Facebook AI показало, что глубокие системы обучения, использующие сильно сжатые изображения JPEG в своих наборах данных, несут значительную пенальти по производительности, и предлагает новые методы для смягчения этих эффектов.
Отчет, озаглавленный Анализ и смягчение дефектов сжатия JPEG в глубоком обучении, утверждает, что он «значительно более полный», чем предыдущие исследования по влиянию артефактов на обучение компьютерного зрения. В статье утверждается, что «тяжелое или умеренное сжатие JPEG несет значительную пенальти по производительности на стандартных метриках», и что нейронные сети, возможно, не так устойчивы к таким нарушениям, как предыдущие работы предлагают.

Фотография собаки из набора данных MobileNetV2 2018 года. При качестве 10 (слева) система классификации не смогла определить правильную породу ‘Пемброк-Вельш-корги’, вместо этого угадав ‘Норвич-терьера’ (система уже знала, что это фотография собаки, но не породу); вторая слева, версия изображения с исправленными артефактами JPEG снова не смогла определить правильную породу; вторая справа, целевая коррекция артефактов восстановила правильную классификацию; и справа, оригинальная фотография, правильно классифицированная. Источник: https://arxiv.org/pdf/2011.08932.pdf
Артефакты сжатия как «данные»
Крайнее сжатие JPEG, скорее всего, создаст видимые или полувидимые границы вокруг 8×8 блоков, из которых JPEG собирается в пиксельную сетку. Как только эти блокирующие или «звонкие» артефакты появляются, они, скорее всего, будут неправильно интерпретированы системами машинного обучения как реальные элементы объекта изображения, если не будет сделано никакой компенсации за это.

Выше, система компьютерного зрения извлекает «чистый» градиентный образ из хорошего качества изображения. Ниже, «блокирующие» артефакты в изображении более низкого качества затрудняют выделение особенностей объекта и могут в конечном итоге «инфицировать» особенности, полученные из набора изображений, особенно в случаях, когда высококачественные и низкокачественные изображения встречаются в наборе данных, такие как в веб-скрапированных коллекциях, для которых была применена только общая очистка данных. Источник: http://www.cs.utep.edu/ofuentes/papers/quijasfuentes2014.pdf
Как видно на первом изображении выше, такие артефакты могут повлиять на задачи классификации изображений, с последствиями также для алгоритмов распознавания текста, которые могут не смогут правильно определить артефактно-поврежденные символы.
В случае систем обучения на синтезе изображений (таких как программное обеспечение для создания глубоких фейков или систем генерации изображений на основе GAN), «бунтовской» блок низкокачественных, сильно сжатых изображений в наборе данных может либо понизить медианное качество воспроизведения, либо быть поглощенным и по сути замененным большим количеством высококачественных особенностей, извлеченных из лучших изображений в наборе. В любом случае лучше иметь лучшие данные – или, по крайней мере, последовательные данные.
JPEG — Обычно «достаточно хорош»
Сжатие JPEG — это необратимо потерянный кодек, который можно применить к различным форматам изображений, хотя он в основном применяется к обертке файла изображения JFIF обертке. Несмотря на это, формат JPEG (.jpg) был назван в честь его связанного метода сжатия, а не обертки JFIF для данных изображения.
Целые архитектуры машинного обучения возникли в последние годы, которые включают смягчение артефактов JPEG в качестве части рутин AI-обучения и восстановления, и удаление артефактов сжатия на основе AI теперь включено в несколько коммерческих продуктов, таких как свита Topaz для изображений/видео и нейронные функции недавних версий Adobe Photoshop.
Поскольку схема JPEG 1986 года, в настоящее время широко используемая, была фактически зафиксирована в начале 1990-х годов, невозможно добавить метаданные к изображению, которые бы указывали, какой уровень качества (1-100) был сохранен для изображения JPEG — по крайней мере, не модифицируя более тридцати лет потребительского, профессионального и академического программного обеспечения, которое не ожидало наличия таких метаданных.
Следовательно, не редко адаптировать рутинные обучения машинного обучения к оцененному или известному качеству данных изображения JPEG, как это сделали исследователи для новой статьи (см. ниже). В отсутствие записи метаданных «качества» в настоящее время необходимо либо знать детали о том, как было сжато изображение (т. е. сжато из безпотерного источника), либо оценить качество с помощью перцептивных алгоритмов или ручной классификации.
Экономический компромисс
JPEG — не единственный метод сжатия с потерями, который может повлиять на качество наборов данных машинного обучения; настройки сжатия в файлах PDF также могут отбрасывать информацию таким образом и могут быть установлены на очень низкие уровни качества, чтобы сэкономить место на диске для локального или сетевого архивирования.
Это можно увидеть, отбирая различные файлы PDF на archive.org, некоторые из которых были сжаты так сильно, что они представляют значительную проблему для систем распознавания изображений или текста. Во многих случаях, таких как защищенные авторским правом книги, такое интенсивное сжатие, по-видимому, было применено в качестве формы дешевого DRM, аналогично тому, как держатели авторских прав могут выбрать снижение разрешения видеороликов, загруженных пользователями на YouTube, на которых они владеют IP, оставляя «блокированные» видео в качестве рекламных токенов, чтобы вдохновить на «полноэкранные» покупки, а не удалять их.
Во многих других случаях разрешение или качество изображения низкое просто потому, что данные очень старые и относятся к эпохе, когда локальное и сетевое хранилище было более дорогим, а ограниченные сетевые скорости отдавали предпочтение высоко оптимизированным и портативным изображениям над высококачественным воспроизведением.
Было утверждено, что JPEG, хотя и не является лучшим решением сейчас, был «закреплен» как неразрывная наследственная инфраструктура, которая по сути переплетается с основами интернета.
Наследственный груз
Хотя более поздние инновации, такие как JPEG 2000, PNG и (самый недавний) формат.webp, предлагают лучшее качество, пересampling старых, очень популярных наборов данных машинного обучения, скорее всего, «сбросит» непрерывность и историю годовых вызовов компьютерного зрения в академическом сообществе — препятствие, которое также будет применяться в случае сохранения изображений набора данных PNG при более высоких настройках качества. Это можно рассматривать как своего рода технический долг.
Хотя почтенные серверные библиотеки обработки изображений, такие как ImageMagick, поддерживают лучшие форматы, включая.webp, требования к преобразованию изображений часто возникают в наследственных системах, которые не настроены на что-либо, кроме JPG или PNG (которое предлагает сжатие без потерь, но за счет задержки и места на диске). Даже WordPress, CMS, который управляет почти 40% всех веб-сайтов, добавил поддержку.webp только три месяца назад.
PNG был поздним (можно сказать, слишком поздним) входом в сектор форматов изображений, возникшим в качестве открытого решения в конце 1990-х годов в ответ на заявление 1995 года Unisys и CompuServe о том, что роялти будут выплачиваться за формат сжатия LZW, используемый в файлах GIF, которые часто использовались в то время для логотипов и плоских цветных элементов, даже если возрождение GIF в начале 2010-х годов было сосредоточено на его способности обеспечивать низкоскоростной, быстрый анимированный контент (иронично, анимированные PNG никогда не получили популярности или широкой поддержки и были даже запрещены в Twitter в 2019 году).
Несмотря на свои недостатки, сжатие JPEG быстрое, экономично по пространству и глубоко встроено в системы всех типов — и, следовательно, вряд ли полностью исчезнет из сцены машинного обучения в ближайшем будущем.
Сделать лучшее из AI/JPEG перемирия
В некоторой степени сообщество машинного обучения приспособилось к причудам сжатия JPEG: в 2011 году Европейское общество радиологии (ESR) опубликовало исследование об «используемости необратимого сжатия изображений в радиологическом изображении», предоставляющее рекомендации по «допустимым» потерям; когда почтенный набор данных MNIST для распознавания текста (чей двоичный формат изображения был первоначально предоставлен в новом формате) был перенесен в «обычный» формат изображения, JPEG, а не PNG, был выбран; и более раннее (2020) сотрудничество от авторов новой статьи предложило «новую архитектуру» для калибровки систем машинного обучения к недостаткам переменного качества изображения JPEG, без необходимости обучать модели на каждом уровне качества JPEG — функция, используемая в новой работе.
Действительно, исследования по полезности данных JPEG с переменным качеством — это относительно процветающая область в машинном обучении. Одно (несвязанное) проект 2016 года из Центра автоматических исследований Университета Мэриленда фактически центрируется на области DCT (где артефакты JPEG возникают при низких настройках качества), как путь к глубокому извлечению особенностей; другой проект 2019 года сосредоточен на байтовом чтении данных JPEG без необходимости разархивировать изображения (т. е. открывать их в какой-то момент автоматизированного рабочего процесса); и исследование из Франции в 2019 году активно использует сжатие JPEG в службе распознавания объектов.
Тестирование и выводы
Возвращаясь к последнему исследованию Университета Мэриленда и Facebook, исследователи попытались протестировать понимание и полезность JPEG на изображениях, сжатых между 10-90 (ниже которого изображение невозможно искажено, и выше которого оно равно безпотерному сжатию). Изображения, использованные в тестах, были предварительно сжаты на каждом значении в целевом диапазоне качества, что предполагало не менее восьми сессий обучения.
Модели были обучены на стохастическом градиентном спуске по четырем методам: базовый, где не были добавлены дополнительные смягчения; настраиваемое тонкое настрой, где набор обучения имеет преимущество предварительно обученных весов и помеченных данных (хотя исследователи признают, что это трудно воспроизвести в приложениях потребительского уровня); исправление артефактов, где коррекция/улучшение выполняется на сжатых изображениях до обучения; и целевая коррекция артефактов, где сеть коррекции артефактов настраивается на возвращенных ошибках.
Обучение происходило на широком диапазоне подходящих наборов данных, включая несколько вариантов ResNet, FastRCNN, MobileNetV2, MaskRCNN и Keras’ InceptionV3.
Пример результатов потерь после целевой коррекции артефактов визуализирован ниже (ниже = лучше).

Не возможно глубоко погрузиться в детали результатов, полученных в исследовании, потому что выводы исследователей разделены между целью оценки артефактов JPEG и новыми методами для смягчения этого; обучение было повторено качество за качеством по так много наборов данных; и задачи включали несколько целей, такие как обнаружение объектов, сегментация и классификация. По сути, новая статья позиционирует себя как всесторонний справочный труд, решающий несколько проблем.
Тем не менее, статья в целом заключает, что «сжатие JPEG несет значительную пенальти по всей линии для сильного и умеренного сжатия». Она также утверждает, что ее новые не помеченные стратегии смягчения достигают лучших результатов среди других подобных подходов; что, для сложных задач, метод исследователей также превосходит своих сверстников, несмотря на отсутствие доступа к меткам основной истины; и что эти новые методологии позволяют повторно использовать модели, поскольку полученные веса передаются между задачами.
В плане задач классификации статья явно заявляет, что «JPEG ухудшает качество градиента, а также вызывает ошибки локализации».
Авторы надеются расширить будущие исследования, чтобы покрыть другие методы сжатия, такие как в значительной степени забытый JPEG 2000, а также WebP, HEIF и BPG. Они также предлагают, что их методология может быть применена к аналогичным исследованиям алгоритмов сжатия видео.
Поскольку метод целевой коррекции артефактов оказался настолько успешным в исследовании, авторы также сигнализируют о своем намерении выпустить веса, обученные во время проекта, ожидая, что «[многие] приложения будут выигрывать от использования наших TTAC весов без изменений».
n.b. Источник изображения для статьи взят с thispersondoesnotexist.com












