Взгляд Anderson

Использование сжатия JPEG для улучшения обучения нейронных сетей

mm
Добавьте Unite.AI в избранные источники в Google
An AI-generated image, using ChatGPTY-4o, with the prompt ' Please create a panoramic photorealistic image of a landscape sunset where the right half of the image gradually becomes full of ugly JPEG artifacts'

Новая исследовательская работа из Канады предложила框架, который намеренно вводит сжатие JPEG в схему обучения нейронной сети и получает лучшие результаты – и лучшую устойчивость к атакам.

Это довольно радикальная идея, поскольку текущее общее мнение заключается в том, что артефакты JPEG, оптимизированные для человеческого зрения, а не для машинного обучения, обычно имеют негативное влияние на нейронные сети, обученные на данных JPEG.

Пример разницы в четкости между изображениями JPEG, сжатыми с разными потерями (более высокая потеря позволяет получить меньший размер файла, но ухудшает дифференциацию и полосы цветовых градиентов, среди других типов артефактов). Источник: https://forums.jetphotos.com/forum/aviation-photography-videography-forums/digital-photo-processing-forum/1131923-how-to-fix-jpg-compression-artefacts?p=1131937#post1131937

Пример разницы в четкости между изображениями JPEG, сжатыми с разными потерями (более высокая потеря позволяет получить меньший размер файла, но ухудшает дифференциацию и полосы цветовых градиентов, среди других типов артефактов). Источник: https://forums.jetphotos.com/forum/aviation-photography-videography-forums/digital-photo-processing-forum/1131923-how-to-fix-jpg-compression-artefacts?p=1131937#post1131937

В отчете 2022 года Университета Мэриленда и Facebook AI утверждалось, что сжатие JPEG “причиняет значительную пенальти производительности” при обучении нейронных сетей, несмотря на предыдущую работу, которая утверждала, что нейронные сети относительно устойчивы к артефактам сжатия изображений.

Годом ранее в литературе появилась новая линия мысли: что сжатие JPEG может быть использовано для улучшения результатов обучения модели.

Однако, хотя авторы этой работы смогли получить улучшенные результаты при обучении изображений JPEG разного качества, предложенная ими модель была слишком сложной и обременительной, и не была практической. Кроме того, использование стандартных настроек оптимизации JPEG (квантование) оказалось препятствием для эффективности обучения.

Позже (в 2023 году) был проведен эксперимент с системой, которая получила немного лучшие результаты от сжатых изображений JPEG с использованием замороженной глубокой нейронной сети (DNN). Однако замораживание частей модели во время обучения снижает универсальность модели, а также ее устойчивость к новым данным.

JPEG-DL

Вместо этого новая работа, озаглавленная JPEG Inspired Deep Learning, предлагает гораздо более простую архитектуру, которую можно даже наложить на существующие модели.

Исследователи из Университета Ватерлоо заявляют:

‘Результаты показывают, что JPEG-DL значительно и последовательно превосходит стандартный DL на различных архитектурах DNN, с незначительным увеличением сложности модели.

В частности, JPEG-DL улучшает точность классификации до 20,9% на некоторых задачах классификации, добавляя только 128 обучаемых параметров в конвейер DL. Кроме того, превосходство JPEG-DL над стандартным DL еще больше демонстрируется повышенной устойчивостью к атакам и уменьшением размера входных изображений.’

Авторы утверждают, что оптимальный уровень качества сжатия JPEG может помочь нейронной сети различать центральные объекты изображения. В примере ниже мы видим базовые результаты (слева), когда признаки получаются нейронной сетью, а изображение JPEG-DL (справа) успешно различает и очерчивает объект фотографии.

Тесты против базовых методов для JPEG-DL. Источник: https://arxiv.org/pdf/2410.07081

Тесты против базовых методов для JPEG-DL. Источник: https://arxiv.org/pdf/2410.07081

‘Это явление,’ они объясняют, ‘называемое “помощь сжатия” в работе 2021 года, обосновано тем, что сжатие может удалить шум и мешающие фоновые особенности, тем самым подчеркивая основной объект в изображении, что помогает DNN сделать лучшие прогнозы.’

Метод

JPEG-DL вводит дифференцируемый мягкий квантовщик, который заменяет недифференцируемую операцию квантования в стандартной процедуре оптимизации JPEG.

Это позволяет выполнять градиентно-основанную оптимизацию изображений. Это невозможно в обычном кодировании JPEG, которое использует униформный квантовщик с операцией округления, приближающей ближайший коэффициент.

Дифференцируемость схемы JPEG-DL позволяет выполнять совместную оптимизацию как параметров модели, так и квантования JPEG (сжатия). Совместная оптимизация означает, что и модель, и обучающие данные адаптируются друг к другу в процессе конца в конец, и не требуется замораживание слоев.

По сути, система настраивает сжатие JPEG исходного набора данных, чтобы оно соответствовало логике процесса обобщения.

Схема для JPEG-DL.

Концептуальная схема для JPEG-DL.

Можно предположить, что сырые данные будут идеальным материалом для обучения; после все изображения полностью декомпрессируются в соответствующее полное цветовое пространство, когда они запускаются в пакетах; так какой же разница делает исходный формат?

Ну, поскольку сжатие JPEG оптимизировано для человеческого зрения, оно выбрасывает области детализации или цвета, соответствующие этой цели. Учитывая изображение озера под голубым небом, увеличение уровня сжатия будет применено к небу, поскольку оно не содержит “необходимых” деталей.

С другой стороны, нейронная сеть лишена эксцентричных фильтров, которые позволяют нам сосредоточиться на центральных объектах. Вместо этого она, скорее всего, будет рассматривать любые артефакты полос в небе как действительные данные, которые необходимо включить в ее латентное пространство.

Хотя человек будет игнорировать полосы в небе на сильно сжатом изображении (слева), нейронная сеть не имеет представления о том, что этот контент должен быть выброшен, и потребует изображения более высокого качества (справа). Источник: https://lensvid.com/post-processing/fix-jpeg-artifacts-in-photoshop/

Хотя человек будет игнорировать полосы в небе на сильно сжатом изображении (слева), нейронная сеть не имеет представления о том, что этот контент должен быть выброшен, и потребует изображения более высокого качества (справа). Источник: https://lensvid.com/post-processing/fix-jpeg-artifacts-in-photoshop/

Следовательно, один уровень сжатия JPEG вряд ли подойдет для всего содержимого набора данных для обучения, если только он не представляет очень конкретную область. Изображения толпы будут требовать гораздо меньше сжатия, чем узкофокусное изображение птицы, например.

Авторы отмечают, что те, кто не знаком с проблемами квантования, но знакомы с основами архитектуры трансформеров, могут рассматривать эти процессы как операцию внимания, в широком смысле.

Данные и тесты

JPEG-DL был оценен на архитектурах, основанных на трансформерах, и свёрточных нейронных сетях (CNN). Использовались архитектуры EfficientFormer-L1; ResNet; VGG; MobileNet; и ShuffleNet.

Версии ResNet, использованные для набора данных CIFAR, были следующими: ResNet32, ResNet56 и ResNet110. Для тестов на основе VGG были выбраны VGG8 и VGG13.

Для CNN методология обучения была получена из работы 2020 года Contrastive Representation Distillation (CRD). Для EfficientFormer-L1 (основанной на трансформерах) был использован метод обучения из работы 2023 года Initializing Models with Larger Ones.

Для задач классификации изображений, представленных в тестах, были использованы четыре набора данных: Stanford Dogs; Flowers Университета Оксфорда; CUB-200-2011 (CalTech Birds); и Pets (‘Кошки и собаки’, совместная работа Университета Оксфорда и Хайдарабада в Индии).

Для задач классификации изображений на CNN использовались PreAct ResNet-18 и DenseNet-BC. Для EfficientFormer-L1 был использован метод, описанный в работе Initializing Models With Larger Ones.

На протяжении всех задач классификации изображений и наборов данных CIFAR-100 и fine-grained использовался дискретное косинусное преобразование (DCT) с помощью оптимизатора Adam, чтобы адаптировать скорость обучения для слоя JPEG в тестированных моделях.

В тестах на наборе данных ImageNet-1K использовался PyTorch с SqueezeNet, ResNet-18 и ResNet-34 в качестве основных моделей.

Для оценки оптимизации слоя JPEG использовался стохастический градиентный спуск (SGD) вместо Adam, для более стабильной производительности. Однако для тестов на наборе данных ImageNet-1K был использован метод из работы 2019 года Learned Step Size Quantization.

Выше - точность валидации для базовой модели и JPEG-DL на наборе данных CIFAR-100, со стандартными и средними отклонениями, усредненными за три запуска. Ниже - точность валидации на различных задачах классификации изображений, на различных архитектурах моделей, также усредненных за три запуска.

Выше – точность валидации для базовой модели и JPEG-DL на наборе данных CIFAR-100, со стандартными и средними отклонениями, усредненными за три запуска. Ниже – точность валидации на различных задачах классификации изображений, на различных архитектурах моделей, также усредненных за три запуска.

Комментируя первоначальный раунд результатов, проиллюстрированных выше, авторы заявляют:

‘На всех семи протестированных моделях для набора данных CIFAR-100 JPEG-DL последовательно обеспечивает улучшения, с приростом до 1,53% в точности валидации. На задачах классификации изображений JPEG-DL предлагает существенное улучшение производительности, с улучшениями до 20,90% на всех наборах данных, используя две разные модели.’

Результаты тестов на наборе данных ImageNet-1K представлены ниже:

Точность валидации на наборе данных ImageNet на различных фреймворках.

Точность валидации на наборе данных ImageNet на различных фреймворках.

Здесь в работе отмечается:

‘С незначительным увеличением сложности (добавлением 128 параметров) JPEG-DL достигает прироста 0,31% в точности валидации для SqueezeNetV1.1 по сравнению с базовой моделью, используя один раунд операции квантования.

‘Увеличивая количество раундов квантования до пяти, мы наблюдаем дополнительное улучшение на 0,20%, что приводит к общему приросту 0,51% над базовой моделью.’

Исследователи также протестировали систему с использованием данных, скомпрометированных атаками Fast Gradient Signed Method (FGSM) и Projected Gradient Descent (PGD).

Атаки были проведены на наборе данных CIFAR-100 на двух моделях:

Результаты тестирования JPEG-DL против двух стандартных фреймворков атак.

Результаты тестирования JPEG-DL против двух стандартных фреймворков атак.

Авторы заявляют:

‘Модели JPEG-DL значительно улучшают устойчивость к атакам по сравнению со стандартными моделями DNN, с улучшениями до 15% для FGSM и 6% для PGD.’

Кроме того, как показано ранее в статье, авторы провели сравнение карт признаков с использованием GradCAM++ – фреймворка, который может выделить извлеченные признаки визуально.

Иллюстрация GradCAM++ для базовой и JPEG-DL классификации изображений, с выделенными извлеченными признаками.

Иллюстрация GradCAM++ для базовой и JPEG-DL классификации изображений, с выделенными извлеченными признаками.

В работе отмечается, что JPEG-DL дает улучшенный результат, и что в одном случае он смог даже классифицировать изображение, которое базовая модель не смогла определить. Относительно ранее проиллюстрированного изображения с птицами авторы заявляют:

‘Ясно, что карты признаков модели JPEG-DL показывают значительно лучший контраст между информацией переднего плана (птицей) и фоном по сравнению с картами признаков, сгенерированными базовой моделью.

‘В частности, объект переднего плана на картах признаков JPEG-DL заключен в четко определенный контур, что делает его визуально различимым от фона.

‘Напротив, карты признаков базовой модели показывают более смешанную структуру, где передний план содержит более высокую энергию в низких частотах, что делает его более гладким и слившимся с фоном.’

Вывод

JPEG-DL предназначен для использования в ситуациях, когда доступны сырые данные, но было бы интересно увидеть, могут ли некоторые принципы, представленные в этом проекте, быть применены к обычному обучению наборов данных, где содержимое может быть более низкого качества (как часто бывает с гипермасштабными наборами данных, собранными из интернета).

Как оно есть, это в основном остается проблемой аннотации, хотя оно было решено в распознавании изображений на основе трафика и в других местах.

 

Опубликовано в первый раз в четверг, 10 октября 2024 года.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai