Погляд Anderson

Використання стиснення JPEG для покращення навчання нейронних мереж

mm
Додайте Unite.AI до бажаних джерел у Google
An AI-generated image, using ChatGPTY-4o, with the prompt ' Please create a panoramic photorealistic image of a landscape sunset where the right half of the image gradually becomes full of ugly JPEG artifacts'

Нова дослідницька робота з Канади запропонувала.framework, який навмисно вводить стиснення JPEG у схему навчання нейронної мережі та отримує кращі результати – і кращу стійкість до атак зловмисників.

Це досить радикальна ідея, оскільки поточна загальна мудрість полягає в тому, що артефакти JPEG, оптимізовані для перегляду людиною, а не для машинного навчання, загалом мають негативний вплив на нейронні мережі, навчені на даних JPEG.

Приклад різниці в чіткості між зображеннями JPEG, стисненими з різними значеннями втрат (більше втрат дозволяє менший розмір файлу, але за рахунок розрізнення та смугування по кольоровим градаціям та іншим типам артефактів). Джерело: https://forums.jetphotos.com/forum/aviation-photography-videography-forums/digital-photo-processing-forum/1131923-how-to-fix-jpg-compression-artefacts?p=1131937#post1131937

Приклад різниці в чіткості між зображеннями JPEG, стисненими з різними значеннями втрат. Джерело: https://forums.jetphotos.com/forum/aviation-photography-videography-forums/digital-photo-processing-forum/1131923-how-to-fix-jpg-compression-artefacts?p=1131937#post1131937

У звіті 2022 року Університету Меріленду та Facebook AI зазначено, що стиснення JPEG “причиняє значну пенальті за продуктивність” при навчанні нейронних мереж, незважаючи на попередню роботу, яка стверджувала, що нейронні мережі відносно стійкі до артефактів стиснення зображень.

Рік раніше нова лінія думки з’явилася в літературі: що стиснення JPEG можна фактично використати для покращення результатів навчання моделі.

Однак, хоча автори цієї статті змогли отримати покращені результати при навчанні зображень JPEG різної якості, запропонованої ними моделі було так складно і важко, що вона не була практичною. Крім того, використання системи за замовчуванням налаштувань оптимізації JPEG (квантування) стало бар’єром для ефективності навчання.

Пізніше проект (2023 року JPEG Compliant Compression for DNN Vision) експериментував з системою, яка отримала трохи кращі результати від зображень JPEG з використанням замороженої глибокої нейронної мережі (DNN). Однак заморожування частин моделі під час навчання тенденцію до зниження гнучкості моделі, а також її загальної стійкості до нових даних.

JPEG-DL

Натомість, нова робота, озаглавлена JPEG Inspired Deep Learning, пропонує набагато простішу архітектуру, яку можна навіть накласти на існуючі моделі.

Дослідники з Університету Ватерлоо заявляють:

‘Результати показують, що JPEG-DL суттєво і послідовно перевершує стандартний DL на різних архітектурах DNN, з незначним збільшенням складності моделі.

Конкретно, JPEG-DL покращує точність класифікації до 20,9% на деяких задачах тонкої класифікації, додаючи лише 128 тренованих параметрів до трубопроводу DL. Крім того, перевага JPEG-DL над стандартним DL далі демонструється підвищеною стійкістю до атак зловмисників та зменшенням розмірів файлів вхідних зображень.’

Автори стверджують, що оптимальний рівень якості стиснення JPEG може допомогти нейронній мережі розрізнити центральну тему/теми зображення. У наведеному нижче прикладі ми бачимо базові результати (ліворуч), які змішують пташку з фоном, коли характеристики отримуються нейронною мережею. Натомість, JPEG-DL (праворуч) успішно розрізняє та виділяє об’єкт фотографії.

Тести проти базових методів для JPEG-DL. Джерело: https://arxiv.org/pdf/2410.07081

Тести проти базових методів для JPEG-DL. Джерело: https://arxiv.org/pdf/2410.07081

‘Цей феномен,’ вони пояснюють, ‘термінований “компресія допомагає” у роботі 2021 року, виправдано тим, що компресія може видалити шум і заважаючі фонові особливості, тим самим виділяючи головний об’єкт на зображенні, що допомагає DNN робити кращі передбачення.’

Метод

JPEG-DL вводить диференційовний м’який квантувальник, який замінює недиференційований оператор квантування у стандартній процедурі оптимізації JPEG.

Це дозволяє здійснювати градієнтну оптимізацію зображень. Це неможливо у конвенційному кодуванні JPEG, яке використовує уніформний квантувальник з операцією округлення, яка наближає найближчий коефіцієнт.

Диференційовність схеми JPEG-DL дозволяє спільну оптимізацію як параметрів моделі навчання, так і квантування JPEG (стиснення). Спільна оптимізація означає, що як модель, так і дані навчання пристосовуються один до одного в кінцевому процесі, і не потрібно заморожувати шари.

По суті, система налаштовує стиснення JPEG набору даних (сировини), щоб воно відповідало логіці процесу узагальнення.

Схема для JPEG-DL.

Концептуальна схема для JPEG-DL.

Хтось може припустити, що сировинні дані були б ідеальним матеріалом для навчання; адже зображення повністю розстиснюються у відповідний повний колірний простір, коли вони виконуються у пакетах; тому яка різниця робить оригінальний формат?

Ну, оскільки стиснення JPEG оптимізовано для перегляду людиною, воно викидає ділянки деталей або кольорів у спосіб, узгоджений з цією метою. Наприклад, якщо у нас є зображення озера під синім небом, збільшені рівні стиснення будуть застосовані до неба, оскільки воно не містить жодної “істотної” деталі.

З іншого боку, нейронна мережа не має тих же ексцентричних фільтрів, які дозволяють нам зосередитися на центральних об’єктах. Натомість вона, ймовірно, буде розглядати будь-які смугові артефакти на небі як дійсні дані, які потрібно включити у свій латентний простір.

Хоча людина відкине смугування на небі у сильно стисненому зображенні (ліворуч), нейронна мережа не має жодної ідеї, що цей вміст потрібно викинути, і їй потрібно зображення вищої якості (праворуч). Джерело: https://lensvid.com/post-processing/fix-jpeg-artifacts-in-photoshop/

Хоча людина відкине смугування на небі у сильно стисненому зображенні (ліворуч), нейронна мережа не має жодної ідеї, що цей вміст потрібно викинути, і їй потрібно зображення вищої якості (праворуч). Джерело: https://lensvid.com/post-processing/fix-jpeg-artifacts-in-photoshop/

Отже, один рівень стиснення JPEG малоймовірно підходить для всього вмісту набору даних для навчання, якщо тільки він не представляє дуже конкретну область. Зображення натовпів будуть вимагати значно менше стиснення, ніж зображення птахів, наприклад.

Автори спостерігають, що ті, хто незнайомий з викликами квантування, але знайомий з основами архітектури трансформерів, можуть розглядати ці процеси як операцію уваги, в широкому сенсі.

Дані та тести

JPEG-DL був оцінений проти архітектур, заснованих на трансформерах, та конвольних нейронних мереж (CNN). Архітектури, використані для цього, були EfficientFormer-L1; ResNet; VGG; MobileNet; і ShuffleNet.

Версії ResNet, використані для цього, були специфічними для набору даних CIFAR: ResNet32, ResNet56 і ResNet110. VGG8 і VGG13 були вибрані для тестів на основі VGG.

Для CNN методологія навчання була отримана з роботи 2020 року Contrastive Representation Distillation (CRD). Для EfficientFormer-L1 (трансформер-орієнтованого) метод навчання з Initializing Models with Larger Ones був використаний.

Для завдань тонкої класифікації, представлених у тестах, чотири набори даних були використані: Stanford Dogs; університет Оксфорду Flowers; CUB-200-2011 (CalTech Birds); і Pets (‘Кішки та собаки’, співпраця між університетом Оксфорду та Гайдарабадом в Індії).

Для завдань тонкої класифікації на CNN автори використали PreAct ResNet-18 і DenseNet-BC. Для EfficientFormer-L1 методологія, викладена в згаданій роботі Initializing Models With Larger Ones, була використана.

По всім сімом тестованим моделям для CIFAR-100 JPEG-DL послідовно забезпечує покращення, з виграшами до 1,53% у точності топ-1. У завданнях тонкої класифікації JPEG-DL пропонує суттєве підвищення продуктивності, з покращеннями до 20,90% по всім наборам даних, використовуючи дві різні моделі.

Результати тестів на ImageNet-1K показані нижче:

Результати валідної точності топ-1 на ImageNet по різних рамках.

Результати валідної точності топ-1 на ImageNet по різних рамках.

Автори також протестували систему, використовуючи дані, скомпрометовані підходами атак зловмисників адверсарними атаками Fast Gradient Signed Method (FGSM) і Projected Gradient Descent (PGD).

Атаки були проведені на CIFAR-100 по двох моделях:

Результати тестів для JPEG-DL проти двох стандартних рамок адверсарних атак.

Результати тестів для JPEG-DL проти двох стандартних рамок адверсарних атак.

Автори заявляють:

‘Моделі JPEG-DL суттєво покращують стійкість до атак зловмисників порівняно зі стандартними моделями DNN, з покращеннями до 15% для FGSM і 6% для PGD.’

Додатково, як показано раніше в статті, автори провели порівняння витягнутих карт особливостей, використовуючи GradCAM++ – рамку, яка може виділити витягнуті особливості візуально.

Ілюстрація GradCAM++ для базової та JPEG-DL класифікації зображень, з виділеними особливостями.

Ілюстрація GradCAM++ для базової та JPEG-DL класифікації зображень, з виділеними особливостями.

Автори відзначають, що JPEG-DL дає покращений результат, і що в одному випадку він навіть зміг класифікувати зображення, яке базова модель не змогла ідентифікувати. Відносно раніше показаного зображення з птахами, автори заявляють:

‘Ясно, що карти особливостей моделі JPEG-DL показують суттєво кращий контраст між інформацією переднього плану (птахом) та фоном порівняно з картами особливостей, згенерованими базовою моделлю.

‘Конкретно, об’єкт переднього плану на картах особливостей JPEG-DL обмежений добре визначеною контуром, що робить його візуально розрізним від фону.

‘Натомість, карти особливостей базової моделі показують більш змішану структуру, де передній план містить вищу енергію на низьких частотах, що робить його більш гладким з фоном.’

Висновок

JPEG-DL призначений для використання в ситуаціях, коли доступні сировинні дані – але було б цікаво побачити, чи деякі з принципів, представлених у цьому проекті, можна застосувати до традиційного навчання наборів даних, де вміст може бути нижчої якості (як часто трапляється з гіпермасштабними наборами даних, витягнутими з Інтернету).

Як стоїть, це в основному залишається проблемою анотації, хоча це було вирішено в визначенні зображень на основі трафіку та в інших місцях.

Перша публікація четверга, 10 жовтня 2024 року

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai