Моделі та платформи ШІ

InstructIR: Відновлення високоякісних зображень за допомогою людських інструкцій

mm
Додайте Unite.AI до бажаних джерел у Google

Зображення може передавати велику кількість інформації, але воно також може бути зіпсоване різними проблемами, такими як розмиття, туман, шум та низький динамічний діапазон. Ці проблеми, які називаються деградаціями в комп’ютерному баченні, можуть виникати через складні умови навколишнього середовища, такі як спека чи дощ, або через обмеження самої камери. Відновлення зображень є основною проблемою в комп’ютерному баченні, оскільки воно намагається відновити високоякісне, чисте зображення з того, яке демонструє деградації. Відновлення зображень є складним завданням, оскільки для будь-якого зображення можуть бути декілька різних рішень. Деякі підходи орієнтовані на конкретні деградації, такі як зменшення шуму або видалення розмиття чи туману.

Хоча ці методи можуть давати хороші результати для окремих проблем, вони часто мають труднощі з узагальненням на різні типи деградацій. Багато рамок використовують один і той же нейронний мережевий модуль для широкого спектра завдань відновлення зображень, але кожна з цих мереж тренується окремо. Потрібність у різних моделях для кожної деградації робить цей підхід обчислювально дорогим і часу споживаючим, що призвело до акценту на моделях All-In-One для відновлення. Ці моделі використовують одну глибоку сліпу модель відновлення зображень для вирішення різних рівнів і типів деградації, часто використовуючи векторні проміжні або текстові підказки для покращення результатів. Хоча моделі All-In-One зазвичай демонструють перспективні результати, вони все ще стикаються з проблемами обернених завдань.

InstructIR представляє собою новаторський підхід у цій галузі, оскільки це перша рамка відновлення зображень, розроблена для керування моделлю відновлення через людські інструкції. Вона може обробляти природні мовні підказки для відновлення високоякісних зображень з деградованих, враховуючи різні типи деградацій. InstructIR встановлює новий стандарт продуктивності для широкого спектра завдань відновлення зображень, включаючи видалення дощу, зменшення шуму, видалення туману, видалення розмиття та покращення зображень при низькому освітленні.

Ця стаття має на меті охопити рамку InstructIR у глибині, і ми досліджуємо механізм, методологію, архітектуру рамки разом з її порівнянням з сучасними рамками генерації зображень і відео. Тому давайте почнемо.

InstructIR: Відновлення високоякісних зображень

Відновлення зображень є фундаментальною проблемою в комп’ютерному баченні, оскільки воно намагається відновити високоякісне, чисте зображення з того, яке демонструє деградації. У низькому рівні комп’ютерного бачення деградації є термін, який використовується для представлення неприємних ефектів, спостережуваних у зображенні, таких як розмиття, туман, шум, низький динамічний діапазон та інше. Причина, по якій відновлення зображень є складним оберненим завданням, полягає в тому, що для будь-якого зображення можуть бути декілька різних рішень. Деякі рамки орієнтовані на конкретні деградації, такі як зменшення шуму або видалення розмиття чи туману.

Недавні методи глибинного навчання продемонстрували сильніші та більш стабільні результати порівняно з традиційними методами відновлення зображень. Ці моделі глибинного навчання пропонують використовувати нейронні мережі на основі трансформерів і конволюційних нейронних мереж. Ці моделі можуть бути треновані незалежно для різних завдань відновлення зображень і вони також мають можливість захоплювати місцеві та глобальні взаємодії ознак і покращувати їх, що призводить до задовільних і стабільних результатів. Хоча деякі з цих методів можуть працювати достатньо добре для окремих типів деградацій, вони зазвичай не узагальнюються добре на різні типи деградацій. Крім того, хоча багато існуючих рамок використовують одну і ту ж нейронну мережу для багатьох завдань відновлення зображень, кожна формулювання нейронної мережі тренується окремо. Отже, очевидно, що використання окремої нейронної моделі для кожної можливої деградації є недоцільним і часу споживаючим, що призвело до акценту на моделях All-In-One для відновлення.

Моделі All-In-One або багатодеградаційні моделі відновлення зображень набувають популярності в галузі комп’ютерного бачення, оскільки вони здатні відновлювати декілька типів і рівнів деградацій у зображенні без потреби тренування моделей окремо для кожної деградації. Моделі All-In-One використовують одну глибоку сліпу модель відновлення зображень для вирішення різних типів і рівнів деградації зображень. Різні моделі All-In-One реалізують різні підходи для керування сліпою моделлю для відновлення деградованого зображення, наприклад, допоміжну модель для класифікації деградації або багатовимірні векторні підказки для допомоги моделі у відновленні різних типів деградацій у зображенні.

З урахуванням цього, ми переходимо до текстової маніпуляції зображеннями, оскільки вона була реалізована декількома рамками за останні роки для генерації зображень на основі тексту і завдань редагування зображень на основі тексту. Ці моделі часто використовують текстові підказки для опису дій або зображень разом з моделями на основі дифузії для генерації відповідних зображень. Основною ідеєю рамки InstructIR є рамка InstructPix2Pix, яка дозволяє моделі редагувати зображення за допомогою інструкцій користувача, які вказують моделі, яку дію виконувати, а не текстові мітки, описи чи підказки для входного зображення. В результаті користувачі можуть використовувати природні тексти для інструктування моделі щодо виконання дій без потреби у зразкових зображеннях чи додаткових описах зображень.

На основі цих основ, рамка InstructIR є першою комп’ютерною моделлю, яка використовує людські інструкції для досягнення відновлення зображень і вирішення обернених завдань. Для природних мовних підказок модель InstructIR може відновлювати високоякісні зображення з деградованих і враховувати декілька типів деградацій. Рамка InstructIR здатна демонструвати найкращі результати на широкому спектрі завдань відновлення зображень, включаючи видалення дощу, зменшення шуму, видалення туману, видалення розмиття та покращення зображень при низькому освітленні. На відміну від існуючих робіт, які досягають відновлення зображень за допомогою навчених векторів підказок або підказок у вигляді вкладень, рамка InstructIR використовує сурові текстові підказки. Рамка InstructIR здатна узагальнюватися для відновлення зображень за допомогою людських інструкцій, і одна модель All-In-One, реалізована InstructIR, покриває більше завдань відновлення, ніж попередні моделі. Наступна фігура демонструє різноманітні зразки відновлення рамки InstructIR.

InstructIR: Метод і архітектура

У своєму ядрі рамка InstructIR складається з текстового кодувальника і моделі зображення. Модель використовує рамку NAFNet, ефективну модель відновлення зображень, яка слідує архітектурі U-Net, як модель зображення. Крім того, модель реалізує техніки маршрутизації завдань для навчання декількох завдань за допомогою однієї моделі успішно. Наступна фігура ілюструє підхід до тренування і оцінки рамки InstructIR.

Вдихаючи ідеї з моделі InstructPix2Pix, рамка InstructIR приймає людські інструкції як механізм керування, оскільки немає потреби у додатковій інформації від користувача. Ці інструкції пропонують виразний і ясний спосіб взаємодії, який дозволяє користувачам вказувати точне місце і тип деградації у зображенні. Крім того, використання підказок користувача замість фіксованих підказок, специфічних для деградації, підвищує придатність і застосування моделі, оскільки вона також може бути використана користувачами, які не мають необхідної експертизи у галузі. Для того, щоб забезпечити рамку InstructIR можливістю розуміння різноманітних підказок, модель використовує велику мовну модель GPT-4 для створення різноманітних запитів, з яких видаляються нечіткі і невиразні підказки після процесу фільтрації.

Текстовий кодувальник

Текстовий кодувальник використовується мовними моделями для відображення підказок користувача у текстове вкладення або фіксоване розмірне векторне представлення. Традиційно, текстовий кодувальник моделі CLIP є важливим компонентом для генерації зображень на основі тексту і завдань редагування зображень на основі тексту для кодування підказок користувача, оскільки рамка CLIP excels у візуальних підказках. Однак більшість часу підказки користувача для деградації містять мало або жодного візуального контенту, що робить великі кодувальники CLIP непридатними для таких завдань, оскільки це значно погіршить ефективність. Для вирішення цієї проблеми рамка InstructIR вибирає текстовий кодувальник речень, який тренується для кодування речень у значимому просторі вкладень. Кодувальники речень попередньо тренуються на мільйонах прикладів і все ж компактні та ефективні порівняно з традиційними кодувальниками CLIP, маючи можливість кодувати семантику різноманітних підказок користувача.

Текстове керування

Одним з основних аспектів рамки InstructIR є реалізація закодованої інструкції як механізму керування для моделі зображення. Будуючи на цьому, і надихаючись маршрутизацією завдань для навчання багатьох завдань, рамка InstructIR пропонує блок конструкції інструкції (ICB), щоб забезпечити завдання-специфічні перетворення у моделі. Традиційна маршрутизація завдань застосовує завдання-специфічні бінарні маски до канальних ознак. Однак, оскільки рамка InstructIR не знає деградації, ця техніка не реалізується безпосередньо. Крім того, для ознак зображення і закодованих інструкцій рамка InstructIR застосовує маршрутизацію завдань і генерує маску за допомогою лінійного шару, активованого функцією Сигмоїд, для отримання набору ваг залежно від текстових вкладень, тим самим отримуючи c-розмірну бінарну маску для кожного каналу. Модель далі покращує умовні ознаки за допомогою блоку NAF, і використовує блок NAF і блок умовного керування для умовлення ознак у блоках кодувальника і декодувальника.

Хоча рамка InstructIR не умовлює фільтри нейронної мережі явно, маска дозволяє моделі вибирати канали, які є найбільш актуальними на основі інструкції зображення та інформації.

InstructIR: Реалізація і результати

Модель InstructIR є тренованою з кінця в кінець, і модель зображення не потребує попереднього тренування. Потрібно тренувати тільки проекції текстових вкладень і класифікаційний заголовок. Текстовий кодувальник ініціалізується за допомогою кодувальника BGE, кодувальника типу BERT, який попередньо тренується на величезній кількості супервізорських і несупервізорських даних для загального призначення кодування речень. Рамка InstructIR використовує модель NAFNet як модель зображення, і архітектура NAFNet складається з 4-рівневого кодувальника-декодувальника з різною кількістю блоків на кожному рівні. Модель також додає 4 середніх блоки між кодувальником і декодувальником для подальшого покращення ознак. Крім того, замість конкатенації для з’єднань пропуску, декодувальник реалізує додавання, і модель InstructIR реалізує тільки блок умовного керування (ICB) для маршрутизації завдань тільки у кодувальнику і декодувальнику. Далі, модель InstructIR оптимізується за допомогою втрат між відновленим зображенням і чистим зображенням, і використовується перехрестна ентропія для класифікаційного заголовка текстового кодувальника. Модель InstructIR використовує оптимізатор AdamW з розміром 배ч 32 і швидкістю навчання 5e-4 протягом майже 500 епох, і також реалізує косинусне зниження швидкості навчання. Оскільки модель зображення у рамці InstructIR складається тільки з 16 мільйонів параметрів, і є тільки 100 тисяч вивчених параметрів текстових проекцій, рамка InstructIR може бути легко тренована на стандартних GPU, тим самим знижуючи обчислювальні витрати і підвищуючи придатність.

Результати для декількох деградацій

Для декількох деградацій і багатозадачного відновлення рамка InstructIR визначає два початкові налаштування:

  1. 3D для моделей з трьома деградаціями для вирішення проблем, таких як видалення туману, зменшення шуму і видалення дощу.
  2. 5D для моделей з п’ятьма деградаціями для вирішення проблем, таких як зменшення шуму зображень, покращення зображень при низькому освітленні, видалення туману, зменшення шуму і видалення дощу.

Виступи 5D-моделей демонструються в наступній таблиці, і порівнюються з сучасними моделями відновлення зображень і моделями All-In-One.

Як можна побачити, рамка InstructIR з простою моделлю зображення і тільки 16 мільйонами параметрів може успішно вирішувати п’ять різних завдань відновлення зображень завдяки інструкційному керуванню, і демонструє конкурентоспроможні результати. Наступна таблиця демонструє продуктивність рамки на 3D-моделях, і результати порівняні з вищеописаними результатами.

Основним акцентом рамки InstructIR є інструкційне відновлення зображень, і наступна фігура демонструє неймовірні можливості моделі InstructIR для розуміння широкого спектра інструкцій для заданого завдання. Крім того, для супротивної інструкції модель InstructIR виконує тотожність, яка не примусова.

Фінальні думки

Відновлення зображень є фундаментальною проблемою в комп’ютерному баченні, оскільки воно намагається відновити високоякісне, чисте зображення з того, яке демонструє деградації. У низькому рівні комп’ютерного бачення деградації є термін, який використовується для представлення неприємних ефектів, спостережуваних у зображенні, таких як розмиття, туман, шум, низький динамічний діапазон та інше. У цій статті ми говорили про InstructIR, перший у світі框 відновлення зображень, який намагається керувати моделлю відновлення зображень за допомогою людських інструкцій. Для природних мовних підказок модель InstructIR може відновлювати високоякісні зображення з деградованих і враховувати декілька типів деградацій. Рамка InstructIR здатна демонструвати найкращі результати на широкому спектрі завдань відновлення зображень, включаючи видалення дощу, зменшення шуму, видалення туману, видалення розмиття та покращення зображень при низькому освітленні.

Інженер за професією, письменник серцем. Kunal є технічним письменником з глибокою любов'ю та розумінням AI і ML, присвяченим спрощенню складних концепцій у цих галузях завдяки його цікавим та інформативним документам.