Модели и платформы ИИ

InstructIR: Высококачественное Восстановление Изображений по Человеческим Инструкциям

mm
Добавьте Unite.AI в избранные источники в Google

Изображение может передавать большую информацию, но также может быть испорчено различными проблемами, такими как размытие, дымка, шум и низкий динамический диапазон. Эти проблемы, обычно называемые деградациями в низкоуровневом компьютерном зрении, могут возникать из-за трудных условий окружающей среды, таких как жара или дождь, или из-за ограничений самой камеры. Восстановление изображений представляет собой основную задачу в компьютерном зрении, направленную на восстановление высококачественного, чистого изображения из изображения, демонстрирующего такие деградации. Восстановление изображений является сложной задачей, поскольку для восстановления любого изображения может быть несколько решений. Некоторые подходы нацелены на конкретные деградации, такие как уменьшение шума или удаление размытия или дымки.

Хотя эти методы могут давать хорошие результаты для конкретных проблем, они часто испытывают трудности в обобщении на различные типы деградаций. Многие рамки используют общую нейронную сеть для широкого спектра задач восстановления изображений, но эти сети обучаются отдельно. Необходимость использования различных моделей для каждой деградации делает этот подход вычислительно дорогим и耗ительным, что привело к фокусу на моделях All-In-One для восстановления. Эти модели используют одну глубокую слепую модель восстановления изображений для решения различных уровней и типов деградаций, часто используя деградационно-специфические подсказки или векторы управления для улучшения производительности. Хотя модели All-In-One обычно показывают перспективные результаты, они все еще сталкиваются с проблемами с обратными задачами.

InstructIR представляет собой прорывной подход в этой области, будучи первой рамкой восстановления изображений, предназначенной для руководства моделью восстановления через написанные человеком инструкции. Она может обрабатывать естественные языковые подсказки для восстановления высококачественных изображений из деградированных, учитывая различные типы деградаций. InstructIR устанавливает новый стандарт производительности для широкого спектра задач восстановления изображений, включая удаление дождя, шума, дымки, размытия и улучшение изображений с низким освещением.

Эта статья направлена на углубленное описание рамки InstructIR, и мы исследуем механизм, методологию, архитектуру рамки, а также ее сравнение с современными рамками генерации изображений и видео. Итак, давайте начнем.

InstructIR: Высококачественное Восстановление Изображений

Восстановление изображений является фундаментальной проблемой в компьютерном зрении, поскольку оно направлено на восстановление высококачественного, чистого изображения из изображения, демонстрирующего деградации. В низкоуровневом компьютерном зрении деградации представляют собой неприятные эффекты, наблюдаемые внутри изображения, такие как размытие, дымка, шум, низкий динамический диапазон и многое другое. Причина, по которой восстановление изображений является сложной обратной задачей, заключается в том, что для восстановления любого изображения может быть несколько различных решений. Некоторые рамки фокусируются на конкретных деградациях, таких как уменьшение шума или удаление размытия, в то время как другие могут фокусироваться на удалении дымки или улучшении изображений с низким освещением.

Недавние методы глубокого обучения показали более сильную и последовательную производительность по сравнению с традиционными методами восстановления изображений. Эти модели восстановления изображений на основе глубокого обучения предлагают использовать нейронные сети на основе трансформеров и свёрточных нейронных сетей. Эти модели можно обучать независимо для различных задач восстановления изображений, и они также обладают способностью захватывать локальные и глобальные взаимодействия особенностей, и улучшать их, в результате чего получается удовлетворительная и последовательная производительность. Хотя некоторые из этих методов могут работать удовлетворительно для конкретных типов деградаций, они обычно не обобщаются хорошо на различные типы деградаций. Кроме того, хотя многие существующие рамки используют одну и ту же нейронную сеть для множества задач восстановления изображений, каждая формулировка нейронной сети обучается отдельно. Следовательно, очевидно, что использование отдельной нейронной модели для каждой деградации является нецелесообразным и耗ительным, что привело к фокусу на моделях All-In-One для восстановления.

Модели All-In-One или много-деградационные или много-задачные модели восстановления изображений набирают популярность в области компьютерного зрения, поскольку они способны восстанавливать множество типов и уровней деградаций в изображении без необходимости обучения моделей независимо для каждой деградации. Модели All-In-One используют одну глубокую слепую модель восстановления изображений для решения различных типов и уровней деградаций. Различные модели All-In-One реализуют различные подходы для руководства слепой моделью для восстановления деградированного изображения, например, вспомогательную модель для классификации деградации или много-мерные векторы управления или подсказки для помощи модели в восстановлении различных типов деградаций внутри изображения.

С учетом этого, мы переходим к текстовой манипуляции изображениями, поскольку она была реализована несколькими рамками в последние годы для задач генерации изображений из текста и редактирования изображений на основе текста. Эти модели часто используют текстовые подсказки для описания действий или изображений, а также модели на основе диффузии для генерации соответствующих изображений. Основной источник вдохновения для рамки InstructIR является рамка InstructPix2Pix, которая позволяет модели редактировать изображение, используя инструкции пользователя, которые указывают модели, какое действие выполнить, вместо текстовых меток, описаний или подписей к входному изображению. В результате пользователи могут использовать естественные текстовые инструкции для указания модели, какое действие выполнить, без необходимости предоставления образцов изображений или дополнительных описаний изображений.

Развивая эти основы, рамка InstructIR является первой компьютерной моделью, которая использует написанные человеком инструкции для достижения восстановления изображений и решения обратных задач. Для естественных языковых подсказок модель InstructIR может восстановить высококачественные изображения из деградированных и учитывать множество типов деградаций. Рамка InstructIR способна обеспечить передовую производительность на широком спектре задач восстановления изображений, включая удаление дождя, шума, дымки, размытия и улучшение изображений с низким освещением. В отличие от существующих работ, которые достигают восстановления изображений, используя обученные векторы управления или вложения подсказок, рамка InstructIR использует сырые текстовые подсказки пользователя. Рамка InstructIR способна обобщаться на восстановление изображений, используя инструкции, написанные человеком, и одна модель All-In-One, реализованная в InstructIR, покрывает больше задач восстановления, чем более ранние модели.

InstructIR: Метод и Архитектура

В своей основе рамка InstructIR состоит из текстового кодировщика и модели изображения. Модель использует рамку NAFNet, эффективную модель восстановления изображений, следующую архитектуре U-Net, в качестве модели изображения. Кроме того, модель реализует техники маршрутизации задач для обучения множества задач с помощью одной модели. Следующая фигура иллюстрирует подход к обучению и оценке для рамки InstructIR.

Вдохновленная моделью InstructPix2Pix, рамка InstructIR принимает написанные человеком инструкции в качестве механизма управления, поскольку нет необходимости для пользователя предоставлять дополнительную информацию. Эти инструкции предлагают выразительный и ясный способ взаимодействия, позволяя пользователям указать точное местоположение и тип деградации в изображении. Кроме того, использование пользовательских подсказок вместо фиксированных деградационно-специфических подсказок улучшает удобство использования и применения модели, поскольку она также может быть использована пользователями, не обладающими необходимыми знаниями в области.

Текстовый Кодировщик

Текстовый кодировщик используется языковыми моделями для сопоставления пользовательских подсказок с текстовым вложением или векторным представлением фиксированного размера. Традиционно текстовый кодировщик модели CLIP является важным компонентом для текстовой генерации изображений и текстовой манипуляции моделей для кодирования пользовательских подсказок, поскольку рамка CLIP превосходно справляется с визуальными подсказками. Однако большинство раз пользовательские подсказки для деградаций содержат мало или совсем не содержат визуального контента, что делает большие кодировщики CLIP бесполезными для таких задач, поскольку это существенно снижает эффективность. Для решения этой проблемы рамка InstructIR выбирает текстовый кодировщик предложений, обученный для кодирования предложений в осмысленном пространстве вложений. Кодировщики предложений предварительно обучены на миллионах примеров и, тем не менее, компактны и эффективны по сравнению с традиционными кодировщиками CLIP, имея возможность кодировать семантику различных пользовательских подсказок.

Текстовое Руководство

Одним из основных аспектов рамки InstructIR является реализация закодированной инструкции в качестве механизма управления для модели изображения. Основываясь на этом и вдохновленная маршрутизацией задач для обучения множества задач, рамка InstructIR предлагает блок конструкции инструкции (Instruction Construction Block, ICB) для ermögления задачно-специфических преобразований внутри модели. Традиционная маршрутизация задач применяет задачно-специфические бинарные маски к каналам особенностей. Однако, поскольку рамка InstructIR не знает деградации, эта техника не реализуется напрямую. Кроме того, для особенностей изображения и закодированных инструкций рамка InstructIR применяет маршрутизацию задач и производит маску с помощью линейного слоя, активированного функцией Сигмоид, для производства набора весов, зависящих от текстовых вложений, тем самым получая бинарную маску размера c для каждого канала. Модель далее улучшает условленные особенности, используя блок NAFBlock, и использует блок NAFBlock и блок условленного инструктирования для условления особенностей как на блоке кодировщика, так и на блоке декодировщика.

Хотя рамка InstructIR не условляет явно фильтры нейронной сети, маска позволяет модели выбрать наиболее актуальные каналы на основе инструкции и информации изображения.

InstructIR: Реализация и Результаты

Модель InstructIR является обучаемой от начала до конца, и модель изображения не требует предварительного обучения. Только проекции текстовых вложений и классификационная голова требуют обучения. Текстовый кодировщик инициализируется с помощью кодировщика BGE, кодировщика, подобного BERT, предварительно обученного на огромном количестве контролируемых и неконтролируемых данных для общего кодирования предложений. Рамка InstructIR использует модель NAFNet в качестве модели изображения, и архитектура NAFNet состоит из 4-уровневого кодировщика-декодировщика с различным количеством блоков на каждом уровне. Модель также добавляет 4 средних блока между кодировщиком и декодировщиком для дальнейшего улучшения особенностей. Кроме того, вместо конкатенации для соединений пропусков, декодировщик реализует сложение, и модель InstructIR реализует только блок условленного инструктирования (ICB) для маршрутизации задач только в кодировщике и декодировщике. Переходя к модели InstructIR, она оптимизируется с помощью потерь между восстановленным изображением и исходным чистым изображением, и используется перекрестная энтропия для классификационной головы текстового кодировщика. Модель InstructIR использует оптимизатор AdamW с размером пакета 32 и скоростью обучения 5e-4 в течение почти 500 эпох, и также реализует косинусное затухание скорости обучения. Поскольку модель изображения в рамке InstructIR состоит только из 16 миллионов параметров, и существует только 100 тысяч обученных параметров проекций текста, рамка InstructIR может быть легко обучена на стандартных GPU, тем самым снижая вычислительные затраты и увеличивая применимость.

Результаты Множественных Деградаций

Для множественных деградаций и много-задачного восстановления рамка InstructIR определяет два начальных набора:

  1. 3D для трех-деградационных моделей для решения проблем, таких как удаление дымки, шума и дождя.
  2. 5D для пяти-деградационных моделей для решения проблем, таких как удаление шума, улучшение изображений с низким освещением, удаление дымки, шума и дождя.

Производительность 5D-моделей демонстрируется в следующей таблице, и сравнивается с современными моделями восстановления изображений и моделями All-In-One.

Как можно наблюдать, рамка InstructIR с простой моделью изображения и только 16 миллионами параметров может успешно решать пять разных задач восстановления изображений благодаря инструкциям, основанным на руководстве, и обеспечивает конкурентоспособные результаты. Следующая таблица демонстрирует производительность рамки на 3D-моделях, и результаты сравнимы с результатами выше.

Основным достоинством рамки InstructIR является инструкция на основе восстановления изображений, и следующая фигура демонстрирует невероятные способности модели InstructIR понимать широкий спектр инструкций для данной задачи. Кроме того, для враждебной инструкции модель InstructIR выполняет идентификацию, которая не является принудительной.

Окончательные Мысли

Восстановление изображений является фундаментальной проблемой в компьютерном зрении, поскольку оно направлено на восстановление высококачественного, чистого изображения из изображения, демонстрирующего деградации. В низкоуровневом компьютерном зрении деградации представляют собой неприятные эффекты, наблюдаемые внутри изображения, такие как размытие, дымка, шум, низкий динамический диапазон и многое другое. В этой статье мы говорили об InstructIR, первой в мире рамке восстановления изображений, которая направлена на руководство моделью восстановления изображений, используя написанные человеком инструкции. Для естественных языковых подсказок модель InstructIR может восстановить высококачественные изображения из деградированных и учитывать множество типов деградаций. Рамка InstructIR способна обеспечить передовую производительность на широком спектре задач восстановления изображений, включая удаление дождя, шума, дымки, размытия и улучшение изображений с низким освещением.

"Инженер по профессии, писатель по сердцу". Кунал - технический писатель с глубокой любовью и пониманием ИИ и МО, посвященный упрощению сложных концепций в этих областях посредством своей увлекательной и информативной документации.