Модели и платформы ИИ
Руководство по редактированию изображений на основе инструкций с помощью многомодальных крупномасштабных языковых моделей
Визуальные инструменты дизайна и модели языка зрения имеют широкое применение в индустрии мультимедиа. Несмотря на значительные достижения в последние годы, для работы с этими инструментами все еще необходим глубокое понимание. Для повышения доступности и контроля индустрия мультимедиа все чаще采用ит методы редактирования изображений на основе текста или инструкций. Эти методы используют естественные языковые команды вместо традиционных региональных масок или подробных описаний, что позволяет более гибко и точно манипулировать изображениями. Однако методы на основе инструкций часто предоставляют краткие указания, которые могут быть сложными для существующих моделей полностью воспринять и выполнить. Кроме того, диффузионные модели, известные своей способностью создавать реалистичные изображения, находятся в высоком спросе в секторе редактирования изображений.
Более того, многомодальные крупномасштабные языковые модели (МКЯМ) показали впечатляющие результаты в задачах, связанных с генерацией визуальных ответов и межмодальной пониманием. Редактирование изображений на основе МКЯМ (МГИЭ) – это исследование, вдохновленное МКЯМ, которое оценивает их возможности и анализирует, как они поддерживают редактирование через текст или руководящие инструкции. Этот подход включает обучение для предоставления явных указаний и получения выразительных инструкций. Модель редактирования МГИЭ понимает визуальную информацию и выполняет редактирование через обучение от начала до конца. В этой статье мы глубоко рассмотрим МГИЭ, оценивая его влияние на глобальную оптимизацию изображений, модификации в стиле Photoshop и локальное редактирование. Мы также обсудим значение МГИЭ в задачах редактирования изображений на основе инструкций, которые полагаются на выразительные инструкции. Давайте начнем наше исследование.
Редактирование изображений на основе МКЯМ или МГИЭ: Введение
Многомодальные крупномасштабные языковые модели и диффузионные модели – это два наиболее широко используемых框架ов ИИ и МЛ в настоящее время, благодаря их замечательным генеративным возможностям. С одной стороны, у вас есть диффузионные модели, которые лучше всего известны производством высокореалистичных и визуально привлекательных изображений, а с другой стороны, у вас есть многомодальные крупномасштабные языковые модели, известные своей исключительной силой в генерации широкого спектра контента, включая текст, язык, речь и изображения/видео.
Диффузионные модели меняют латентные межмодальные карты для выполнения визуальной манипуляции, отражающей изменение входной цели подписи, и они также могут использовать руководящую маску для редактирования конкретной области изображения. Но основная причина, по которой диффузионные модели широко используются для мультимедийных приложений, заключается в том, что вместо использования подробных описаний или региональных масок диффузионные модели используют методы редактирования на основе инструкций, которые позволяют пользователям выражать, как редактировать изображение,直接 используя текстовые инструкции или команды. Далее, крупномасштабные языковые модели не нуждаются в представлении, поскольку они продемонстрировали значительные достижения в различных языковых задачах, включая суммаризацию текста, машинный перевод, генерацию текста и ответы на вопросы. КЯМ обычно обучаются на большом и разнообразном наборе обучающих данных, что наделяет их визуальной креативностью и знаниями, позволяя им выполнять несколько задач языка зрения. Основываясь на КЯМ, МКЯМ или многомодальные крупномасштабные языковые модели могут использовать изображения как естественные входные данные и предоставлять соответствующие визуально осведомленные ответы.
Учитывая это, хотя диффузионные модели и МКЯМ-рамки широко используются для задач редактирования изображений, существуют некоторые проблемы с руководством, основанным на текстовых инструкциях, которые препятствуют общей производительности, что приводит к разработке МГИЭ или редактирования изображений на основе МКЯМ, ИИ-рамки, состоящей из диффузионной модели и МКЯМ-модели, как показано на следующем изображении.
В рамке МГИЭ диффузионная модель обучается от начала до конца для выполнения редактирования изображений с латентной фантазией намеченной цели, а МКЯМ-рамка учится предсказывать точные выразительные инструкции. Вместе диффузионная модель и МКЯМ-рамка используют внутреннюю визуальную производность, что позволяет ей решать проблемы, связанные с неоднозначными человеческими командами, что приводит к реалистичному редактированию изображений, как показано на следующем изображении.
Рамка МГИЭ черпает вдохновение из двух существующих подходов: редактирование изображений на основе инструкций и модели языка зрения.
Редактирование изображений на основе инструкций может значительно улучшить доступность и контролируемость визуальной манипуляции, следуя человеческим командам. Существует два основных рамка, используемых для редактирования изображений на основе инструкций: ГАН-рамки и диффузионные модели. ГАН или генеративно-состязательные сети способны изменять изображения, но либо ограничены конкретными доменами, либо производят нереалистичные результаты. С другой стороны, диффузионные модели с крупномасштабным обучением могут контролировать межмодальные карты внимания для глобальных карт, чтобы достичь редактирования и преобразования изображений. Редактирование на основе инструкций работает, получая прямые команды в качестве входных данных, часто не ограничиваясь региональными масками и подробными описаниями. Однако существует вероятность того, что предоставленные инструкции являются либо неоднозначными, либо не достаточно точными для выполнения инструкций для задач редактирования.
Модели языка зрения известны своей способностью генерировать текст и обобщать различные задачи, и они часто имеют прочное текстовое понимание, и могут дальнейшее производство исполняемых программ или псевдокода. Эта способность крупномасштабных языковых моделей позволяет МКЯМ воспринимать изображения и предоставлять соответствующие ответы, используя визуальную выравнивание с настройкой инструкции, с недавними моделями, принимающими МКЯМ для генерации изображений, связанных с чатом или входным текстом. Однако, что отличает МГИЭ от МКЯМ или МЯМ, заключается в том, что, хотя последние могут производить изображения, отличные от входных данных, с нуля, МГИЭ использует возможности МКЯМ для улучшения возможностей редактирования изображений с полученными инструкциями.
МГИЭ: Архитектура и методология
Традиционно крупномасштабные языковые модели использовались для генеративных задач обработки естественного языка. Но с тех пор, как МКЯМ стали мейнстримом, КЯМ были наделены способностью предоставлять разумные ответы, воспринимая изображения. Обычно многомодальная крупномасштабная языковая модель инициализируется из предварительно обученной КЯМ и содержит визуальный кодировщик и адаптер для извлечения визуальных функций и проектирования визуальных функций в языковую модальность соответственно. Благодаря этому МКЯМ-рамка способна воспринимать визуальные входные данные, хотя выход仍 ограничен текстом.
Предлагаемая рамка МГИЭ направлена на решение этой проблемы и облегчение МКЯМ редактирования входного изображения в выходное изображение на основе данной текстовой инструкции. Для достижения этого рамка МГИЭ включает МКЯМ и обучается для получения кратких и явных выразительных текстовых инструкций. Кроме того, рамка МГИЭ добавляет специальные токены изображений в своей архитектуре для моста между видением и языковой модальностью и принимает заголовок редактирования для преобразования модальностей. Эти модальности служат латентной визуальной фантазией из многомодальной крупномасштабной языковой модели и направляют диффузионную модель для выполнения задач редактирования. Рамка МГИЭ затем способна выполнять задачи визуального восприятия для разумного редактирования изображений.
Краткая выразительная инструкция
Традиционно многомодальные крупномасштабные языковые модели могут предлагать визуально связанные ответы с межмодальной перцепцией благодаря настройке инструкции и выравниванию функций. Для редактирования изображений рамка МГИЭ использует текстовый сигнал как основной языковой вход с изображением и получает подробное объяснение для команды редактирования. Однако эти объяснения могут часто быть слишком длинными или включать повторяющиеся описания, что приводит к неправильному толкованию намерений, заставляя МГИЭ применять предварительно обученный суммаризатор для получения кратких нарративов, позволяя МКЯМ генерировать суммированные выходные данные. Рамка рассматривает краткое, но явное руководство как выразительную инструкцию и применяет перекрестную энтропию для обучения многомодальной крупномасштабной языковой модели с помощью принудительного обучения.
Использование выразительной инструкции предоставляет более конкретную идею по сравнению с текстовой инструкцией, поскольку оно мостит разрыв для разумного редактирования изображений, повышая эффективность рамки. Кроме того, рамка МГИЭ во время периода вывода получает краткие выразительные инструкции вместо производства длинных нарративов и опоры на внешнюю суммаризацию. Благодаря этому рамка МГИЭ способна понять визуальную фантазию намерений редактирования, но все еще ограничена языковой модальностью. Чтобы преодолеть это препятствие, модель МГИЭ добавляет определенное количество визуальных токенов после выразительной инструкции с обучаемыми векторными представлениями слов, позволяя МКЯМ генерировать их с помощью своей головки языковой модели.
Редактирование изображений с латентной фантазией
На следующем шаге рамка МГИЭ принимает заголовок редактирования для преобразования инструкции изображения в фактическое визуальное руководство. Заголовок редактирования – это модель последовательность-последовательность, которая помогает в сопоставлении последовательных визуальных токенов из МКЯМ с осмысленными латентными семантически как его руководство редактирования. Чтобы быть более конкретным, преобразование над векторными представлениями слов может быть интерпретировано как общее представление в визуальной модальности и использует компонент визуальной фантазии для намерений редактирования. Кроме того, для направления редактирования изображений с визуальной фантазией рамка МГИЭ встраивает латентную диффузионную модель в своей архитектуре, которая включает вариационный автоэнкодер и решает задачу денойзинга в латентном пространстве. Основная цель латентной диффузионной модели – генерировать латентную цель, сохраняя латентный вход и следуя руководству редактирования. Процесс диффузии добавляет шум к латентной цели через регулярные интервалы времени, и уровень шума увеличивается с каждым шагом времени.
Обучение МГИЭ
Следующая фигура суммирует алгоритм процесса обучения предложенной рамки МГИЭ.
Как можно наблюдать, МКЯМ учится получать краткие выразительные инструкции, используя потерю инструкции. Используя латентную фантазию из входных инструкций изображения, рамка преобразует модальность заголовка редактирования и направляет латентную диффузионную модель для синтеза результирующего изображения и применяет потерю редактирования для обучения диффузии. Наконец, рамка замораживает большинство весов, что приводит к параметро-эффективному обучению от начала до конца.
МГИЭ: Результаты и оценка
Рамка МГИЭ использует набор данных IPr2Pr в качестве своего основного предварительно обученного данных и содержит более 1 миллиона фильтрованных данных CLIP с инструкциями, извлеченными из модели GPT-3, и моделью Prompt-to-Prompt для синтеза изображений. Кроме того, рамка МГИЭ рассматривает рамку InsPix2Pix, построенную на основе кодировщика текста CLIP с диффузионной моделью, в качестве базовой модели для задач редактирования изображений на основе инструкций. Кроме того, модель МГИЭ также принимает во внимание модель редактирования изображений на основе КЯМ, принятую для выразительных инструкций из входных данных только инструкций, но без визуального восприятия.
Количественный анализ
Следующая фигура суммирует результаты редактирования в нулевой установке с моделями, обученными только на наборе данных IPr2Pr. Для данных GIER и EVR, включающих модификации в стиле Photoshop, выразительные инструкции могут раскрыть конкретные цели вместо неоднозначных команд, что позволяет результатам редактирования лучше соответствовать намерениям редактирования.
Хотя модели LGIE и МГИЭ обучаются на тех же данных, что и модель InsPix2Pix, они могут предложить подробные объяснения через обучение с крупномасштабной языковой моделью, но модель LGIE все еще ограничена одной модальностью. Кроме того, рамка МГИЭ может обеспечить значительный прирост производительности, поскольку она имеет доступ к изображениям и может использовать эти изображения для получения явных инструкций.
Для оценки производительности на задачах редактирования изображений на основе инструкций для конкретных целей разработчики дообучают несколько моделей на каждом наборе данных, как суммировано в следующей таблице.
Как можно наблюдать, после адаптации задач редактирования в стиле Photoshop для EVR и GIER модели демонстрируют прирост производительности. Однако стоит отметить, что, поскольку дообучение делает выразительные инструкции более доменно-специфичными, рамка МГИЭ наблюдает значительный прирост производительности, поскольку она также учится доменно-специфичному руководству, что позволяет диффузионной модели демонстрировать конкретные отредактированные сцены из дообученной крупномасштабной языковой модели, что приносит пользу как локальному изменению, так и локальной оптимизации. Кроме того, поскольку визуально-осведомленное руководство более соответствует намеченным целям редактирования, рамка МГИЭ последовательно обеспечивает лучшие результаты по сравнению с LGIE.
Следующая фигура демонстрирует оценку CLIP-S между входными или исходными изображениями цели и выразительными инструкциями. Более высокий балл CLIP указывает на соответствие инструкций с источником редактирования, и как можно наблюдать, МГИЭ имеет более высокий балл CLIP по сравнению с моделью LGIE как для входных, так и для выходных изображений.
Качественные результаты
Следующее изображение идеально суммирует качественный анализ рамки МГИЭ.
Как мы знаем, рамка LGIE ограничена одной модальностью, из-за чего она имеет один языковый взгляд, и склонна получать неправильные или нерелевантные объяснения для редактирования изображения. Однако рамка МГИЭ является многомодальной, и с доступом к изображениям, она выполняет задачи редактирования и обеспечивает явную визуальную фантазию, которая хорошо соответствует цели.
Окончательные мысли
В этой статье мы говорили о МГИЭ или редактировании изображений на основе МКЯМ, МКЯМ-инспирированном исследовании, которое направлено на оценку многомодальных крупномасштабных языковых моделей и анализ того, как они облегчают редактирование с помощью текста или руководящих инструкций, обучаясь для предоставления явных указаний и получения выразительных инструкций одновременно. Модель редактирования МГИЭ понимает визуальную информацию и выполняет редактирование или манипуляцию с помощью обучения от начала до конца. Вместо неоднозначных и кратких указаний рамка МГИЭ производит явные визуально-осведомленные инструкции, что приводит к разумному редактированию изображений.












