Модели и платформы ИИ

Само-внимание Руководство: Улучшение качества образцов диффузионных моделей

mm
Добавьте Unite.AI в избранные источники в Google

Диффузионные модели являются генеративными моделями ИИ, которые синтезируют изображения из шума посредством итеративного процесса денойзинга. Они известны своими исключительными возможностями генерации изображений и разнообразием, в основном благодаря методам руководства, основанным на тексте или классе, включая руководство классификатора и руководство без классификатора. Эти модели были особенно успешны в создании разнообразных, высококачественных изображений. Недавние исследования показали, что методы руководства, такие как подписи классов и метки, играют важную роль в улучшении качества генерируемых изображений.

Однако диффузионные модели и методы руководства сталкиваются с ограничениями в определенных внешних условиях. Метод руководства без классификатора (CFG), который использует удаление меток, добавляет сложность к процессу обучения, а метод руководства классификатора (CG) требует дополнительного обучения классификатора. Оба метода несколько ограничены своей зависимостью от внешних условий, что ограничивает их потенциал и ограничивает их условными настройками.

Чтобы устранить эти ограничения, разработчики сформулировали более общий подход к руководству диффузией, известный как Само-внимание Руководство (SAG). Этот метод использует информацию из промежуточных образцов диффузионных моделей для генерации изображений. Мы рассмотрим SAG в этой статье, обсуждая его работу, методологию и результаты по сравнению с текущими передовыми фреймворками и конвейерами.

Само-внимание Руководство: Улучшение качества образцов диффузионных моделей

Диффузионные модели (DDM) получили популярность благодаря своей способности создавать изображения из шума посредством итеративного процесса денойзинга. Способность синтеза изображений этих моделей в основном обусловлена использованными методами руководства диффузии. Несмотря на их сильные стороны, диффузионные модели и методы, основанные на руководстве, сталкиваются с проблемами, такими как добавленная сложность и увеличенные вычислительные затраты.

Чтобы преодолеть текущие ограничения, разработчики ввели метод Само-внимание Руководство, более общую формулировку руководства диффузии, не зависящую от внешней информации от руководства диффузии, тем самым облегчая условно-безопасный и гибкий подход к руководству диффузионными фреймворками. Подход, выбранный Само-вниманием Руководством, в конечном итоге помогает улучшить применимость традиционных методов руководства диффузии к случаям с или без внешних требований.

Само-внимание Руководство основано на простом принципе общей формулировки и предположении, что внутренняя информация, содержащаяся в промежуточных образцах, может служить руководством. На основе этого принципа метод SAG сначала вводит Руководство Размытием, простое и прямое решение для улучшения качества образцов. Руководство размытием направлено на использование полезных свойств гауссовского размытия для удаления мелкомасштабных деталей естественным образом, руководя промежуточными образцами с помощью исключенной информации в результате гауссовского размытия. Хотя метод Руководства Размытием действительно улучшает качество образцов с умеренным масштабом руководства, он не может воспроизвести результаты на большом масштабе руководства, поскольку часто вводит структурную двусмысленность во всем регионе.

Чтобы улучшить стабильность и эффективность метода Руководства Размытием на более крупном масштабе руководства, Само-внимание Руководство пытается использовать механизм само-внимания диффузионных моделей, поскольку современные диффузионные модели уже содержат механизм само-внимания в своей архитектуре.

С предположением, что само-внимание является важным для захвата существенной информации в своем ядре, метод Само-внимания Руководство использует карты само-внимания диффузионных моделей для противостоящего размытия регионов, содержащих существенную информацию, и в процессе руководства диффузионными моделями с необходимой остаточной информацией. Затем метод использует карты внимания во время обратного процесса диффузионных моделей для улучшения качества изображений и использует само-условие для уменьшения артефактов без необходимости дополнительного обучения или внешней информации.

Чтобы суммировать, метод Само-внимания Руководство

  1. Является новым подходом, который использует внутренние карты само-внимания диффузионных фреймворков для улучшения качества сгенерированных образцов без необходимости дополнительного обучения или внешних условий.
  2. Метод SAG пытается обобщить условные методы руководства в условно-безопасный метод, который можно интегрировать с любой диффузионной моделью без необходимости дополнительных ресурсов или внешних условий, тем самым улучшая применимость фреймворков, основанных на руководстве.
  3. Метод SAG также пытается продемонстрировать свои ортогональные способности по отношению к существующим условным методам и фреймворкам, тем самым облегчая улучшение производительности путем облегчения гибкой интеграции с другими методами и моделями.

Переходя к следующему, метод Само-внимания Руководство учитывает результаты связанных фреймворков, включая Диффузионные Модели, Руководство Образцов, Методы Само-Внимания ИИ и Внутренние Представления Диффузионных Моделей. Однако в своей основе метод Само-внимания Руководство реализует результаты из DDPM или Диффузионных Вероятностных Моделей, Руководства Классификатора, Руководства без Классификатора и Само-Внимания в Диффузионных Фреймворках.

Само-внимание Руководство: Предварительные условия, Методология и Архитектура

Диффузионная Вероятностная Модель или DDPM

DDPM или Диффузионная Вероятностная Модель – это модель, которая использует итеративный процесс денойзинга для восстановления изображения из белого шума. Традиционно модель DDPM получает входное изображение и график дисперсии на временном шаге для получения изображения с помощью прямого процесса, известного как Марковский процесс.

Классификатор и Классификатор-безопасное Руководство с Реализацией GAN

GAN или Генеративные Противостоящие Сети обладают уникальной торговой разнообразностью для верности, и для того, чтобы принести эту способность фреймворков GAN к диффузионным моделям, фреймворк Само-внимания Руководство предлагает использовать метод руководства классификатора, который использует дополнительный классификатор. Напротив, метод руководства без классификатора также может быть реализован без использования дополнительного классификатора для достижения одних и тех же результатов. Хотя метод доставляет желаемые результаты, он все еще не вычислительно жизнеспособен, поскольку требует дополнительных меток, и также ограничивает фреймворк условными диффузионными моделями, которые требуют дополнительных условий, таких как текст или класс, а также дополнительных деталей обучения, которые добавляют к сложности модели.

Обобщение Руководства Диффузии

Хотя методы руководства классификатора и руководства без классификатора доставляют желаемые результаты и помогают условной генерации в диффузионных моделях, они зависят от дополнительных входных данных. Для любого заданного временного шага входные данные для диффузионной модели состоят из обобщенного условия и искаженного образца без обобщенного условия. Кроме того, обобщенное условие охватывает внутреннюю информацию в искаженном образце или внешнее условие, или даже оба. Результативное руководство формулируется с использованием воображаемого регрессора с предположением, что оно может предсказать обобщенное условие.

Улучшение качества изображений с помощью карт само-внимания

Обобщенное руководство диффузии подразумевает, что возможно предоставить руководство обратному процессу диффузионных моделей, извлекая существенную информацию в обобщенном условии, содержащемся в искаженном образце. Основываясь на этом, метод Само-внимания Руководство захватывает существенную информацию для обратных процессов эффективно, ограничивая риски, возникающие в результате проблем вне распределения в предварительно обученных диффузионных моделях.

Руководство Размытием

Руководство размытием в Само-внимании Руководстве основано на гауссовском размытии, линейном методе фильтрации, при котором входной сигнал сворачивается с гауссовским фильтром для генерации выхода. С увеличением стандартного отклонения гауссовское размытие уменьшает мелкомасштабные детали в входных сигналах и приводит к локально неразличимым входным сигналам, сглаживая их к константе.

На основе этого обучения фреймворк Само-внимания Руководство вводит Руководство Размытием, технику, которая намеренно исключает информацию из промежуточных реконструкций во время процесса диффузии и вместо этого использует эту информацию для руководства своими предсказаниями для увеличения релевантности изображений к входной информации. Руководство размытием по сути вызывает отклонение исходного предсказания от размытого входного предсказания.

В конвейере Само-внимания Руководство входной сигнал сначала размыт с помощью гауссовского фильтра, а затем диффундирован с дополнительным шумом для производства выходного сигнала. Делая это, конвейер SAG смягчает побочный эффект результирующего размытия, которое уменьшает гауссовский шум, и делает руководство зависящим от содержания, а не от случайного шума.

Эти результаты могут быть результатом структурной двусмысленности, введенной в фреймворк глобальным размытием, что делает его трудным для конвейера SAG выровнять предсказания исходного входа с деградированным входом, в результате чего получаются шумные выходы.

Механизм Само-Внимания

Как упоминалось ранее, диффузионные модели обычно имеют встроенный компонент само-внимания, и это один из наиболее важных компонентов в фреймворке диффузионной модели. Механизм само-внимания реализован в ядре диффузионных моделей и позволяет модели обращать внимание на существенные части входных данных во время генеративного процесса, как показано на следующем изображении с высокочастотными масками в верхней строке и масками само-внимания в нижней строке окончательно сгенерированных изображений.

Предложенный метод Само-внимания Руководство строится на том же принципе и использует возможности карт само-внимания в диффузионных моделях. В целом метод Само-внимания Руководство размыт само-внимаемые патчи в входном сигнале или, в простых словах, скрывает информацию патчей, на которые обращает внимание диффузионная модель. Кроме того, выходные сигналы в Само-внимании Руководстве содержат целые регионы входных сигналов, что означает, что они не приводят к структурной двусмысленности входных данных и решают проблему глобального размытия.

Само-внимание Руководство: Эксперименты и Результаты

Чтобы оценить его производительность, конвейер Само-внимания Руководство был отобран с помощью 8 Nvidia GeForce RTX 3090 GPU и построен на предварительно обученных фреймворках IDDPM, ADM и Стабильной Диффузии.

Безусловная Генерация с Само-вниманием Руководством

Чтобы измерить эффективность конвейера SAG на безусловных моделях и продемонстрировать условно-безопасное свойство, не обладающее руководством классификатора и руководством без классификатора, конвейер SAG был запущен на безусловно предварительно обученных фреймворках на 50 тысячах образцов.

Как можно наблюдать, реализация конвейера SAG улучшает метрики FID, sFID и IS входных данных, а также снижает значение recall. Кроме того, качественные улучшения в результате реализации конвейера SAG очевидны на следующих изображениях, где изображения в верхней части являются результатами фреймворков ADM и Стабильной Диффузии, а изображения в нижней части являются результатами фреймворков ADM и Стабильной Диффузии с конвейером SAG.

Условная Генерация с SAG

Интеграция конвейера SAG в существующие фреймворки доставляет исключительные результаты в безусловной генерации, и конвейер SAG способен условно-агностически, что позволяет конвейеру SAG быть реализованным для условной генерации.

Стабильная Диффузия с Само-вниманием Руководством

Хотя исходный фреймворк Стабильной Диффузии генерирует высококачественные изображения, интеграция фреймворка Стабильной Диффузии с конвейером Само-внимания Руководство может значительно улучшить результаты. Чтобы оценить его эффект, разработчики используют пустые подсказки для Стабильной Диффузии с случайным семенем для каждой пары изображений и используют оценку человека на 500 парах изображений с и без Само-внимания Руководства.

Кроме того, реализация SAG может улучшить возможности фреймворка Стабильной Диффузии, поскольку слияние руководства без классификатора с Само-вниманием Руководством может расширить диапазон моделей Стабильной Диффузии до синтеза изображения из текста. Кроме того, сгенерированные изображения из модели Стабильной Диффузии с Само-вниманием Руководством имеют более высокое качество с меньшим количеством артефактов благодаря само-условному эффекту конвейера SAG.

Текущие Ограничения

Хотя реализация конвейера Само-внимания Руководство может существенно улучшить качество сгенерированных изображений, она имеет некоторые ограничения.

Одним из основных ограничений является ортогональность с руководством классификатора и руководством без классификатора. Как можно наблюдать на следующем изображении, реализация SAG улучшает метрику FID и предсказательную метрику, что означает, что конвейер SAG содержит ортогональный компонент, который может быть использован с традиционными методами руководства одновременно.

Однако это все еще требует, чтобы диффузионные модели были обучены определенным образом, что добавляет к сложности, а также вычислительным затратам.

Кроме того, реализация Само-внимания Руководства не увеличивает потребление памяти или времени, что указывает на то, что накладные расходы, возникающие в результате операций, таких как маскирование и размытие в SAG, являются незначительными. Однако это все еще добавляет к вычислительным затратам, поскольку включает в себя дополнительный шаг по сравнению с подходами без руководства.

Окончательные Мысли

В этой статье мы говорили о Само-внимании Руководстве, новом и общем подходе к методу руководства, который использует внутреннюю информацию, доступную в диффузионных моделях, для генерации высококачественных изображений. Само-внимание Руководство основано на простом принципе общей формулировки и предположении, что внутренняя информация, содержащаяся в промежуточных образцах, может служить руководством. Конвейер Само-внимания Руководство является условно-безопасным и обучающим подходом, который может быть реализован в различных диффузионных моделях, и использует само-условие для уменьшения артефактов в сгенерированных изображениях и улучшения общего качества.

"Инженер по профессии, писатель по сердцу". Кунал - технический писатель с глубокой любовью и пониманием ИИ и МО, посвященный упрощению сложных концепций в этих областях посредством своей увлекательной и информативной документации.