Модели и платформы ИИ

AnimateLCM: Ускорение анимации персонализированных диффузионных моделей

mm
Добавьте Unite.AI в избранные источники в Google

За последние несколько лет диффузионные модели достигли огромного успеха и признания в задачах генерации изображений и видео. Видеодиффузионные модели, в частности, привлекают значительное внимание благодаря своей способности производить видео с высокой связностью и верностью. Эти модели генерируют высококачественные видео, используя итеративный процесс денойзинга в своей архитектуре, который постепенно преобразует высокоразмерный гауссовский шум в реальные данные.

Стабильная диффузия является одной из наиболее представительных моделей для генеративных задач изображений, полагаясь на вариационный автоэнкодер (VAE) для сопоставления реального изображения и xuốngэмплированных латентных признаков. Это позволяет модели уменьшить генеративные затраты, а механизм кросс-аттенции в ее архитектуре облегчает текст-условленную генерацию изображений. Более недавно стабильная диффузионная модель заложила основу для нескольких плагинных адаптеров для достижения более инновационных и эффективных генераций изображений или видео. Однако итеративный генеративный процесс, используемый большинством видеодиффузионных моделей, делает процесс генерации изображений длительным и относительно дорогим, ограничивая его применение.

В этой статье мы поговорим об AnimateLCM, персонализированной диффузионной модели с адаптерами, направленной на генерацию высококачественных видео с минимальными шагами и вычислительными затратами. Фреймворк AnimateLCM вдохновлен моделью последовательности, которая ускоряет выборку с минимальными шагами, дистиллируя предварительно обученные диффузионные модели изображений. Кроме того, успешное расширение модели последовательности, латентная модель последовательности (LCM), облегчает условную генерацию изображений. Вместо проведения обучения последовательности непосредственно на сырых видеоданных, фреймворк AnimateLCM предлагает использовать декуплированную стратегию обучения последовательности. Эта стратегия декуплирует дистилляцию приоров генерации движения и приоров генерации изображений, позволяя модели повысить визуальное качество сгенерированного контента и улучшить эффективность обучения одновременно. Кроме того, модель AnimateLCM предлагает обучать адаптеры с нуля или адаптировать существующие адаптеры к своей дистиллированной видеомодели последовательности. Это облегчает комбинацию плагинных адаптеров в семействе стабильных диффузионных моделей для достижения различных функций без ущерба для скорости выборки.

Эта статья направлена на углубленное освещение фреймворка AnimateLCM. Мы исследуем механизм, методологию и архитектуру фреймворка, а также его сравнение с передовыми фреймворками генерации изображений и видео. Итак, начнем.

AnimateLCM: Анимация персонализированных диффузионных моделей

Диффузионные модели стали основным фреймворком для задач генерации изображений и видео благодаря их эффективности и возможностям в генеративных задачах. Большинство диффузионных моделей полагаются на итеративный процесс денойзинга для генерации изображений, который постепенно преобразует высокоразмерный гауссовский шум в реальные данные. Хотя этот метод дает удовлетворительные результаты, итеративный процесс и количество итераций замедляют процесс генерации и добавляют к вычислительным требованиям диффузионных моделей, которые намного медленнее других генеративных фреймворков, таких как GAN или Генеративные противостоящие сети. В последние годы модели последовательности или CM были предложены как альтернатива итеративным диффузионным моделям для ускорения процесса генерации, сохраняя при этом вычислительные требования постоянными.

Выделение моделей последовательности заключается в том, что они учатся отображениям последовательности, которые сохраняют самопоследовательность траекторий, введенных предварительно обученными диффузионными моделями. Процесс обучения моделей последовательности позволяет им генерировать высококачественные изображения с минимальными шагами и исключает необходимость вычислительно интенсивных итераций. Кроме того, латентная модель последовательности или LCM, построенная на основе стабильного диффузионного фреймворка, может быть интегрирована в веб-интерфейс с существующими адаптерами для достижения различных дополнительных функций, таких как реальное время перевода изображения в изображение. По сравнению с этим, хотя существующие видеодиффузионные модели дают удовлетворительные результаты, прогресс еще предстоит сделать в области ускорения выборки видео, и это имеет большое значение из-за высоких вычислительных затрат на генерацию видео.

Это приводит нас к AnimateLCM, фреймворку высококачественной генерации видео, который требует минимального количества шагов для задач генерации видео. Следуя латентной модели последовательности, фреймворк AnimateLCM рассматривает обратный процесс диффузии как решение CFG или классификаторно-свободного руководства по вероятностному потоку, и обучает модель предсказывать решение такого вероятностного потока напрямую в латентном пространстве. Однако вместо проведения обучения последовательности на сырых видеоданных напрямую, что требует высоких тренировочных и вычислительных ресурсов и часто приводит к плохому качеству, фреймворк AnimateLCM предлагает использовать декуплированную стратегию обучения последовательности. Эта стратегия декуплирует дистилляцию приоров генерации движения и приоров генерации изображений.

Фреймворк AnimateLCM сначала проводит дистилляцию последовательности для адаптации базовой диффузионной модели изображений к модели последовательности изображений, а затем проводит 3D-инфляцию как модели последовательности изображений, так и диффузионных моделей изображений для учета 3D-признаков. В конечном итоге фреймворк AnimateLCM получает видеомодель последовательности, проводя дистилляцию последовательности на видеоданных. Кроме того, для смягчения потенциального повреждения признаков в результате процесса диффузии фреймворк AnimateLCM также предлагает использовать стратегию инициализации. Поскольку фреймворк AnimateLCM построен на основе стабильного диффузионного фреймворка, он может заменить пространственные веса своей обученной видеомодели последовательности на публично доступные персонализированные веса диффузионных моделей изображений для достижения инновационных результатов генерации.

Кроме того, для обучения конкретных адаптеров с нуля или для лучшей адаптации публично доступных адаптеров фреймворк AnimateLCM предлагает эффективную стратегию ускорения для адаптеров, которые не требуют обучения конкретных моделей учителей.

Вклад фреймворка AnimateLCM можно очень хорошо суммировать как: Предлагаемый фреймворк AnimateLCM направлен на достижение высококачественной, быстрой и высококачественной генерации видео, и для этого фреймворк AnimateLCM предлагает декуплированную стратегию дистилляции, которая декуплирует приоры генерации движения и приоры генерации изображений, в результате чего получается лучшее качество генерации и повышенная эффективность обучения.

InstantID: Методология и Архитектура

В своей основе фреймворк InstantID черпает вдохновение из диффузионных моделей и стратегий ускорения выборки. Диффузионные модели, также известные как модели на основе оценок, продемонстрировали замечательные возможности генерации изображений. Под руководством направления оценки итеративная стратегия выборки, реализованная диффузионными моделями, постепенно очищает зашумленные данные. Эффективность диффузионных моделей является одной из основных причин, почему они используются большинством видеодиффузионных моделей путем обучения на добавленных временных слоях. С другой стороны, стратегии ускорения выборки и ускорения помогают решить проблему медленных скоростей генерации в диффузионных моделях. Метод ускорения на основе дистилляции настраивает исходные веса диффузионной модели с помощью уточненной архитектуры или планировщика для улучшения скорости генерации.

Двигаясь дальше, фреймворк InstantID построен на основе стабильной диффузионной модели, что позволяет InstantID применять соответствующие понятия. Модель рассматривает дискретный прямой процесс диффузии как непрерывное время сохраняющейся дисперсии СДЕ. Кроме того, стабильная диффузионная модель является расширением DDPM или денойзинговой диффузионной вероятностной модели, в которой точка обучающих данных постепенно нарушается дискретной цепью Маркова с ядром нарушения, позволяющей распределению шумных данных в разных временных шагах следовать распределению.

Для достижения высококачественной генерации видео с минимальным количеством шагов фреймворк AnimateLCM приручает стабильные диффузионные видеомодели для следования свойству самопоследовательности. Общая структура обучения фреймворка AnimateLCM состоит из декуплированной стратегии обучения последовательности для адаптации учителя и эффективного обучения последовательности.

Переход от Диффузионных Моделей к Моделям Последовательности

Фреймворк AnimateLCM вводит свою собственную адаптацию стабильной диффузионной модели или DM к модели последовательности или CM, следующей за проектированием латентной модели последовательности или LCM. Стоит отметить, что хотя стабильные диффузионные модели обычно предсказывают шум, добавленный к образцам, они являются сущностными сигма-диффузионными моделями. Это контрастирует с моделями последовательности, которые направлены на предсказание решения траектории PF-ODE напрямую. Кроме того, в стабильных диффузионных моделях с определенными параметрами важно для модели использовать стратегию классификаторно-свободного руководства для генерации высококачественных изображений. Фреймворк AnimateLCM, однако, использует классификаторно-свободное руководство, дополненное решателем ОДЕ, для выборки соседних пар в одной и той же траектории, в результате чего получается лучшая эффективность и качество.

Декуплированное Обучение Последовательности

Для процесса дистилляции последовательности разработчики наблюдали, что данные, используемые для обучения, сильно влияют на качество окончательной генерации моделей последовательности. Однако основной проблемой с публично доступными наборами данных в настоящее время является то, что они часто состоят из водяных данных или имеют низкое качество и могут содержать слишком краткие или двусмысленные подписи. Кроме того, обучение модели непосредственно на видео с большим разрешением является вычислительно дорогим и длительным, что делает его нецелесообразным вариантом для большинства исследователей.

Учитывая наличие отфильтрованных высококачественных наборов данных, фреймворк AnimateLCM предлагает декуплировать дистилляцию приоров генерации движения и приоров генерации изображений. Более конкретно, фреймворк AnimateLCM сначала дистиллирует стабильные диффузионные модели в модели последовательности изображений с помощью отфильтрованных высококачественных наборов данных изображений и текста с лучшим разрешением. Затем фреймворк обучает легкие веса LoRA на слоях стабильной диффузионной модели, замораживая веса стабильной диффузионной модели. Как только модель настраивает веса LoRA, она работает как универсальный модуль ускорения и продемонстрировала свою совместимость с другими персонализированными моделями в сообществе стабильных диффузионных моделей. Для вывода фреймворк AnimateLCM объединяет веса LoRA с исходными весами без нарушения скорости вывода.

Важно признать, что хотя пространственные веса LoRA предназначены для ускорения процесса выборки без учета временной модели, и временные модули разрабатываются с помощью стандартных методов диффузии, их прямая интеграция склонна к коррупции представления в начале обучения. Это представляет значительные проблемы в эффективном и эффективном объединении их с минимальным конфликтом. Через эмпирические исследования фреймворк AnimateLCM определил успешный подход к инициализации, который не только использует приоры последовательности из пространственных весов LoRA, но и смягчает негативные эффекты их прямого объединения.

В начале обучения последовательности предварительно обученные пространственные веса LoRA интегрируются исключительно в онлайн-модель последовательности, сохраняя целевую модель последовательности от вставки. Эта стратегия обеспечивает, что целевая модель, служащая образовательным руководством для онлайн-модели, не генерирует ошибочные прогнозы, которые могли бы негативно повлиять на процесс обучения онлайн-модели. На протяжении всего периода обучения веса LoRA постепенно включаются в целевую модель последовательности через процесс экспоненциального скользящего среднего (EMA), достигая оптимального баланса весов после нескольких итераций.

Адаптация без Учителя

Стабильные диффузионные модели и плагинные адаптеры часто идут рука об руку. Однако было наблюдено, что хотя плагинные адаптеры работают до некоторой степени, они склонны терять контроль над деталями, даже когда большинство этих адаптеров обучены с помощью моделей диффузии изображений. Чтобы противостоять этой проблеме, фреймворк AnimateLCM выбирает адаптацию без учителя, простую, но эффективную стратегию, которая либо адаптирует существующие адаптеры для лучшей совместимости, либо обучает адаптеры с нуля. Этот подход позволяет фреймворку AnimateLCM достигать контролируемой генерации видео и генерации изображения в видео с минимальным количеством шагов без необходимости в моделях учителей.

AnimateLCM: Эксперименты и Результаты

Фреймворк AnimateLCM использует стабильную диффузию v1-5 в качестве базовой модели и реализует решатель ОДЕ DDIM для целей обучения. Фреймворк также применяет стабильную диффузию v1-5 с открытыми весами движения в качестве модели видеодиффузии учителя с экспериментами, проводимыми на наборе данных WebVid2M без дополнительных или дополненных данных. Кроме того, фреймворк использует набор данных TikTok с подписями BLIP для контролируемой генерации видео.

Качественные Результаты

Следующая фигура демонстрирует результаты четырехшагового метода генерации, реализованного фреймворком AnimateLCM, в генерации видео из текста, генерации видео из изображения и контролируемой генерации видео.

Как можно наблюдать, результаты, доставленные каждым из них, удовлетворительны, и сгенерированные результаты демонстрируют способность фреймворка AnimateLCM следовать свойству последовательности даже с различными шагами вывода, сохраняя подобное движение и стиль.

Количественные Результаты

Следующая фигура иллюстрирует количественные результаты и сравнение фреймворка AnimateLCM с методами DDIM и DPM++.

Как можно наблюдать, фреймворк AnimateLCM превосходит существующие методы на значительную величину, особенно в режиме с низким количеством шагов, варьирующемся от 1 до 4 шагов. Кроме того, метрики AnimateLCM, представленные в этом сравнении, оцениваются без использования CFG или классификаторно-свободного руководства, что позволяет фреймворку сэкономить почти 50% времени вывода и пиковой памяти. Кроме того, для дальнейшей проверки его производительности пространственные веса внутри фреймворка AnimateLCM заменяются на публично доступную персонализированную реалистичную модель, которая хорошо балансирует верность и разнообразие, что помогает повысить производительность еще больше.

Окончательные Мысли

В этой статье мы говорили об AnimateLCM, персонализированной диффузионной модели с адаптерами, направленной на генерацию высококачественных видео с минимальными шагами и вычислительными затратами. Фреймворк AnimateLCM вдохновлен моделью последовательности, которая ускоряет выборку с минимальными шагами, дистиллируя предварительно обученные диффузионные модели изображений, и успешным расширением модели последовательности, латентной модели последовательности или LCM, которая облегчает условную генерацию изображений. Вместо проведения обучения последовательности на сырых видеоданных напрямую фреймворк AnimateLCM предлагает использовать декуплированную стратегию обучения последовательности, которая декуплирует дистилляцию приоров генерации движения и приоров генерации изображений, позволяя модели повысить визуальное качество сгенерированного контента и улучшить эффективность обучения одновременно.

"Инженер по профессии, писатель по сердцу". Кунал - технический писатель с глубокой любовью и пониманием ИИ и МО, посвященный упрощению сложных концепций в этих областях посредством своей увлекательной и информативной документации.