Модели и платформы ИИ

Стабильная Видеодиффузия: Латентные Видеодиффузионные Модели для Больших Наборов Данных

mm
Добавьте Unite.AI в избранные источники в Google

Генеративный ИИ уже некоторое время является движущей силой в сообществе ИИ, и достижения в области генеративного моделирования изображений, особенно с использованием диффузионных моделей, существенно продвинули вперед генеративные видеомодели не только в исследованиях, но и в реальных приложениях. Традиционно генеративные видеомодели либо обучаются с нуля, либо частично или полностью дообучаются от предварительно обученных моделей изображений с дополнительными временными слоями на смеси изображений и видеоданных.

Развивая достижения в области генеративных видеомоделей, в этой статье мы поговорим о Стабильной Видеодиффузии, латентной видеодиффузионной модели, способной генерировать высококачественный, современный контент от изображения к видео и от текста к видео. Мы обсудим, как латентные диффузионные модели, обученные для синтеза 2D-изображений, улучшили возможности и эффективность генеративных видеомоделей, добавляя временные слои и дообучая модели на небольших наборах высококачественных видео.

Стабильная Видеодиффузия и Генеративные Видеомодели: Введение

Благодаря почти неограниченному потенциалу, Генеративный ИИ стал основной темой исследований для практиков ИИ и МО за последние годы, и последние годы принесли быстрый прогресс как в эффективности, так и в производительности генеративных моделей изображений. Знания, полученные из генеративных моделей изображений, позволили исследователям и разработчикам добиться прогресса в генеративных видеомоделях, что привело к повышению практичности и реальных приложений. Однако большинство исследований, направленных на улучшение возможностей генеративных видеомоделей, в первую очередь фокусируются на точной расстановке временных и пространственных слоев, с небольшим вниманием к изучению влияния выбора правильных данных на результат этих генеративных моделей.

Благодаря прогрессу, достигнутому генеративными моделями изображений, исследователи наблюдали, что влияние распределения обучающих данных на производительность генеративных моделей действительно значимо и неоспоримо. Кроме того, исследователи также отметили, что предварительное обучение генеративной модели изображений на большом и разнообразном наборе данных, за которым следует дообучение на меньшем наборе данных с лучшим качеством, часто приводит к значительному улучшению производительности. Традиционно генеративные видеомодели реализуют знания, полученные из успешных генеративных моделей изображений, и исследователи еще не изучили влияние данных и стратегий обучения. Стабильная Видеодиффузия является попыткой улучшить возможности генеративных видеомоделей, исследуя ранее неисследованные области с особым вниманием к выбору данных.

Недавние генеративные видеомодели полагаются на диффузионные модели и подходы условной генерации для синтеза нескольких последовательных кадров видео или изображений. Диффузионные модели известны своей способностью учиться постепенно очищать образец от нормального распределения, реализуя итеративный процесс уточнения, и они показали желаемые результаты на высококачественном видео и синтезе текста в изображение. Используя тот же принцип в своей основе, Стабильная Видеодиффузия обучает латентную видеодиффузионную модель на своем видеодatasetе вместе с использованием Генеративных Соперничающих сетей (GAN) и даже автoregressive моделей до некоторой степени.

Стабильная Видеодиффузия следует уникальной стратегии, никогда не реализованной никакой генеративной видеомоделью, поскольку она полагается на латентные видеодиффузионные базовые модели с фиксированной архитектурой и фиксированной стратегией обучения, за которой следует оценка влияния кюрации данных. Стабильная Видеодиффузия стремится сделать следующие вклады в область генеративного видеомоделирования.

  1. Представить систематический и эффективный рабочий процесс кюрации данных в попытке превратить большой набор неотобранных видеоэкземпляров в высококачественный набор данных, который затем используется генеративными видеомоделями.
  2. Обучить современные модели изображения в видео и текст в видео, которые превосходят существующие фреймворки.
  3. Провести эксперименты в конкретных областях для изучения понимания 3D и сильного приора движения модели.

Теперь Стабильная Видеодиффузия реализует знания из Латентных Видеодиффузионных Моделей и методов кюрации данных в основе своей основы.

Латентные Видеодиффузионные Модели

Латентные Видеодиффузионные Модели или Video-LDM следуют подходу обучения основной генеративной модели в латентном пространстве с уменьшенной вычислительной сложностью, и большинство Video-LDM реализуют предварительно обученную модель текста в изображение, соединенную с добавлением временных смешивающих слоев в архитектуре предварительного обучения. В результате большинство Латентных Видеодиффузионных Моделей либо обучают только временные слои, либо пропускают процесс обучения совсем, в отличие от Стабильной Видеодиффузии, которая дообучает всю структуру.

Кюрация Данных

Кюрация данных является важным компонентом не только Стабильной Видеодиффузии, но и генеративных моделей в целом, поскольку важно предварительно обучать большие модели на больших наборах данных для повышения производительности по различным задачам, включая моделирование языка, дискриминативную генерацию текста в изображение и многое другое. Кюрация данных была успешно реализована на генеративных моделях изображений, используя возможности эффективных представлений языка-изображения, хотя такие обсуждения никогда не проводились для разработки генеративных видеомоделей. Существует несколько препятствий, с которыми сталкиваются разработчики при кюрации данных для генеративных видеомоделей, и для решения этих проблем Стабильная Видеодиффузия реализует трехэтапную стратегию обучения, в результате чего повышается производительность.

Кюрация Данных для Высококачественного Видеосинтеза

Как обсуждалось в предыдущем разделе, Стабильная Видеодиффузия реализует трехэтапную стратегию обучения, в результате чего повышается производительность. Этап I – это предварительное обучение изображений, которое использует 2D-модель текста в изображение. Этап II – это предварительное обучение видео, в котором структура обучается на большом количестве видеоданных. Наконец, у нас есть Этап III для дообучения видео, в котором модель уточняется на небольшом подмножестве высококачественных и высокоразрешающих видео.

Однако, прежде чем Стабильная Видеодиффузия реализует эти три этапа, важно обработать и аннотировать данные, поскольку они служат основой для Этапа II или этапа предварительного обучения видео, и играют решающую роль в обеспечении оптимального вывода. Для обеспечения максимальной эффективности структура сначала реализует каскадный пайплайн обнаружения срезов на трех различных уровнях кадров в секунду, и необходимость этого пайплайна демонстрируется на следующем изображении.

Далее Стабильная Видеодиффузия аннотирует каждый видеоклип, используя три различных синтетических метода подписывания. Следующая таблица сравнивает наборы данных, использованные в Стабильной Диффузионной Структуре до и после процесса фильтрации.

Этап I: Предварительное Обучение Изображений

Первый этап в трехэтапном пайплайне, реализованном в Стабильной Видеодиффузии, – это предварительное обучение изображений, и для достижения этого исходная Стабильная Видеодиффузионная структура основана на предварительно обученной модели диффузии изображений, а именно модели Стабильная Диффузия 2.1, которая оснащает ее более сильными визуальными представлениями.

Этап II: Предварительное Обучение Видео

Второй этап – это этап предварительного обучения видео, и он основан на знаниях о том, что использование кюрации данных в многомодальных генеративных моделях изображений часто приводит к лучшим результатам и повышению эффективности, а также к мощной дискриминативной генерации изображений. Однако, из-за отсутствия таких же мощных готовых представлений для фильтрации нежелательных образцов для генеративных видеомоделей, Стабильная Видеодиффузия полагается на человеческие предпочтения в качестве входных сигналов для создания подходящего набора данных, используемого для предварительного обучения структуры.

Более конкретно, структура использует различные методы для кюрации подмножеств Латентной Видеодиффузии и учитывает рейтинг моделей LVD, обученных на этих наборах данных. Кроме того, Стабильная Видеодиффузионная структура также обнаруживает, что использование отобранных наборов данных для обучения структуры помогает повысить производительность структуры и диффузионных моделей в целом. Кроме того, стратегия кюрации данных также работает на более крупных, актуальных и практических наборах данных.

Этап III: Высококачественное Уточнение

До этапа II Стабильная Видеодиффузионная структура фокусируется на улучшении производительности до предварительного обучения видео, и на третьем этапе структура подчеркивает оптимизацию или дальнейшее повышение производительности структуры после высококачественного уточнения видео, и как переход от Этапа II к Этапу III достигается в структуре. На Этапе III структура использует методы обучения, заимствованные из латентных моделей диффузии изображений, и увеличивает разрешение примеров обучения.

Результаты и Находки

Пришло время взглянуть, как Стабильная Видеодиффузионная структура работает на реальных задачах и как она сравнивается с текущим состоянием фреймворков. Стабильная Видеодиффузионная структура сначала использует оптимальный подход к данным для обучения базовой модели, а затем выполняет уточнение для генерации нескольких современных моделей, каждая из которых выполняет конкретную задачу.

Вышеуказанное изображение представляет собой высококачественные образцы изображения в видео, сгенерированные структурой, в то время как следующее изображение демонстрирует способность структуры генерировать высококачественные образцы текста в видео.

Предварительно Обученная Базовая Модель

Как обсуждалось ранее, Стабильная Видеодиффузионная модель основана на фреймворке Стабильная Диффузия 2.1, и на основе недавних находок было важно для разработчиков принять график шума и увеличить шум, чтобы получить изображения с лучшим разрешением при обучении моделей диффузии изображений. Благодаря этому подходу, базовая модель Стабильной Видеодиффузии учится мощным представлениям движения, и в процессе превосходит базовые модели для генерации видео из текста в нулевой установке, и результаты отображаются в следующей таблице.

Интерполяция Кадров и Мультивидовая Генерация

Стабильная Видеодиффузионная структура дообучает модель изображения в видео на мультивидовых наборах данных, чтобы получить несколько новых видов объекта, и эта модель известна как SVD-MV или Стабильная Видеодиффузия – Мультивидовая модель. Оригинальная модель SVD дообучается с помощью двух наборов данных таким образом, что структура вводит одно изображение и возвращает последовательность мультивидовых изображений в качестве вывода.

Как можно увидеть на следующих изображениях, Стабильная Видеодиффузионная Мультивидовая структура демонстрирует высокую производительность, сравнимую с современными фреймворками Scratch Мультивидовой, и результаты являются четким демонстрацией способности SVD-MV использовать знания, полученные из оригинальной структуры SVD для мультивидовой генерации изображений. Кроме того, результаты также указывают на то, что запуск модели на относительно меньшем количестве итераций помогает достичь оптимальных результатов, как и в случае с большинством моделей, дообученных из структуры SVD.

На приведенном выше изображении метрики указаны слева, и как можно увидеть, Стабильная Видеодиффузионная Мультивидовая структура превосходит Scratch-MV и SD2.1 Мультивидовую структуру на приличный отрыв. Второе изображение демонстрирует эффект количества итераций обучения на общую производительность структуры в терминах Clip Score, и структуры SVD-MV демонстрируют устойчивые результаты.

Окончательные Мысли

В этой статье мы говорили о Стабильной Видеодиффузии, латентной видеодиффузионной модели, способной генерировать высококачественный, современный контент от изображения к видео и от текста к видео. Стабильная Видеодиффузия следует уникальной стратегии, никогда не реализованной никакой генеративной видеомоделью, поскольку она полагается на латентные видеодиффузионные базовые модели с фиксированной архитектурой и фиксированной стратегией обучения, за которой следует оценка влияния кюрации данных.

Мы говорили о том, как латентные диффузионные модели, обученные для синтеза 2D-изображений, улучшили возможности и эффективность генеративных видеомоделей, добавляя временные слои и дообучая модели на небольших наборах высококачественных видео. Для сбора предварительных данных структура проводит масштабное исследование и следует системным практикам сбора данных, и в конечном итоге предлагает метод кюрации большого количества видеоданных и преобразования шумных видео в входные данные, подходящие для генеративных видеомоделей.

Кроме того, Стабильная Видеодиффузионная структура использует три различных этапа обучения видеомоделей, которые анализируются независимо для оценки их влияния на производительность структуры. Структура в конечном итоге выводит видеопредставление, достаточно мощное для дообучения моделей для оптимального видеосинтеза, и результаты сравнимы с современными видеогенерационными моделями, уже используемыми.

"Инженер по профессии, писатель по сердцу". Кунал - технический писатель с глубокой любовью и пониманием ИИ и МО, посвященный упрощению сложных концепций в этих областях посредством своей увлекательной и информативной документации.