Yapay zeka modelleri ve platformları
Stable Video Diffusion: Latent Video Diffusion Modelleri ve Büyük Veri Kümelerine Uygulama
Yaratıcı AI AI topluluğu için bir süredir önemli bir güç olmuştur ve özellikle difüzyon modellerinin kullanımı ile görüntüsel modelleme alanında yapılan ilerlemeler, yaratıcı video modellerinin hem araştırma hem de gerçek dünya uygulamaları açısından önemli ölçüde ilerlemesine yardımcı olmuştur. Geleneksel olarak, yaratıcı video modelleri ya sıfırdan eğitilir ya da kısmen veya tamamen önceden eğitilmiş görüntü modellerinden, ek zaman katmanları ile birlikte, görüntü ve video veri setlerinin bir karışımından eğitilir.
Yaratıcı video modellerindeki ilerlemeleri ileriye taşıyarak, bu makalede Stable Video Diffusion Model hakkında konuşacağız, bu model yüksek çözünürlüklü, state-of-the-art görüntü ve video içeriği oluşturabilen bir laten video difüzyon modelidir. Laten difüzyon modellerinin 2D görüntüler için nasıl eğitildiğini ve nasıl temporal katmanlar eklenerek ve küçük, yüksek kaliteli video veri setlerinde fine-tune edilerek yaratıcı video modellerinin yeteneklerini ve verimliliğini nasıl geliştirdiğini konuşacağız. Stable Video Diffusion Model’in mimarisini ve çalışma şeklini derinlemesine inceleyeceğiz ve çeşitli metriklere göre performansını değerlendireceğiz ve mevcut video oluşturma çerçeveleri ile karşılaştıracağız. Şimdi başlayalım.
Stable Video Diffusion Model ve Yaratıcı Video Modelleri: Bir Giriş
Sınırsız potansiyeli nedeniyle, Yaratıcı AI, AI ve ML uygulayıcıları için bir süredir araştırma konusudur ve son birkaç yıl, görüntüsel modelleme açısından hem verimlilik hem de performans açısından hızlı ilerlemeler görmüştür. Görüntüsel modelleme öğrenimleri, araştırmacıların ve geliştiricilerin yaratıcı video modelleri üzerinde ilerleme kaydetmelerine olanak tanımıştır, bu da daha fazla pratiklik ve gerçek dünya uygulamalarına yol açmıştır. Ancak, yaratıcı video modellerinin yeteneklerini geliştirme amacını taşıyan çoğu araştırma, esas olarak temporal ve mekansal katmanların düzenlenmesine odaklanmaktadır ve veri seçiminin bu yaratıcı modeller üzerindeki etkisini araştırmak için yeterli dikkat gösterilmemektedir.
Görüntüsel modelleme ilerlemeleri sayesinde, araştırmacılar, eğitici veri dağılımının yaratıcı modellerin performansına olan etkisinin önemli ve tartışılmaz olduğunu gözlemlediler. Ayrıca, büyük ve çeşitli bir veri setinde önceden eğitilmiş bir görüntüsel modelin, daha sonra küçük, yüksek kaliteli bir veri setinde fine-tune edilmesi genellikle performansın önemli ölçüde iyileşmesine yol açmaktadır. Geleneksel olarak, yaratıcı video modelleri, başarılı görüntüsel modellerden elde edilen öğrenimleri uygular ve araştırmacılar, veri ve eğitim stratejilerinin etkisini henüz incelememişlerdir. Stable Video Diffusion Model, yaratıcı video modellerinin yeteneklerini geliştirmek için veri seçimi üzerinde özel bir odaklanma ile yeni alanlara yönelmektedir.

Son yaratıcı video modelleri, difüzyon modellerine ve metin veya görüntü koşullandırma yaklaşımlarına dayanarak birden fazla tutarlı video veya görüntü çerçevesi sentezlemekte kullanılmaktadır. Difüzyon modelleri, örnekleri normal dağılımdan yavaş yavaş gürültüsüzleştirmeyi öğrenme yetenekleri ile bilinirler ve yüksek çözünürlüklü video ve metin-görüntü sentezinde istenen sonuçlar vermişlerdir. Aynı ilkeyi temel alarak, Stable Video Diffusion Model, video veri seti üzerinde laten video difüzyon modelini eğitir ve Generatif Karşıt Ağlar (GAN’lar) veya otoregresif modelleri de kullanır.
Stable Video Diffusion Model, hiçbir yaratıcı video modelinin uygulamadığı benzersiz bir strateji izler, çünkü sabit bir mimari ve eğitim stratejisi ile laten video difüzyon temel noktalarına dayanır ve veri kürasyonunun etkisini değerlendirir. Stable Video Diffusion Model, yaratıcı video modellemesi alanında aşağıdaki katkıları hedeflemektedir.
- Yaratıcı video modelleri tarafından kullanılan yüksek kaliteli veri seti oluşturmak için sistematik ve etkili bir veri kürasyon iş akışı sunmak.
- Mevcut çerçevelerden daha iyi performans gösteren, görüntü ve metin-video modelleri eğitmek.
- Modelin 3D anlayışını ve güçlü hareket önceliğini araştırmak için alan spesifik deneyler gerçekleştirmek.
Şimdi, Stable Video Diffusion Model, Laten Video Difüzyon Modelleri ve Veri Kürasyon tekniklerinden öğrenmeleri temel alır.
Laten Video Difüzyon Modelleri
Laten Video Difüzyon Modelleri veya Video-LDM’ler, birincil yaratıcı modeli azaltılmış hesaplama karmaşıklığı ile laten uzayda eğitmeyi hedefler ve çoğu Video-LDM, önceden eğitilmiş metin-görüntü modeli ile temporal karıştırma katmanlarının eklenmesini içerir. Sonuç olarak, çoğu Video Laten Difüzyon Modeli yalnızca temporal katmanları eğitmekte veya eğitime tamamen atlayabilmektedir, oysa Stable Video Diffusion Model tüm çerçeveyi fine-tune etmektedir. Ayrıca, metin-video veri sentezinde, Stable Video Diffusion Model doğrudan metin.promptuna koşullandırılır ve sonuçlar, oluşan çerçevenin kolayca çoklu-görünüm sentezi veya görüntü-video modeline fine-tune edilebileceğini gösterir.
Veri Kürasyonu
Veri Kürasyonu, Stable Video Diffusion Model için olduğu kadar yaratıcı modeller için de temel bir bileşendir, çünkü büyük ölçekli veri setlerinde büyük modelleri önceden eğitmek, dil modelleme, ayırt edici metin-görüntü sentezi gibi çeşitli görevlerde performansı artırmak için gereklidir. Veri Kürasyonu, efektif dil-görüntü temsilinin yeteneklerini kullanarak görüntüsel modellerde başarılı bir şekilde uygulanmıştır, ancak böyle bir tartışma yaratıcı video modelleri geliştirme konusunda hiç odaklanmamıştır. Yaratıcı video modelleri için veri kürasyonu sırasında geliştiriciler beberapa engel ile karşılaşmaktadır ve bu zorlukları gidermek için Stable Video Diffusion Model, üç aşamalı bir eğitim stratejisi uygular, bu da gelişmiş sonuçlar ve performansın önemli ölçüde artmasına yol açar.
Yüksek Kaliteli Video Sentezi için Veri Kürasyonu
Önceki bölümde tartışılan gibi, Stable Video Diffusion Model, üç aşamalı bir eğitim stratejisi uygular, bu da gelişmiş sonuçlar ve performansın önemli ölçüde artmasına yol açar. Aşama I, görüntü ön-eğitimi aşamasıdır ve 2D metin-görüntü difüzyon modeli kullanır. Aşama II, video ön-eğitimi aşamasıdır ve büyük miktarda video verisi üzerinde eğitilir. Son olarak, video fine-tune aşaması için Aşama III vardır ve model, küçük bir yüksek kaliteli ve yüksek çözünürlüklü video alt kümesinde rafine edilir.
Ancak, Stable Video Diffusion Model bu üç aşama uygulamadan önce, verilerin işlenmesi ve etiketlenmesi önemlidir, çünkü bunlar Aşama II veya video ön-eğitimi için temel oluşturur ve optimal çıktıyı sağlamak için kritik bir rol oynar. Maksimum verimlilik için, çerçevede önce üç farklı FPS (Frames Per Second) düzeyinde bir kaskad kesme algılama pipeline’si uygulanır ve bu pipeline’nin gerekliliği aşağıdaki resimde gösterilir.

Daha sonra, Stable Video Diffusion Model her video klipini üç farklı sentetik altyazı yöntemi ile etiketler. Aşağıdaki tablo, Stable Diffüzyon Çerçevesi’nde kullanılan veri setlerini, süzme işleminden önce ve sonra karşılaştırır.

Aşama I: Görüntü Ön-Eğitimi
Stable Video Diffusion Model’de uygulanan üç aşamalı boru hattın ilk aşaması, görüntü ön-eğitimidir ve bunu başarmak için, ilk Stable Video Diffusion Model çerçevesi, Stable Diffusion 2.1 adlı önceden eğitilmiş bir görüntü difüzyon modeli ile desteklenir, bu da daha güçlü görsel temsil sağlar.

Aşama II: Video Ön-Eğitimi
İkinci aşama, Video Ön-Eğitimi aşamasıdır ve multimodal yaratıcı görüntü modellerinde veri kürasyonunun genellikle daha iyi sonuçlar ve artan verimlilik ile birlikte güçlü ayırt edici görüntü oluşturma sağladığı bulgularına dayanır. Ancak, yaratıcı video modelleri için güçlü, hazır temsil kullanıma sunulmadığından, Stable Video Diffusion Model, insan tercihlerini girdi sinyalleri olarak kullanarak uygun bir veri seti oluşturur. Aşağıdaki şekil, çerçeveyi küratörlü bir veri setinde ön-eğitmek için olumlu bir etkiye sahip olduğunu ve genel performansı artırabileceğini gösterir.

Daha spesifik olarak, çerçevede Laten Video Difüzyon’un alt kümelerini küratörlü yöntemler kullanarak oluşturur ve bu veri setlerinde eğitilen LVD modellerinin sıralamasını dikkate alır. Ayrıca, Stable Video Diffusion çerçevesi, küratörlü veri setleri kullanarak eğitmenin çerçevenin performansını artırabileceğini ve difüzyon modelleri için de geçerli olduğunu bulur. Ayrıca, veri kürasyonu stratejisi daha büyük, daha ilgili ve daha pratik veri setlerinde de çalışır. Aşağıdaki şekil, çerçeveyi küratörlü bir veri setinde ön-eğitmek için olumlu bir etkiye sahip olduğunu ve genel performansı artırabileceğini gösterir.

Aşama III: Yüksek Kaliteli Fine-Tune
İki aşama, video ön-eğitimi öncesi performansı iyileştirmeye odaklanırken, üçüncü aşama, yüksek kaliteli video fine-tune ile performansı optimize etmeyi hedefler ve Stable Video Diffusion Model’de bu geçiş nasıl gerçekleştirilir. Aşama III’de, çerçevede laten görüntü difüzyon modellerinden alınan eğitim tekniklerine başvurur ve eğitim örneklerinin çözünürlüğünü artırır. Bu yaklaşımın etkinliğini analiz etmek için, çerçevede üç identical model ile karşılaştırma yapılır, bu modeller yalnızca ağırlıklarının başlatılma şekli ile farklılık gösterir. İlk identical modelin ağırlıkları başlatılır ve video eğitimi atlanır, kalan iki identical modelin ağırlıkları diğer laten video modellerinden alınan ağırlıklarla başlatılır.
Sonuçlar ve Bulgular
Gerçek dünya görevlerinde Stable Video Diffusion çerçevesinin nasıl performans gösterdiğini ve mevcut state-of-the-art çerçeveler ile nasıl karşılaştırıldığını görmeye zamanı geldi. Stable Video Diffusion çerçevesi, ilk olarak optimal veri yaklaşımını kullanarak bir temel modeli eğitmekte ve daha sonra fine-tune ederek birkaç state-of-the-art model oluşturmaktadır, her model belirli bir görevi gerçekleştirir.

Yukarıdaki resim, çerçevenin oluşturduğu yüksek çözünürlüklü görüntü-video örneklerini gösterir, aşağıdaki şekil ise çerçevenin yüksek kaliteli metin-video örnekleri oluşturma yeteneğini gösterir.

Önceden Eğitilmiş Temel Model
Önceden tartışılan gibi, Stable Video Diffusion modeli, Stable Diffusion 2.1 çerçevesine dayanır ve yakın zamanda yapılan bulgulara göre, gürültü programını benimsemek ve gürültüyü artırmak, görüntü difüzyon modellerini eğitmek için daha iyi çözünürlüklü görüntüler elde etmek için gerekliydi. Bu yaklaşıma teşekkürler, Stable Video Diffusion temel modeli, güçlü hareket temsilini öğrenir ve sıfır atışta metin-video oluşturma için temel modellere göre daha iyi performans gösterir, sonuçlar aşağıdaki tabloda gösterilir.

Çerçeveler Arası İnterpolasyon ve Çoklu Görünüm Oluşturma
Stable Video Diffusion çerçevesi, çoklu görünüm veri setlerinde image-video modelini fine-tune eder ve bu model, SVD-MV veya Stable Video Diffusion-Multi View modeli olarak bilinir. Orijinal SVD modeli, iki veri seti ile birlikte fine-tune edilir, bu şekilde çerçeve, tek bir görüntü girişi alır ve çoklu görünüm görüntüleri dizisi olarak çıktı verir.
Aşağıdaki resimlerde görüldüğü gibi, Stable Video Diffusion Multi View çerçevesi, state-of-the-art Scratch Multi View çerçevesine benzer bir performans gösterir ve sonuçlar, SVD-MV’nin orijinal SVD’den öğrenilenleri çoklu görünüm görüntü oluşturma için kullanma yeteneğini gösterir. Ayrıca, sonuçlar modelin nispeten daha az sayıda iterasyon çalıştırılmasının optimal sonuçlar verdiğini de gösterir, bu da SVD çerçevesinden fine-tune edilen çoğu model için geçerlidir.


Yukarıdaki resimde, sol tarafta metriklere işaret ediliyor ve görüldüğü gibi, Stable Video Diffusion Multi View çerçevesi, Scratch-MV ve SD2.1 Multi-View çerçevesinden önemli bir farkla daha iyi performans gösteriyor. İkinci resim, eğitim iterasyonlarının sayısının çerçevenin performansına etkisini gösteriyor ve SVD-MV çerçeveleri, Clip Skorunda sürdürülebilir sonuçlar sağlıyor.
Son Düşünceler
Bu makalede, Stable Video Diffusion hakkında konuştuk, bu model yüksek çözünürlüklü, state-of-the-art görüntü ve video içeriği oluşturabilen bir laten video difüzyon modelidir. Stable Video Diffusion Model, hiçbir yaratıcı video modelinin uygulamadığı benzersiz bir strateji izler, çünkü sabit bir mimari ve eğitim stratejisi ile laten video difüzyon temel noktalarına dayanır ve veri kürasyonunun etkisini değerlendirir.
Laten difüzyon modellerinin 2D görüntüler için nasıl eğitildiğini ve nasıl temporal katmanlar eklenerek ve küçük, yüksek kaliteli video veri setlerinde fine-tune edilerek yaratıcı video modellerinin yeteneklerini ve verimliliğini nasıl geliştirdiğini konuşladık. Stable Video Diffusion Model’in mimarisini ve çalışma şeklini derinlemesine inceleyeceğiz ve çeşitli metriklere göre performansını değerlendireceğiz ve mevcut video oluşturma çerçeveleri ile karşılaştıracağız.
Ayrıca, Stable Video Diffusion çerçevesinin üç farklı video modeli eğitim aşaması vardır ve bu aşamalar bağımsız olarak analiz edilir ve çerçevenin performansına olan etkileri değerlendirilir. Çerçevede, optimal video sentezi için modelleri fine-tune edebilecek bir video temsiliyeti üretilir ve sonuçlar, mevcut state-of-the-art video oluşturma modelleri ile karşılaştırılabilir.












