Yapay zeka modelleri ve platformları

CameraCtrl: T2V Nesil için Kamera Kontrolü Sağlama

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Son yıllarda, metin-den videoya veya T2V üretimi için çalışan çerçeveler, eğitim süreçlerinde stabilitenin sağlanmasına yardımcı olmak için difüzyon modellerini kullanmaya çalışıyorlar ve Video Difüzyon Modeli, metin-den videoya üretim çerçevelerinin öncülerinden biri olarak, 2B görüntü difüzyon mimarisini video verilerini kapsayacak şekilde genişletmeye çalışıyor ve modeli video ve görüntü birlikte, sıfırdan eğitiyor. Aynı zamanda, güçlü bir önceden eğitilmiş görüntü üreticisi olan Stable Diffusion’u uygulamak için, son çalışmalar 2B mimariyi, zaman içinde katmanlar ekleyerek genişletiyorlar ve yeni modeli, görmediği büyük veri setlerinde ayarlıyor. Buna rağmen, metin-den videoya difüzyon modelleri önemli bir zorlukla karşılaşıyorlar, çünkü yalnızca kullanılan metin açıklamalarına dayanarak video örneği üretmenin belirsizliği, metin-den videoya modelinin üretimi üzerinde zayıf kontrol olmasına neden oluyor. Bu sınırlamayı aşmak için, bazı modeller daha gelişmiş rehberlik sağlarken, diğerleri videoya精确 kontrol sağlamak için precisa sinyallerle çalışıyorlar. Diğer yandan, bazı metin-den videoya çerçeveleri, video üreticisine kontrol sinyali olarak görüntüleri kullanıyor, bu da ya doğru zaman ilişkisi modellemesi ya da yüksek video kalitesi ile sonuçlanıyor.

Görüntü ve video üretimi görevlerinde kontrol edilebilirlik çok önemli bir rol oynuyor, çünkü kullanıcıların istedikleri içeriği oluşturmasına olanak tanıyor. Ancak mevcut çerçeveler genellikle kamera pozunun precisa kontrolünü göz ardı ediyor, bu da modelin daha derin anlatımları daha iyi ifade etmesine yardımcı olan sinematik bir dil olarak hareket ediyor. Mevcut kontrol edilebilirlik sınırlamalarını aşmak için, bu makalede CameraCtrl adlı yeni bir fikir hakkında konuşacağız, bu fikir metin-den videoya modelleri için precisa kamera poz kontrolü sağlamaya çalışıyor. Kamera traijektörünü precisa parametreleştirerek, model bir metin-den videoya modeline bir oynatma ve çalıştırma kamera modülü eğitir ve diğer bileşenleri dokunmadan bırakır. Ayrıca, CameraCtrl modeli çeşitli veri setlerinin etkisini kapsamlı bir şekilde incelemeye çalışır ve benzer görünümde ve çeşitli kamera dağılımına sahip videoların, modelin genel kontrol edilebilirlik ve genelleme yeteneklerini artırabileceğini önerir. Gerçek dünya görevlerinde CameraCtrl modelinin performansını analiz etmek için yapılan deneyler, precisa ve domaine-adaptif kamera kontrolü sağlamakta çerçevenin verimliliğini gösteriyor, kamera pozundan ve metinsel girdilerden hareketle özelleştirilmiş ve dinamik video üretimi için bir yol açıyor.

Bu makale, CameraCtrl çerçevesini derinlemesine incelemeyi amaçlıyor, mekanizmasını, metodolojisini, mimarisini ve diğer çerçevelerle karşılaştırmayı探iyoruz. Şimdi başlayalım.

CameraCtrl: T2V Nesil için Kamera Kontrolü

Son yıllarda, difüzyon modellerinin gelişimi ve ilerlemesi, metin-den videoya üretimini önemli ölçüde geliştirdi ve içerik tasarım akışlarını devrimleştirerek, kontrol edilebilirlik önemli bir rol oynuyor. Uygulamalı video üretimi uygulamalarında, yüksek kontrol edilebilirlik, modelin gerçekliği, kalitesi ve ürettiği videoların kullanılabilirliğini artırmasına yardımcı oluyor. Metin ve görüntü girdileri genellikle modeller tarafından kontrol edilebilirliği artırmak için kullanılıyor, ancak hareket ve içerik üzerinde precisa kontrol sağlamada yetersiz kalabiliyorlar. Bu sınırlamayı aşmak için, bazı çerçeveler video üretimi için daha precisa kontrol sağlamak amacıyla poz iskeleti, optik akış ve diğer çok modelli sinyalleri kullanmaya çalışıyorlar.

Mevcut çerçevelerin bir diğer sınırlaması, video üretimi sırasında kamera noktalarını uyarlamak veya ayarlamak için precisa kontrol sağlamada yetersiz kalmasıdır, çünkü kamera kontrolü sadece üretilecek videoların gerçekliğini artırmakla kalmaz, aynı zamanda kullanıcı katılımını artırarak, film ve reklam endüstrilerinde önemli bir özelliktir. Ayrıca, kamera hareketlerini Beceriyle yönetmek, karakter ilişkilerini vurgulamak, duyguları vurgulamak ve hedef kitlenin odak noktasını yönlendirmek için önemlidir.

AnimateDiff çerçevesi, LoRA fine-tuning yaklaşımını kullanarak farklı türdeki görüntüler için modelin ağırlıklarını elde ediyor. Direct-a-video çerçevesi, video üretimi sırasında kamera pozunu kontrol etmek için bir kamera gömme öğesi uygulamaya çalışıyor, ancak yalnızca üç kamera parametresine bağlı kalıyor, kamera kontrolünü en temel türlerle sınırlıyor. Diğer yandan, MotionCtrl gibi çerçeveler, daha karmaşık kamera pozları üretebilen bir hareket kontrolörü tasarlıyor, ancak üretilen videoların bazı kısımlarını ayarlamak zorunda kalması, modelin genelleme yeteneğini sınırlıyor.

CameraCtrl: Model Mimari

CameraCtrl çerçevesinin kamera kodlayıcısı bileşenini video üreticisinde eğitmek için, büyük miktarda iyi etiketlenmiş ve anotlanmış videolara ihtiyaç duyuluyor, model kamera traijektörünü yapıdan hareket yaklaşımı kullanarak elde edebiliyor. CameraCtrl çerçevesi, veri setini seçerken, temel metin-den videoya modelinin eğitim verilerine yakın görünümde ve mümkün olduğunca geniş kamera dağılımına sahip olmasını amaçlıyor.

Video Üreticilerindeki Kamera Kontrol Edilebilirliği

Model, kamera traijektörünü plucker gömme dizisine parametreleştirerek, kamera özelliklerini çıkarmak için bir kodlayıcı modeli kullanma seçeneğine sahip, bu kodlayıcı model, kamera özellikleri video üreticisine sorunsuz bir şekilde entegre edilebiliyor. Kamera kodlayıcısı, her bir konvolüsyonel bloktan sonra zaman attention modeli içeriyor, bu da kamera pozlarının zaman içindeki ilişkilerini yakalamasını sağlıyor.

Kamera Dağılımlarının Öğrenilmesi

CameraCtrl çerçevesinin kamera kodlayıcısı bileşenini video üreticisinde eğitmek için, büyük miktarda iyi etiketlenmiş ve anotlanmış videolara ihtiyaç duyuluyor, model kamera traijektörünü yapıdan hareket yaklaşımı kullanarak elde edebiliyor. CameraCtrl çerçevesi, veri setini seçerken, temel metin-den videoya modelinin eğitim verilerine yakın görünümde ve mümkün olduğunca geniş kamera dağılımına sahip olmasını amaçlıyor.

CameraCtrl: Deneyler ve Sonuçlar

CameraCtrl çerçevesi, AnimateDiff modelini temel metin-den videoya modeli olarak uyguluyor, çünkü AnimateDiff modelinin eğitim stratejisi, hareket modülünün metin-den görüntü tabanlı modellerle veya metin-den görüntü LoRA’ları ile entegre olmasına olanak tanıyor. Model, Adam optimizatörünü kullanarak 1e-4 sabit öğrenme hızıyla eğitiliyor.

Performansını değerlendirmek için, CameraCtrl çerçevesi iki mevcut kamera kontrol çerçevesiyle karşılaştırıldı: MotionCtrl ve AnimateDiff. Ancak, AnimateDiff çerçevesinin yalnızca sekiz temel kamera traijektörünü desteklemesi nedeniyle, CameraCtrl ile AnimateDiff arasındaki karşılaştırma yalnızca üç temel traijektöre sınırlı kaldı.

Görüldüğü gibi, CameraCtrl çerçevesi AnimateDiff çerçevesini temel traijektörde geride bırakıyor ve MotionCtrl çerçevesine karşı karmaşık traijektör metricinde daha iyi sonuçlar elde ediyor.

Aşağıdaki şekil, kamera kodlayıcısı mimarisinin üretilecek örneklerin genel kalitesi üzerindeki etkisini gösteriyor. Satır a’dan Satır d’ye kadar, sırasıyla ControlNet, ControlNet ile zaman attention, T2I Adaptor ve T2I adaptor ile zaman attention ile elde edilen sonuçları temsil ediyor.

Aşağıdaki şekil, ilk iki satırda SparseCtrl çerçevesinin RGB kodlayıcısı ve CameraCtrl çerçevesinin kullanılan yöntemi ile elde edilen videoları gösteriyor.

Son Düşünceler

Bu makalede, metin-den videoya modelleri için precisa kamera poz kontrolü sağlamaya çalışan CameraCtrl adlı yeni bir fikir hakkında konuşuyoruz. Kamera traijektörünü precisa parametreleştirerek, model bir metin-den videoya modeline bir oynatma ve çalıştırma kamera modülü eğitir ve diğer bileşenleri dokunmadan bırakır. Ayrıca, CameraCtrl modeli çeşitli veri setlerinin etkisini kapsamlı bir şekilde incelemeye çalışır ve benzer görünümde ve çeşitli kamera dağılımına sahip videoların, modelin genel kontrol edilebilirlik ve genelleme yeteneklerini artırabileceğini önerir. Gerçek dünya görevlerinde CameraCtrl modelinin performansını analiz etmek için yapılan deneyler, precisa ve domaine-adaptif kamera kontrolü sağlamakta çerçevenin verimliliğini gösteriyor, kamera pozundan ve metinsel girdilerden hareketle özelleştirilmiş ve dinamik video üretimi için bir yol açıyor.

Mesleği mühendis, kalbi yazar. Kunal, AI ve ML'ye derin bir sevgi ve anlayışla technical writer, bu alanlardaki karmaşık kavramları etkileyici ve bilgilendirici belgelerle basitleştirmeye adanmış.