Anderson’un Açısı
AI Video Oluşturma Kontrolü Üzerine Toplam Kontrol

Video temel modelleri gibi Hunyuan ve Wan 2.1, güçlü olsalar da, film ve TV prodüksiyonu (özellikle VFX prodüksiyonu) tarafından talep edilen türden granüler kontrole sahip değiller.
Mesleki görsel efekt stüdyolarında, bu gibi açık kaynaklı modeller, daha önceki görüntü tabanlı (video tabanlı değil) modeller gibi Stable Diffusion, Kandinsky ve Flux ile birlikte, belirli yaratıcı ihtiyaçları karşılamak için ham çıkışlarını uyarlayan bir dizi destek aracı ile birlikte kullanılır. Bir yönetmen “Bu güzel görünüyor, ancak bunu biraz daha [n] yapabilir miyiz?” dediğinde, modelin bu tür taleplere yeterli olmadığına dair bir cevap veremezsiniz.
Bunun yerine, bir AI VFX ekibi, video sentezinin sınırlarını biraz daha ileriye taşımak için geleneksel CGI ve kompozisyon teknikleri ile özel prosedürler ve iş akışları kullanacaktır.
Benzer şekilde, bir temel video modeli, bir web tarayıcısı gibi Chrome’un varsayılan kurulumuna benzer; çok şey yapar, ancak onu sizin ihtiyaçlarınıza uyarlamak istiyorsanız, tersi değilse, bazı eklentilere ihtiyacınız olacak.
Kontrol manyakları
Diffüzyon tabanlı görüntü sentezinin dünyasında, en önemli üçüncü taraf sistemi ControlNet dir.
ControlNet, diffüzyon tabanlı generatif modellere yapılandırılmış kontrol eklemek için bir tekniktir, böylece kullanıcılar, kenar haritaları, derinlik haritaları veya pozisyon bilgisi gibi ek girdilerle görüntü veya video oluşturmayı yönlendirebilir.

ControlNet’in çeşitli yöntemleri, derinlik>görüntü (üst satır), anlamsal segmentasyon>görüntü (alt sol) ve insan ve hayvanların poz yönlendirmeli görüntü oluşturmasına olanak tanır (alt sol).
Metin promtlarına yalnızca güvenmek yerine, ControlNet, bu koşullandırma sinyallerini işlerken temel modelin üretken yeteneklerini koruyan ayrı nöral ağ dalları veya adaptörler tanır.
Bu, kullanıcı spesifikasyonlarına daha yakın olan ince ayarlı çıkışlar sağlar, özellikle precisa kompozisyon, yapı veya hareket kontrolü gerektiren uygulamalar için özellikle yararlıdır:

Bir rehber poz ile, çeşitli doğru çıktı türleri ControlNet aracılığıyla elde edilebilir. Kaynak: https://arxiv.org/pdf/2302.05543
Ancak, bu tür adaptör tabanlı çerçeveler, çok içe dönük nöral süreçler seti üzerinde dışarıdan çalışır. Bu yaklaşımlar several dezavantajlara sahiptir.
İlk olarak, adaptörler bağımsız olarak eğitilir, bu da dal çatışmaları när birden fazla adaptör birleştirilir, bu da üretim kalitesinin bozulmasına neden olabilir.
İkincisi, parametre fazlalığı getirir, her adaptör için ek hesaplama ve bellek gerektirir, bu da ölçeklendirilmesi verimsiz hale getirir.
Üçüncüsü, esnekliğine rağmen, adaptörler genellikle alt-optimal sonuçlar üretir, tam olarak ince ayarlanmış çoklu koşullu üretim modellerine kıyasla. Bu sorunlar, birden fazla kontrol sinyalinin sorunsuz entegrasyonunu gerektiren görevler için adaptör tabanlı yöntemleri moins etkili hale getirir.
İdeal olarak, ControlNet’in yetenekleri modelin içine yerli olarak eğitilecekti, daha sonra anticipated obvious yenilikler gibi同時 video/ses oluşturma veya yerli dudak senkronizasyonu kabiliyetleri gibi diğer kontrol türlerini barındıracak şekilde modüler bir şekilde.
Bu durumda, her ek işlev, bir post-prodüksiyon görevi veya temel modelin duyarlı ağırlıklarını gezinmek zorunda olan bir yerli olmayan prosedürü temsil eder.
FullDiT
Bu çıkmaza, Çin’den yeni bir teklif geliyor, ControlNet tarzı önlemlerin, eğitim zamanında bir generatif video modeline doğrudan entegre edildiği bir sistem öneriyor, bunun yerine sonradan düşünülmesine gerek kalmıyor.

Yeni makaleden: FullDiT yaklaşımı, kimlik dayatması, derinlik ve kamera hareketini yerel üretimlere entegre edebilir ve bu kombinasyonların herhangi birini aynı anda çağırabilir. Kaynak: https://arxiv.org/pdf/2503.19907
Adı FullDiT olan yeni yaklaşım, kimlik transferi, derinlik eşlemesi ve kamera hareketi gibi çoklu görev koşullarını birleşik bir eğitimli generatif video modelinin bir parçası haline getirir ve yazarlar bir prototip eğitimli model ve eşlik eden video klipleri ürettikleri bir proje sitesine sahiptir.
Aşağıdaki örnekte, kamera hareketi, kimlik bilgisi ve metin bilgisi (yani, kullanıcı metin promtları) gibi üretimlerin birleştirildiğini görüyoruz:
Oynatmak için tıklayın. ControlNet tarzı kullanıcı dayatmasıyla yalnızca yerel eğitimli bir temel model örneği. Kaynak: https://fulldit.github.io/
Yazarlar, deneysel eğitimli modelini işlevsel bir temel model olarak önermediklerini, ancak yerel metin-veya-görüntüden-videoya (T2V ve I2V) modellerinin kullanıcıya sadece bir görüntü promt veya metin promtından daha fazla kontrol sunabileceğini kanıtlamak için bir kanıt olarak sunuyorlar.
Henüz böyle modeller olmadığından, araştırmacılar FullBench adlı birbenchmark oluşturdular, çoklu görevli videoların değerlendirilmesi için ve benzeri testlerde önceki yaklaşımlara karşı state-of-the-art performans iddiasında bulunurlar. Ancak, FullBench yazarları tarafından tasarlandığından, nesnelliği test edilmemiş ve 1.400 örnekten oluşan veri kümesi daha geniş sonuçlar için çok sınırlı olabilir.
Belki de makalenin sunduğu mimarinin en ilginç yönü, yeni kontrol türlerini entegre etme potansiyelidir. Yazarlar şunları söylüyor:
‘Bu çalışmada, yalnızca kamera, kimlikler ve derinlik bilgisi kontrol koşullarını araştırıyoruz. Diğer koşullar ve modaliteler gibi ses, konuşma, nokta bulutu, nesne sınırlama kutuları, optik akış vb. hakkında daha fazla araştırma yapmadık. FullDiT’nin tasarımı, minimal mimari değişiklikle diğer modaliteleri sorunsuz bir şekilde entegre edebilir, ancak mevcut modelleri yeni koşullara ve modalitelere nasıl hızlı ve maliyet etkin bir şekilde uyarlayacağı hala önemli bir soru olarak kalıyor.’
Yazarlar FullDiT’yi çoklu görevli video oluşturma alanında bir adım olarak sunsalar da, bu yeni çalışma temelde mevcut mimarileri üzerine kuruludur, temelden yeni bir paradigmaya girmez.
Her şeye rağmen, FullDiT şu anda (bildiğim kadarıyla) ‘sabitlenmiş’ ControlNet tarzı olanaklara sahip tek video temel modeli olarak duruyor ve önerilen mimarinin gelecekteki yenilikleri de barındırabileceğini görmek güzel.
Oynatmak için tıklayın. Proje sitesinden kullanıcı kontrollü kamera hareketleri örnekleri.
Yeni makale FullDiT: Çoklu Görevli Video Oluşturma Temel Modeli ile Tam Dikkat olarak adlandırılmış ve Kuaishou Teknoloji ve Hong Kong Çin Üniversitesi’nden dokuz araştırmacı tarafından yazılmıştır. Proje sayfası burada ve yeni benchmark verileri Hugging Face’de bulunabilir.
Yöntem
Yazarlar, FullDiT’nin birleşik dikkat mekanizmasının, koşullar arasında hem uzaysal hem de zamansal ilişkileri yakalayarak daha güçlü çapraz modalli temsil öğrenimi sağlar:

Yeni makaleye göre, FullDiT, tam self-dikkat aracılığıyla birden fazla girdi koşulunu birleştirir ve bunları birleşik bir diziye dönüştürür. Buna karşılık, adaptör tabanlı modeller (en soldaki), her girişin ayrı modüllerini kullanır, bu da fazlalığına, çatışmalarına ve daha zayıf performansına neden olur.
Her girişi ayrı olarak işleyen adaptör tabanlı kurulumların aksine, bu paylaşılan dikkat yapısı, dal çatışmalarını önler ve parametre fazlalığı azaltır. Ayrıca, mimarinin yeni girdi türlerine önemli bir yeniden tasarım olmadan ölçeklenebileceğini ve modelin, eğitim sırasında görmediği koşul kombinasyonlarına (örneğin, kamera hareketini karakter kimliğiyle bağlama) genellemeye işaret ettiğini iddia ediyorlar.
Oynatmak için tıklayın. Proje sitesinden kimlik oluşturma örnekleri.
FullDiT’nin mimarisinde, tüm koşullandırma girdileri – metin, kamera hareketi, kimlik ve derinlik gibi – önce birleşik bir token formatına dönüştürülür. Bu tokenler daha sonra bir dizi transformer katmanlarından geçirilir ve tam self-dikkat kullanılır. Bu yaklaşım, önceki çalışmalar gibi Open-Sora Plan ve Movie Gen‘i takip eder.
Bu tasarım, modelin tüm koşullar boyunca uzaysal ve zamansal ilişkileri ortaklaşa öğrenmesini sağlar. Her transformer bloğu, tüm dizi üzerinde çalışır, böylece modaliteler arasında dinamik etkileşimler sağlar ve her girişin ayrı modüllerine güvenmek zorunda kalmaz – ve, previously belirttiğimiz gibi, mimari gelecekteki ek kontrol sinyallerini entegre etmek için tasarlanmıştır, önemli yapısal değişiklikler olmadan.
Üçlü Güç
FullDiT, her kontrol sinyalini standartlaştırılmış bir token formatına dönüştürür, böylece tüm koşullar birleşik bir dikkat çerçevesinde birlikte işlenebilir. Kamera hareketi için, model her kare için dışsal parametrelerin bir dizesini kodlar – pozisyon ve yön gibi. Bu parametreler zaman damgalı ve gömme vektörlerine projekte edilir, bu da sinyalin zamansal doğasını yansıtır.
Kimlik bilgisi farklı şekilde ele alınır, çünkü doğası gereği uzaysaldır, zamansal değil. Model, her karedeki karakterlerin hangi bölümlerinde bulunduğunu gösteren kimlik haritalarını kullanır. Bu haritalar yamalar olarak bölünmüştür ve her yama, belirli bölgelerle belirli varlıkları ilişkilendirmeyi sağlayan bir gömme olarak projekte edilir.
Derinlik, uzay-zamansal bir sinyaldir ve model, derinlik videolarını hem uzayda hem de zamanda uzanan 3B yamalara ayırarak bunu işler. Bu yamalar, yapılarını kareler arasında koruyacak şekilde gömme olarak işlenir.
Bu gömme işlemlerinden sonra, tüm bu koşul tokenleri (kamera, kimlik ve derinlik) birleşik bir diziye eklenir, FullDiT’nin bunları tam self-dikkat kullanarak birlikte işlemesine olanak tanır. Bu paylaşılan temsil, modelin modaliteler ve zaman boyunca etkileşimleri öğrenmesini sağlar, ayrı işleme akışlarına güvenmek zorunda kalmaz.
Veri ve Testler
FullDiT’nin eğitim yaklaşımı, her koşul türü için seçili olarak etiketlenmiş veri kümelerine dayanıyordu, tüm koşulların aynı anda mevcut olmasını gerektirmedi.
Metinsel koşullar için, girişim MiraData projesinde belirtilen yapılandırılmış altyazı yaklaşımını izledi.

MiraData projesinden video toplama ve anlama iş akışı. Kaynak: https://arxiv.org/pdf/2407.06358
Kamera hareketi için, RealEstate10K veri kümesi, yüksek kaliteli yerleşik kamera parametreleri anotasyonları nedeniyle ana veri kaynağı olarak kullanıldı.
Yazarlar, statik sahne kamera veri kümeleri gibi RealEstate10K’ye yalnızca eğitim yaptığında, oluşturulan videolarda dinamik nesne ve insan hareketlerinin azaltıldığını gözlemlediler. Buna karşı koymak için, daha dinamik kamera hareketleri içeren dahili veri kümeleri kullanarak ek bir fine-tuning aşaması gerçekleştirdiler.
Kimlik anotasyonları, ConceptMaster projesi için geliştirilen pipeline kullanılarak oluşturuldu, bu da ince kimlik bilgilerinin verimli bir şekilde filtrelenmesini ve çıkarılmasını sağladı.

ConceptMaster çerçevesi, özdeşlikten kopma sorunlarını giderirken, özgün videolarda kavram bütünlüğünü korur. Kaynak: https://arxiv.org/pdf/2501.04698
Derinlik anotasyonları, Panda-70M veri kümesi kullanılarak Derinlik Her Şey ile elde edildi.
Veri Sıralama ile Optimizasyon
Yazarlar ayrıca, modelin daha zorlu görevlere karşı güçlü temsiller elde etmesini sağlamak için daha zorlu koşulları eğitimın başlangıcında tanıttıkları bir ilerleyici eğitim takvimi uyguladılar. Eğitim sırası, metin koşullarından kamera koşullarına, ardından kimlikler ve son olarak derinlik koşullarına geçti, daha kolay görevler genellikle daha az örneklerle ve daha geç tanıtıldı.
Yazarlar, iş yükünü bu şekilde sıralamanın değerini vurguladı:
‘Ön eğitim aşamasında, daha zorlu görevlerin daha uzun eğitim süresi gerektiğini ve öğrenme sürecinin başlangıcında tanıtılması gerektiğini gözlemledik. Bu zorlu görevler, çıktı videodan önemli ölçüde farklı olan karmaşık veri dağılımlarını içerir ve modelin bunları doğru bir şekilde yakalayabilmesi için yeterli kapasiteye sahip olması gerekir. ‘
‘Tersine, daha kolay görevleri çok erken tanıtmak, modelin bunlara öncelik vermesine ve daha zorlu görevlerin converge olmasına engel olabilecek daha hızlı optimizasyon geri bildirimi sağlamasına neden olabilir.’

Araştırmacıların benimsediği veri eğitim sırasının bir illüstrasyonu, kırmızı daha büyük veri hacmini gösterir.
İlk ön eğitimden sonra, bir final fine-tuning aşaması, görsel kaliteyi ve hareket dinamiklerini iyileştirmek için modeli daha da rafine etti. Sonrasında eğitim, standart bir diffüzyon çerçevesinin eğitimine benzerdi: video latents’e gürültü eklendi ve model, gürültüyü.predict ve kaldırmayı öğrendi, gömme koşul tokenlerini rehber olarak kullanarak.
FullDiT’yi ve mevcut yöntemlerle adil bir karşılaştırma yapabilmek için, yazarlar FullBench adlı bir benchmark seti tanıttılar, bu 1.400 farklı test vakasından oluşuyor.

Yeni FullBench benchmark için bir veri gezgin örneği. Kaynak: https://huggingface.co/datasets/KwaiVGI/FullBench
Her veri noktası, çeşitli koşullandırma sinyalleri için yerleşik anotasyonlar sağladı, bunlar arasında kamera hareketi, kimlik ve derinlik bulunuyordu.
Metrikler
Yazarlar, FullDiT’yi, beş ana performans yönünü kapsayan on metrik kullanarak değerlendirdiler: metin hizalama, kamera kontrolü, kimlik benzerliği, derinlik doğruluğu ve genel video kalitesi.
Metin hizalaması, CLIP benzerliği kullanılarak ölçüldü, kamera kontrolü ise rotasyon hatası (RotErr), çevirme hatası (TransErr) ve kamera hareketi tutarlılığı (CamMC) ile değerlendirildi, CamI2V projesindeki (KameraCtrl projesinde) yaklaşımı izleyerek.
Kimlik benzerliği, DINO-I ve CLIP-I ile değerlendirildi ve derinlik kontrolü doğruluğu, Ortalama Mutlak Hata (MAE) ile nicelendirildi.
Video kalitesi, MiraData’dan üç metrik ile değerlendirildi: pürüzsüzlük için kare düzeyinde CLIP benzerliği; dinamik için optik akış tabanlı hareket mesafesi; ve görsel çekicilik için LAION-Aesthetic puanları.
Eğitim
Yazarlar, FullDiT’yi, yaklaşık bir milyar parametre içeren (içerik gizli) bir iç metin-veya-görüntüden-videoya diffüzyon modeli kullanarak eğittiler. Modest bir parametre boyutu seçtiler, böylece önceki yöntemlerle karşılaştırmalar adil ve tekrarlanabilir olsun.
Video eğitimlerinin uzunluğu ve çözünürlüğü farklı olduğundan, yazarlar her partiyi ortak bir çözünürlüğe yeniden boyutlandırarak, her dizi için 77 kare örnekleme yaparak ve uygulamalı dikkat ve kayıp maskeleri kullanarak eğitim etkinliğini optimize ettiler.
Adam optimizatörü, 1×10−5 öğrenme hızında, toplam 5.120GB VRAM’a sahip 64 NVIDIA H800 GPU kümesinde kullanıldı (bu, hobisel sentez topluluklarında, RTX 3090’da 24GB’nin hala lüks bir standart olarak kabul edildiğini düşünün).
Model, 32.000 adımda eğitildi, her videoda en fazla üç kimlik ve 20 kare kamera koşulu ve 21 kare derinlik koşulu ile, her ikisi de 77 kareden eşit olarak örneklendi.
Çıktı için, model 384×672 piksel çözünürlükte (yaklaşık 15 kare/saniyede beş saniye) 50 diffüzyon çıkarma adımı ve beş sınıfçı rehber ölçekleme ile videolar üretti.
Önceki Yöntemler
Kamera-veya-video değerlendirme için, yazarlar FullDiT’yi MotionCtrl, CameraCtrl ve CamI2V ile karşılaştırdılar, tüm modeller RealEstate10K veri kümesi kullanılarak eğitildi, böylece tutarlılık ve adillik sağlandı.
Kimlik koşullu üretim için, comparable açık kaynaklı çoklu kimlik modelleri mevcut olmadığından, model 1M parametreli ConceptMaster modeli ile aynı eğitim verisi ve mimari kullanılarak benchmarklandı.
Derinlik-veya-video görevleri için, Ctrl-Adapter ve ControlVideo ile karşılaştırmalar yapıldı.

Tekli görevli video oluşturma için nicel sonuçlar. FullDiT, kamera-veya-video oluşturma için MotionCtrl, CameraCtrl ve CamI2V ile karşılaştırıldı; kimlik-veya-video için 1M parametreli ConceptMaster; ve derinlik-veya-video için Ctrl-Adapter ve ControlVideo. Tüm modeller, varsayılan ayarlarıyla değerlendirildi. Tutarlılık için, her yöntem için 16 kare eşit olarak örneklendi, önceki modellerin çıktı uzunluğunu eşledi.
Sonuçlar, FullDiT’nin, birden fazla koşullandırma sinyalini aynı anda işlerken, metin, kamera hareketi, kimlik ve derinlik kontrolleri ile ilgili metriklerde state-of-the-art performans sergilediğini gösteriyor.
Genel kalite metriklerinde, sistem genellikle diğer yöntemlerin üzerinde performans gösterdi, ancak pürüzsüzlüğü ConceptMaster’dan biraz daha düşüktü. Yazarlar şunları söylüyor:
‘FullDiT’nin pürüzsüzlüğü, ConceptMaster’dan biraz daha düşüktür, çünkü pürüzsüzlük hesabının bitişik kareler arasındaki CLIP benzerliğine dayanmasıdır. FullDiT, ConceptMaster’a kıyasla önemli ölçüde daha büyük varyasyonlara sahip olduğundan, pürüzsüzlük metriği, bitişik kareler arasındaki büyük varyasyonlardan etkilenir. ‘
‘Görsel çekicilik puanı için, since ControlVideo genellikle resim tarzı videolar üretiyor ve bu tür videoları tercih eden bir puanlama modeli, görsel çekicilik puanında yüksek bir puan elde ediyor.’
Sonuç
FullDiT, daha full-featured bir video temel modeli türüne yönelik heyecan verici bir girişimdir, ancak ControlNet tarzı araçların talebi, özellikle FOSS projeleri için, büyük ölçekli olarak uygulanmasını haklı çıkarıp çıkarmayacaklarını merak etmek gerekir. Bu tür sistemlerin kullanılması, ComfyUI gibi nispeten karmaşık kullanıcı arayüzlerine non-trivial bir aşinalık gerektirir.
Bu nedenle, böyle bir işlevsel FOSS modelinin geliştirilmesi muhtemelen, böyle bir modeli kapalı kapılar ardında eğitmek ve bakımını yapmak için para veya iradeye sahip olmayan daha küçük VFX şirketleri tarafından gerçekleştirilecektir.
Öte yandan, API tabanlı ‘kiralık AI’ sistemleri, modellere doğrudan entegre edilmiş yardımcı kontrol sistemleri için daha basit ve daha kullanıcı dostu yorumlama yöntemlerini geliştirmek için iyi motive edilebilir.
Oynatmak için tıklayın. FullDiT kullanarak video oluşturma ile Depth+Text kontrolleri.
* Yazarlar, bilinen bir temel model (örneğin, SDXL, vb.) belirtmiyor.
İlk olarak 27 Mart 2025 Perşembe günü yayınlandı.












