Anderson’un Açısı

Sürekli AI Video İçerik Düzenleme ile Metin-Rehberli Giriş

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Profesyonel VFX topluluğu, görüntü ve video sentezindeki yeni yeniliklere ilgi duyuyor ve bazen tehdit altında hissediyor, ancak çoğu AI tabanlı video düzenleme projesinde zaman sürekliliğinin olmaması, bu çabaları genellikle ‘psikedelik’ alanına yönlendiriyor, parlayan ve hızla değişen dokular ve yapılar ve etkiler ve teknolojiyle başa çıkma gibi kaba teknolojiye benzeyen şeyler.

Eğer bir videoda, derin sahteciliklerin (yani, bir kişinin mevcut görüntüsüne yeni bir kimlik dayatması) dışında bir şeyi değiştirmek istiyorsanız, çoğu mevcut çözüm üretim kaliteli görsel efektler için gerekli kesinlik açısından oldukça ciddi sınırlamalarla çalışır.

Bu durumun bir istisnası, Weizmann Bilim Enstitüsü’nden bir grup akademisyenin devam eden çalışmasıdır. 2021 yılında, üç araştırmacı, Adobe ile birlikte, videoyu parçalayarak ve birleştirilmiş bir çıktıya katmanlı nöral atlas adı verilen bir iç harita ekleyen yeni bir yöntem açıkladı.

2021 makalesinden: Kaynak klipteki yolun tam geçişinin tahmini, geleneksel olarak geniş rotoskopi ve eşleştirme gerektirecek şekilde bir nöral ağ tarafından düzenlenmiştir. Arka plan ve ön plan elemanları farklı ağlar tarafından işlendiği için maskeler gerçekten 'otomatik'tir. Kaynak: https://layered-neural-atlases.github.io/

2021 makalesinden: Kaynak klipteki yolun tam geçişinin tahmini, geleneksel olarak geniş rotoskopi ve eşleştirme gerektirecek şekilde bir nöral ağ tarafından düzenlenmiştir. Arka plan ve ön plan elemanları farklı ağlar tarafından işlendiği için maskeler gerçekten ‘otomatik’tir. Kaynak: https://layered-neural-atlases.github.io/

Bu, VFX pipeline’larında optik akış tarafından kapsanan alana girer, ancak geleneksel CGI iş akışlarında doğrudan eşdeğeri yoktur, çünkü esasen bir ‘zamanlı doku haritası’ oluşturur ve geleneksel yazılım yöntemleriyle üretilebilir ve düzenlenebilir.

Üstteki illüstrasyondaki ikinci resim, yol yüzeyinin arka planını (sembolik olarak) tüm video süresince temsil eder. Bu temel görüntüyü değiştirmek (üstteki illüstrasyondaki üçüncü resim), arka planında tutarlı bir değişikliğe neden olur.

‘Açık’ atlasın yukarıdaki resimleri yalnızca bireysel yorumlanmış kareleri temsil eder; hedef video karesindeki tutarlı değişiklikler, gerekli örtüşmeleri ve diğer sahne efektlerini (gölgeler veya yansımalara benzer) koruyarak orijinal kareye geri eşlenir.

Core mimari, katmanlı atlasları, alfa kanallarını ve eşleştirmeleri temsil etmek için bir Çok Katmanlı Perceptron (MLP) kullanır; tüm bunlar 2B bir alanda optimize edilir ve NeRF tarzı 3B geometri noktaları, derinlik haritaları ve benzer CGI tarzı unsurların önceden bilgisine gerek kalmaz.

Bireysel nesnelerin referans atlası da güvenilir bir şekilde değiştirilebilir:

2021 çerçevesi altında hareketli bir nesneye tutarlı değişiklik. Kaynak: https://www.youtube.com/watch?v=aQhakPFC4oQ

2021 çerçevesi altında hareketli bir nesneye tutarlı değişiklik. Kaynak: https://www.youtube.com/watch?v=aQhakPFC4oQ

Aslında, 2021 sistemi, geometri hizalamasını, eşleştirmeyi, eşleştirmeyi, yeniden metinleştirme ve rotoskopi işlemlerini ayrı bir nöral işlem haline getirir.

Text2Live

2021 makalesinin üç orijinal araştırmacısı, NVIDIA araştırma ekibiyle birlikte, katmanlı atlasların gücünü, metin-rehberli CLIP teknolojisini birleştiren yeni bir yenilik üzerinde çalışıyorlar.

Yeni mimari, Text2Live adlı bir son kullanıcının metin promtlarına dayalı olarak gerçek video içeriğine yönelik yerel düzenlemeler yapmasına olanak tanır:

Ön plan düzenlemenin iki örneği. Daha iyi çözünürlük ve tanım için, orijinal videolara https://text2live.github.io/sm/pages/video_results_atlases.html adresinden ulaşabilirsiniz

Ön plan düzenlemenin iki örneği. Daha iyi çözünürlük ve tanım için, orijinal videolara https://text2live.github.io/sm/pages/video_results_atlases.html adresinden ulaşabilirsiniz

Text2Live, önceden eğitilmiş bir jeneratör kullanmadan, video klibine özgü bir iç veritabanını kullanarak, anlamsal ve yüksek derecede yerel düzenleme sağlar.

Text2Live altında arka plan ve ön plan (nesne) dönüşümleri. Kaynak: https://text2live.github.io/sm/pages/video_results_atlases.html

Text2Live altında arka plan ve ön plan (nesne) dönüşümleri. Kaynak: https://text2live.github.io/sm/pages/video_results_atlases.html

Teknik, geleneksel rotoskopi veya yeşil ekran iş akışlarında olduğu gibi kullanıcı tarafından sağlanan maskeleri gerektirmez, ancak 2021 araştırması temelinde bir başlangıç teknikleriyle alaka haritaları tahmin eder.

Transformer tabanlı genel dikkat modeli ile oluşturulan çıktı haritaları.

Transformer tabanlı genel dikkat modeli ile oluşturulan çıktı haritaları.

Yeni makale, Text2LIVE: Metin-Rehberli Katmanlı Görüntü ve Video Düzenleme olarak adlandırılmıştır. Orijinal 2021 ekibine, Weizmann’ın Omer Bar-Tal’i ve NVIDIA Araştırma’nın Yoni Kasten’i de katılmıştır.

Mimari

Text2Live, tek bir girdi görüntüsü ve hedef metin promtlarına dayalı olarak eğitilen bir jeneratörden oluşur. 400 milyon metin/görüntü çiftine önceden eğitilmiş bir CLIP modeli, kullanıcı girişine dayalı dönüşümlerin yorumlanabileceği ilgili görsel materyali sağlar.

Jeneratör, girdi görüntüsünü (kare) kabul eder ve renk ve opaklık bilgilerini içeren bir hedef RGBA katmanını çıkarır. Bu katman daha sonra orijinal görüntüye ek işlemlerle birleştirilir.

Üretilen RGBA katmanındaki alfa kanalı, geleneksel iş akışlarına gerek kalmadan iç birleştirme işlevi sağlar.

Üretilen RGBA katmanındaki alfa kanalı, geleneksel iş akışlarına gerek kalmadan iç birleştirme işlevi sağlar.

Text2Live, hedef video veya görüntüye özgü iç görüntülerde eğitim vererek, bir GAN’ın (Generative Adversarial Network) latent uzayına girdi görüntüsünü tersine çevirmek veya bir Diffusion modeli kullanmak gibi gereksinimlerini ortadan kaldırır.

Text2Live'dan çeşitli promt tabanlı dönüşüm düzenlemeleri.

Text2Live’dan çeşitli promt tabanlı dönüşüm düzenlemeleri.

Önceki yaklaşımlar, iletim tabanlı yöntemler veya optik akış tabanlı yaklaşımları kullanmıştır. Bu teknikler,某 certain bir düzeyde kare tabanlı olduğundan, çıktı videosunda değişikliklerin tutarlı bir zamanlı görünümünü oluşturamazlar. Bir nöral katmanlı atlas, ise değişikliklere yönelik tek bir alanda işlem yapma olanağı sağlar ve bu değişiklikler video ilerledikçe sadık kalır.

Hiçbir 'sizzling' veya rastgele hayal gücü yok: Text2Live, metin promt'ını 'paslı jeep' olarak yorumlar ve video中的 araba için nöral katmanlı atlasına bir kez uygular, her yorumlanmış kare için dönüşümü yeniden başlatmak yerine.

Hiçbir ‘sizzling’ veya rastgele hayal gücü yok: Text2Live, metin promt’ını ‘paslı jeep’ olarak yorumlar ve video中的 araba için nöral katmanlı atlasına bir kez uygular, her yorumlanmış kare için dönüşümü yeniden başlatmak yerine.

Text2Live'nin bir Jeep'i paslı bir enkaz haline getirmesinin iş akışı.

Text2Live’nin bir Jeep’i paslı bir enkaz haline getirmesinin iş akışı.

Text2Live, AI tabanlı kompozisyonda bir đột pháya daha yakındır; metin-görüntü alanındaki bu hafta DALL-E 2 framework’inin ikinci neslinin çıkışı ile birlikte çok dikkat çeken bir alana değil.

Text2Live, son kullanıcının bir atlas çıkarmasına ve sonra yüksek kontrolde piksel tabanlı ortamlarda (Photoshop gibi) bir defada düzenlenmesine ve daha sonra 3B tahmini veya geriye dönük CGI tabanlı yaklaşımlara gerek kalmadan doğru bir şekilde yönlendirilen bir ortama geri beslenmesine olanak tanır.

Dahası, Text2Live, yazarlara göre, tamamen otomatik bir şekilde maskeleme ve kompozisyonu başaran ilk karşılaştırılabilir çerçeve olduğunu iddia ediyor.

 

İlk olarak 7 Nisan 2022’de yayımlanmıştır.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: [email protected]