Yapay zeka modelleri ve platformları

Video İçin Arada Kalan Boşluğu Kapatmak

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
Images taken from the FCVG paper and project site, https://arxiv.org/pdf/2412.11755 and https://fcvg-inbetween.github.io/

Çin’den yapılan yeni bir araştırma, iki zamanla uzaklaşmış video karesi arasındaki boşluğu doldurmak için geliştirilmiş bir yöntem sunuyor – bu, şu anda generatif AI video için gerçekçilik yarışması ve video codec sıkıştırması için en önemli zorluklardan biri.

Aşağıdaki örnek videoda, en soldaki sütunda bir ‘başlangıç’ (en üstte) ve ‘son’ (en altta) kare görüyoruz. Rekabet eden sistemlerin gerçekleştirmesi gereken görev, iki resimdeki konu nasıl A karesinden B karesine geçerdi diye tahmin etmek. Animasyonda bu süreç, tweening olarak adlandırılır ve sessiz sinema dönemine kadar uzanır.

Çalmağa tıklayınız. İlk sütunda önerilen başlangıç ve son kareleri görüyoruz. Orta sütunda ve üçüncü (en sağdaki) sütunun üst kısmında, bu zorluğa karşı önceki üç yaklaşımı görüyoruz. En sağdaki alt kısımda, yeni yöntemin daha inandırıcı bir sonuç elde ettiğini görüyoruz.

Çinli araştırmacılar tarafından önerilen yeni yöntem, Çerçevesel Koşullara Dayalı Video Oluşturma (FCVG) olarak adlandırılmaktadır ve sonuçları yukarıdaki videonun sağ alt kısmında görülmektedir.

Örneğin, video interpolasyonu için en çok övgü alan çerçeveler olan Google’ın Frame Interpolation for Large Motion (FILM) projesi, büyük ve cesur hareketleri yorumlamakta zorlanmaktadır.

Videodaki diğer iki rakip çerçeve, Zaman Tersine Çevirme Birleştirme (TRF) ve Oluşturucu Ara (GI), daha az eğriliğe sahip bir yorum sunar, ancak saçma ve komik dans hareketleri oluşturur, bunlar da iki verilen karenin örtük mantığını saygı göstermez.

Çalmağa tıklayınız. Tweening sorununa iki kusurlu çözüm. Sol, FILM iki kareyi basit morf hedefleri olarak ele alır. Sağ, TRF’nin bazı dans hareketlerinin eklenmesi gerektiğini bilmesi, ancak anatomi anomalileri gösteren uygulanamaz bir çözüm üretmesi.

Üstte solda, FILM’in bu sorunu nasıl ele aldığını daha yakından inceleyebiliriz. FILM, büyük hareketleri işleyebilme amacıyla tasarlanmış olmasına rağmen, önceki optical flow tabanlı yaklaşımların aksine, iki kare arasındaki mantıksal geçişi anlamakta zorluk çekmektedir.

Sağ tarafta, yukarıdaki videoda TRF’nin çabasını görüyoruz. Stable Video Diffusion (SVD) kullanılarak, iki kullanıcı tarafından sağlanan karelere uygun bir dans hareketi nasıl oluşturulabileceği daha akıllıca tahmin edilmeye çalışılmaktadır, ancak iddialı ve inanılmaz bir yaklaşım üretilmiştir.

FCVG, aşağıdaki videoda görüldüğü gibi, hareket ve kareler arasındaki içeriği daha inandırıcı bir şekilde tahmin etmektedir.

Çalmağa tıklayınız. FCVG, önceki yaklaşımlardan daha iyidir, ancak mükemmel değildir.

Hala el ve yüz kimliği gibi istenmeyen morflama gibi bazı hatalar vardır, ancak bu sürüm, yüzeyde en inandırıcı olandır ve herhangi bir ilerleme, görevin sunduğu büyük zorluğa karşı dikkate alınmalıdır.

İnterpolasyon Neden Önemlidir

Önceden de belirttiğimiz gibi, iki kullanıcı tarafından sağlanan kareler arasındaki video içeriğini inandırıcı bir şekilde doldurabilme yetisi, generatif video için zamanlı tutarlılığı korumanın en iyi yollarından biridir.

Bir tek başlangıç karesi kullanıldığında, bir generatif sistemin sınırlı dikkat penceresi, genellikle sadece yakındaki kareleri dikkate alır ve konuyla ilgili unsurları, örneğin giysi, saç ve çevre gibi, yavaş yavaş “evrimleştirme” eğilimindedir.

Çalmağa tıklayınız. Kling’e iki gerçek kaynak karesini ‘Çatıdaki Dans Eden Adam’ promosyonu ile beslediğimizde, ideal bir çözüm elde edilemedi. Kling 1.6 o zaman mevcut olmasına rağmen, V1.5, kullanıcı girişli başlangıç ve son kareleri destekleyen en son sürümdür. Kaynak: https://klingai.com/

Sorun Zaten Çözüldü mü?

Öte yandan, bazı ticari, kapalı kaynaklı ve özel sistemler bu soruna daha iyi çözümler sunuyor gibi görünüyor – özellikle RunwayML, iki kaynak kareler arasındaki inandırıcı bir ara doldurmayı başarmıştır.

Çalmağa tıklayınız. RunwayML’nin difüzyon tabanlı interpolasyonu çok etkili. Kaynak: https://app.runwayml.com/

RunwayML’yi tekrar denediğimizde, ikinci olarak da aynı derecede inandırıcı bir sonuç elde ettik.

Çalmağa tıklayınız. RunwayML’nin ikinci çalışması.

Bu durumda bir sorun, ticari bir sistemden, özellikle de kapalı kaynaklı bir sistemden, zorluğun ne şekilde aşıldığını öğrenemememizdir. Bu, benzersiz mimari yaklaşımlar, veri (veya veri toplama ve işleme yöntemleri) veya bu ve diğer olası araştırma yeniliklerinin bir bileşimi ile mi elde edildiğini bilemeyiz.

İkinci olarak, daha küçük şirketler, uzun vadede B2B API tabanlı hizmetlere bağımlı olamazlar, çünkü bu hizmetler, özellikle de bir hizmet pazarı domine ederse ve fiyatları artırma eğilimindeyse, lojistik planlarını bozmaya devam edebilirler.

Haklar Yanlışsa

Much daha önemli olarak, iyi performans gösteren bir ticari model, lisanssız verilerle eğitilmişse, bu durum RunwayML’nin durumunda olduğu gibi görünmektedir, bu durumda bu hizmetleri kullanan bir şirket, aşağı akışta yasal sorumluluğa maruz kalabilir.

Çünkü yasalar (ve bazı davalarda) başkanlardan daha uzun sürer ve kilit ABD pazarı dünyadaki en çok dava açılan pazarlardan biridir, AI eğitim verisi için daha fazla yasal denetimin mevcut eğilimi muhtemelen Donald Trump’ın sonraki başkanlık döneminde ‘hafif dokunuş’a rağmen devam edecektir.

Bu nedenle, bilgisayar görüşü araştırma sektörünün bu sorunu zor yoldan çözmesi gerekecek, böylece ortaya çıkan herhangi bir çözüm uzun vadede dayanıklı olabilir.

FCVG

Çin’den gelen yeni yöntem, Çerçevesel Koşullara Dayalı Oluşturucu Ara Video Oluşturma adlı bir makalede sunulmuştur ve Harbin Teknoloji Enstitüsü ve Tianjin Üniversitesi’nden beş araştırmacı tarafından gelmektedir.

FCVG, interpolasyon görevindeki belirsizliği, çerçevesel koşulları kullanarak ve kullanıcı tarafından sağlanan başlangıç ve son karelerde kenarlar tanımlayan bir çerçeve kullanarak çözer, bu da işlemin kareler arasındaki geçişleri daha tutarlı bir şekilde takip etmesine yardımcı olur.

Çerçevesel koşullandırma, ara karelerin oluşturulmasını alt görevlere ayırma işlemini içerir, iki kare arasındaki büyük bir anlamsal boşluğu doldurmak yerine.

Aşağıdaki grafikte, yazarlar, yukarıda bahsedilen zaman tersine çevirme yöntemini (TRF) kendi yöntemleriyle karşılaştırmaktadır. TRF, bir ön eğitimli görüntü-video modeli (SVD) kullanarak iki video oluşturma yolu oluşturur.

Önceki yaklaşımlarla FCVG karşılaştırması. Kaynak: https://arxiv.org/pdf/2412.11755

Önceki yaklaşımlarla FCVG karşılaştırması. Kaynak: https://arxiv.org/pdf/2412.11755

Yazarlar, FCVG’nin, her kareye açık bir koşul vererek, video oluşturmasında daha稳il ve tutarlı bir çıktı sağladığı için zaman tersine çevirme yöntemlerinden daha iyi olduğunu iddia etmektedirler.

Zaman tersine çevirme yöntemleri gibi TRF, belirsizliğe neden olabilir, çünkü ileri ve geri oluşturma yolları birbirinden uzaklaşabilir ve hizasızlık veya tutarsızlıklara neden olabilir. FCVG, başlangıç ve son kareler arasındaki eşleştirilmiş çizgilerden (yukarıdaki resmin sağ alt kısmında) türetilen çerçeve koşulları kullanarak bu sorunu çözer.

Çalmağa tıklayınız. FCVG projesi sayfasından başka bir karşılaştırma.

Zaman tersine çevirme, ön eğitimli video oluşturma modellerinin ara doldurma için kullanılmasını sağlar, ancak bazı dezavantajları vardır. I2V modelleri tarafından oluşturulan hareket çeşitlidir rather than stable. Bu, saf görüntü-video (I2V) görevleri için faydalıdır, ancak ara doldurma için belirsizlik yaratır ve hizasız veya tutarlı olmayan video yollarına neden olur.

Zaman tersine çevirme ayrıca, her oluşturulan video için kare hızı gibi hiperparametrelerin laboratuvar ayarlamasını gerektirir. Ayrıca, belirsizliği azaltmak için kullanılan bazı teknikler, çıkarımı önemli ölçüde yavaşlatır.

Yöntem

Yazarlar, bu sorunlardan ilkinin (çeşitlilik karşıtı stabilite) çözülmesi halinde, diğer tüm sorunların kendiliğinden çözüleceğini gözlemlemektedirler. Bu, önceki çalışmalarda, özellikle de ViBiDSampler çalışmasında denenmiştir.

Makalede denilir ki:

‘Bununla birlikte, bu yollar arasında önemli bir rastgelelik vẫn vardır, bu nedenle bu yöntemlerin, büyük hareketleri içeren senaryolarda, özellikle hızlı insan duruşu değişikliklerinde, büyük hareketleri işleme konusunda etkililiğini sınırlar.’

‘Dolayısıyla, her kare için açık bir koşul sunmayı öneriyoruz, bu da ara doldurma yolunun belirsizliğini önemli ölçüde azaltır.’

FCVG’nin temel kavramlarını aşağıdaki şemada görebiliriz. FCVG, iki girdi karesiyle tutarlı bir şekilde başlayan ve biten bir video karesi dizisi oluşturur.

FCVG çıkarımı şeması.

FCVG çıkarımı şeması.

Bu, zaman tersine çevirme yaklaşımının yeniden düşünülmesi, ileri ve geri yönlere ait bilgileri birleştirerek, pürüzsüz geçişler oluşturur.

Sürecin bir sonraki aşaması, ön eğitimli GlueStick çizgi eşleme modelinin kullanılmasıdır.

FCVG'de çizgi eşleştirmesi için GlueStick.

FCVG’de çizgi eşleştirmesi için GlueStick.

Yazarlar, ControlNeXt girişimi için geliştirilen yöntemi kullanarak, elde edilen çerçeve koşullarını SVD’ye enjekte eder.

Modelin çoğu parametresi dondurulur ve SVD modeli, 70.000 iterasyon için AdamW optimizatörü altında, 1×10-6 öğrenme hızıyla ve 512×320 yamalarla fine-tune edilir.

Makalede denilir ki:

‘Bu sınırlamalar büyük ölçüde FCVG’de çözülmüştür: (i) Her kare için açık bir koşul belirleyerek, ileri ve geri yollar arasındaki belirsizlik önemli ölçüde azaltılır; (ii) yalnızca bir ayarlanabilir parametre tanıtılırken, SVD’deki hiperparametreler varsayılan olarak tutulur ve çoğu senaryoda olumlu sonuçlar verir; (iii) Basit bir ortalama birleştirme, gürültü yeniden enjekte edilmeden, FCVG’de yeterlidir ve çıkarım adımları %50 oranında azaltılabilir.’

Veri ve Testler

Araştırmacılar, çeşitli sahneleri içeren bir veri kümesi oluşturdular: dış mekanlar, insan duruşları, iç mekanlar ve kamera hareketleri, dans eylemleri ve yüz ifadeleri gibi hareketler.

524 klibin seçildiği bu veri kümesi, DAVIS ve RealEstate10k veri kümelerinden alınmıştır.

Toplanan veri kümesi, 4:1 oranında fine-tune ve test arasında bölünmüştür.

Kullanılan metriklere Öğrenilen Algısal Benzerlik Metrikleri (LPIPS), Fréchet Inception Mesafesi (FID), Fréchet Video Mesafesi (FVD), VBench ve Fréchet Video Hareket Mesafesi dahildir.

Yazarlar, bu metriklere dayanarak, FCVG’nin diğer yöntemlere göre daha iyi performans gösterdiğini belirtmektedirler.

SONUÇ

FCVG, açık kaynaklı bir bağlamda, video kareleri arasında ara doldurma için devlet-sanatının en azından bir adım ilerlemesini temsil etmektedir.

Yazarlar, bu çalışmanın kodunu GitHub üzerinde yayınlamışlardır.

Ticari, kapalı kaynaklı çözümler, web’den kazanılan, lisanssız veriler kullanılarak açık kaynaklı çabaları aşmaktadır, ancak bu yaklaşımın ticari kullanım için geleceği sınırlı görünmektedir.

Bu nedenle, açık kaynaklı sahne, ticari liderlerin gösterişli sunumlarını geride bıraksa bile, uzun vadede kazanan “tavşan” olabilir.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai