Anderson’un Açısı

İyileştirilmiş Nesnel Generatif AI Videosu Çerçeveleri Sırasında Eğitim Sırasında Karıştırma

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
Adobe Firefly, various prompts and edits.

Bu hafta Arxiv’de yayınlanan bir yeni makale, Hunyuan Video veya Wan 2.1 AI video jeneratörlerini benimsemiş olan herkesin şimdiye kadar karşılaştığı bir sorunu ele alıyor: temporal anormallikler, yani jeneratif süreçlerin突然 hızlanması, birleştirmesi, atlaması veya oluşturulan videodaki kritik anları başka şekilde bozmaya eğilimi.

Çalmaya da oynatma. Bazı temporal hataları, yeni makalede vurgulanan, yeni FluxFlow yaklaşımının sağladığı iyileştirmelerle birlikte. Kaynak: https://haroldchen19.github.io/FluxFlow/

Yukarıdaki video, makale için örnek test videolarından alınan parçaları içerir (uyarı: oldukça kaotik) proje sitesi. İyileştirilen sorunları görebiliyoruz (videonun sağ tarafında), yazarların yöntemiyle (resimde sağda), efektif bir veri ön işleme tekniği olarak uygulanabilir.

İlk örnekte, ‘iki çocuk bir top ile oynuyor’ videosu, CogVideoX tarafından oluşturuldu ve videonun sol tarafında ve aşağıdaki özel örneklerde, yerel jenerasyonun mikro-hareketleri atladığını ve çocukların aktivitesini bir ‘çizgi film’ hızına çıkardığını görebiliyoruz. Buna karşılık, aynı veri kümesi ve yöntem, yeni ön işleme tekniğiyle, FluxFlow (aşağıdaki videonun sağ tarafında) daha iyi sonuçlar veriyor:

Çalma.

İkinci örnekte (NOVA-0.6B kullanılarak), bir kedinin merkezi hareketi, eğitim aşamasında bazı şekilde bozulmuş veya önemli ölçüde az örneklenmiş, öyle ki jeneratif sistem ‘felç’ oluyor ve nesneyi hareket ettiremiyor:

Çalma.

Bu sendrom, yani hareketin veya nesnenin ‘takıldığı’ durum, HV ve Wan 2.1’in çeşitli görüntü ve video sentez gruplarında en sık rapor edilen sorunlardan biri.

Bazı bu sorunlar, kaynak veri kümesindeki video altyazı sorunlarıyla ilgili, bunları bu hafta inceledik; ancak yeni çalışmanın yazarları, çabalarını eğitim verilerinin temporal niteliklerine odaklıyor ve bu perspektiften gelen zorlukları ele almanın faydalı sonuçlar doğurabileceğini ikna edici bir şekilde savunuyorlar.

Önceki makalede de belirttiğimiz gibi, belirli sporlar kritik olayları (örneğin, bir slam-dunk) necessary dikkat çekmelerine rağmen, bunları birleştirerek öğrenmek özellikle zordur:

Çalma.

Yukarıdaki örnekte, jeneratif sistem, bir sonraki hareket aşamasına nasıl geçeceğini bilmiyor ve mantıksız bir şekilde bir pozdan diğerine geçiş yapıyor, oyuncunun tutumunu ve geometrisini değiştiriyor.

Bunlar, eğitimde kaybolan büyük hareketler – ancak aynı zamanda çok daha küçük ancak kritik hareketler, bir kelebeğin kanat çırpması gibi:

Çalma.

Slam-dunk’tan farklı olarak, kanat çırpması bir ‘nadir’ değil, sondern sürekli ve monoton bir olay. Ancak, hareket o kadar hızlı ki, temporal olarak kurulması çok zor.

Bunlar özellikle yeni sorunlar değil, ancak güçlü jeneratif video modelleri yerel olarak kurulabilir ve ücretsiz olarak jeneratif olduğunda daha fazla dikkat çekiyorlar.

Reddit ve Discord toplulukları, bu sorunları başlangıçta ‘kullanıcı ile ilgili’ olarak ele aldılar. Bu, anlaşılabilir bir varsayım, çünkü ilgili sistemler çok yeni ve minimal olarak belgelenmiştir. Bu nedenle, çeşitli uzmanlar HV ve Wan 2.1 için çeşitli ComfyUI iş akışlarının çeşitli bileşenlerinde ayarları değiştirme gibi çeşitli (ve her zaman etkili olmayan) çözümler önerdiler.

Bazı durumlarda, HV ve Wan, hızlı hareket yerine yavaş hareket üretebiliyor. Reddit ve ChatGPT’den (çoğunlukla Reddit’i kullanıyor) gelen öneriler, istenen jenerasyonun çerçevelerini değiştirmeyi veya çerçeveleri radikal olarak düşürmeyi içeriyor*.

Bu, umutsuzca bir şeyler deneme; ortaya çıkan gerçeklik, bu sorunların nedeninin ve kesin çözümünün henüz bilinmediği; açıkçası, bu sorunların etrafında generation ayarlarını değiştirmek (özellikle bu, çıktı kalitesini düşürürse, örneğin çok düşük bir fps oranında) sadece geçici bir çözüm ve araştırmaların bu sorunları bu kadar hızlı ele alması iyi.

Öyleyse, bu haftaki video altyazılarının eğitim üzerindeki etkisine baktığımız gibi, yeni makaledeki temporal düzenleme hakkında da bir göz atalım.

Merkezi fikir oldukça basit ve bu nedenle de kötü değil; makale,八 sayfaya ulaşmak için biraz şişirilmiş ve gerektiğinde bu şişirmeyi atlayacağız.

VideoCrafter framework'ünün yerel jenerasyonunda balık statikken, FluxFlow'da değişiklikler gerekli değişiklikleri yakalıyor. Kaynak: https://arxiv.org/pdf/2503.15417

VideoCrafter framework’ünün yerel jenerasyonunda balık statikken, FluxFlow’da değişiklikler gerekli değişiklikleri yakalıyor. Kaynak: https://arxiv.org/pdf/2503.15417

Yeni çalışma, Temporal Regularization Makes Your Video Generator Stronger başlıklı ve Everlyn AI, Hong Kong Bilim ve Teknoloji Üniversitesi (HKUST), Central Florida Üniversitesi (UCF) ve Hong Kong Üniversitesi’nden (HKU) sekiz araştırmacının katkılarıyla yazılmıştır.

(yazının yazıldığı sırada, makalenin eşlik eden proje sitesi ile ilgili bazı sorunlar vardı)

FluxFlow

Yazarların yeni ön eğitim şeması olan FluxFlow behindaki merkezi fikir, yaygin parlama ve temporal tutarlılık sorunlarını, eğitim verilerinin temporal çerçeve sırasını karıştırarak aşmaktır:

FluxFlow'un arkasındaki merkezi fikir, blokları ve blokların gruplarını beklenmedik ve temporal olmayan konumlara taşıyarak veri artırımı olarak hareket etmektir.

FluxFlow’un arkasındaki merkezi fikir, blokları ve blokların gruplarını beklenmedik ve temporal olmayan konumlara taşıyarak veri artırımı olarak hareket etmektir.

Makale açıklıyor:

‘[Sanat eserleri] temel bir sınırlamadan kaynaklanıyor: büyük ölçekli veri kümelerine rağmen, mevcut modeller genellikle eğitim verilerinin basitleştirilmiş temporal kalıplarına güveniyor (örneğin, sabit yürüme yönleri veya tekrarlayan çerçeve geçişleri) rather than öğrenmek için çeşitli ve inandırıcı temporal dinamikler.

‘Bu sorun, eğitim sırasında açık temporal artırımın eksikliği ile daha da kötüleşiyor, böylece modeller, çeşitli motion senaryoları üzerinde genellemek yerine, sahte temporal korelasyonlara (örneğin, “çerçeve #5, #4’ü takip etmelidir”) karşı duyarlı hale geliyor.’

Çoğu video jenerasyon modeli, hala görüntü sentezinden ödünç alıyor, uzaysal doğruluğa odaklanırken büyük ölçüde temporal ekseni görmezden geliyor. Çerçeveleri kırpma, çevirme ve renk kararma gibi teknikler, statik görüntü kalitesini iyileştirmeye yardımcı oldu, ancak videolarda, hareketin illüzyonu sürekli geçişlere bağlı olduğundan, bunlar yeterli çözümler değil.

Bunun sonucu, parlamayan dokular, çerçeveler arasındaki rahatsız edici kesmeler ve tekrar eden veya aşırı basit hareket kalıpları gibi sorunlar.

Çalma

Makale, bazı modellerin – Stable Video Diffusion ve LlamaGen gibi – artan karmaşık mimariler veya mühendislik kısıtlamalarıyla telafi ettiğini, ancak bu türlerin hesaplama ve esneklik maliyetine sahip olduğunu savunuyor.

Temporal veri artırımının zaten video anlama görevlerinde (örneğin, FineCliper, SeFAR ve SVFormer gibi çerçevelerde) faydalı olduğunu kanıtlamış olmasına rağmen, yazarlar, bu taktiğin jeneratif bir bağlamda neden nadiren uygulandığını şaşırıyorlar.

Bozucu Davranış

Araştırmacılar, eğitim sırasında temporal sırayı basit, yapılandırılmış bozucu davranışlar ile karıştırmanın, modellerin gerçekçi, çeşitli hareketlere genellemesine yardımcı olabileceğini savunuyor:

‘Düzensiz sıralara eğitim vererek, jeneratör, inandırıcı yolları geri kazanmayı öğrenir, böylece temporal entropiyi düzenler. FLUXFLOW, ayrımcı ve jeneratif temporal artırım arasında köprü kurar ve temporally inandırıcı video jenerasyonu için bir artırım çözümü sunar ve genel kaliteyi geliştirir.

‘Mevcut yöntemlerin mimari değişiklikler veya son işlemlere güvenmek yerine, FLUXFLOW doğrudan veri düzeyinde çalışır ve eğitim sırasında kontrol edilen temporal pertürbasyonlar sunar.’

Çalma

Çerçeve seviyesi pertürbasyonları, yazarlar göre, bir dizi içinde ince düzeyde bozulmalar sunar. Bu tür bir bozulma, masking artırımına benzer, burada veri parçaları rastgele engellenir, böylece sistem aşırı uyumu önler ve daha iyi genellemeyi teşvik eder.

Testler

Merkezi fikir burada tam bir makaleye ulaşmasa da, bir test bölümü var ve buna bir göz atabiliriz.

Araştırmacılar, dört sorgu için test etti: iyileştirilmiş temporal kaliteyi korurken uzaysal doğruluğu koruma yeteneği; hareket/optik akış dinamikleri öğrenme yeteneği; dış jenerasyonda temporal kaliteyi koruma; ve ana hiperparametrelere duyarlılık.

Araştırmacılar, FluxFlow’u üç jeneratif mimariye uyguladı: U-Net tabanlı, VideoCrafter2 şeklinde; DiT tabanlı, CogVideoX-2B şeklinde; ve AR tabanlı, NOVA-0.6B şeklinde.

Adil bir karşılaştırma için, temel modellerini FluxFlow ile bir ek eğitim aşaması olarak, bir epoch için, OpenVidHD-0.4M veri kümesiyle fine-tuned ettiler.

Modeller, iki popüler benchmark ile değerlendirildi: UCF-101 ve VBench.

UCF için, Fréchet Video Distance (FVD) ve Inception Score (IS) metrikleri kullanıldı. VBench için, araştırmacılar temporal kalite, çerçeve bazlı kalite ve genel kaliteye odaklandı.

FluxFlow-Frame'in nicel ilk değerlendirmesi.

FluxFlow-Frame’in nicel ilk değerlendirmesi. "+ Orijinal" FLUXFLOW olmadan eğitim gösteriyor, "+ Num × 1" ise farklı FluxFlow-Frame yapılandırmalarını gösteriyor. En iyi sonuçlar gölgeli, ikinci en iyi sonuçlar her model için alt çizgili.

Bu sonuçlar hakkında yorum yapan araştırmacılar:

‘Hem FLUXFLOW-FRAME hem de FLUXFLOW-BLOCK, temporal kaliteyi önemli ölçüde geliştiriyor, bu da Tablo 1, 2’deki (yani FVD, Konu, Parlama, Hareket ve Dinamik) metriklere ve [aşağıdaki resimdeki] niteliksel sonuçlara kanıtlanıyor.

‘Örneğin, VC2’deki sürüklenen arabanın hareketi, NOVA’daki kedinin kuyruğunu kovalaması ve CVX’deki sörfçünün dalgaya binmesi, FLUXFLOW ile daha akıcı hale geliyor. Önemli olan, bu temporal geliştirmelerin uzaysal doğruluktan fedakarlık etmeden elde edildiği, su sıçramalarının, duman izlerinin ve dalga dokularının keskin ayrıntıları ve uzaysal ve genel doğruluk metrikleriyle kanıtlanıyor.’

Aşağıda, yazarların bahsettiği niteliksel sonuçlardan seçimler görüyoruz (orijinal makale için tam sonuçlar ve daha iyi bir çözünürlük için lütfen orijinal makaleye bakın):

Niteliksel sonuçlardan seçimler.

Niteliksel sonuçlardan seçimler.

Makale, hem çerçeve seviyesi hem de blok seviyesi pertürbasyonlarının temporal kaliteyi geliştirdiğini, ancak çerçeve seviyesi yöntemlerinin daha iyi performans gösterdiğini savunuyor. Bu, daha ince düzeyde ayarlamalar yapabilmeleri nedeniyle atribüt ediliyor. Blok seviyesi pertürbasyonları, bloklar içindeki sıkı bir şekilde bağlantılı uzaysal ve temporal kalıplar nedeniyle gürültüye neden olabilir ve bu da onların etkinliğini azaltabilir.

Sonuç

Bu makale, bu hafta yayınlanan Bytedance-Tsinghua altyazı işbirliği ile birlikte, yeni jeneratif video modellerindeki görünür eksikliklerin, kullanıcı hatasından, kurumsal yanlış adımlardan veya fonlama sınırlamalarından değil, daha acil zorluklara öncelik veren araştırma odaklı olmasından kaynaklanabileceğini bana gösterdi.

Şimdiye kadar, ücretsiz olarak indirilebilen ve kurulabilen jeneratif video sistemlerinin sonuçları o kadar bozulmuştur ki, bu sorunları gidermek için hiçbir büyük çaba ortaya çıkmamıştır (en azından çünkü sorunlar temel ve kolayca çözülemezdi).

Şimdi, tamamen AI tarafından oluşturulmuş foto gerçekçi video çıkışının uzun süredir öngörülen çağına çok yakınken, hem araştırma hem de toplulukların bu kalan sorunları çözmeye daha derin ve üretken bir ilgi gösterdiğini görmek güzel.

 

* Wan’ın yerel çerçeve hızı yalnızca 16fps’dir ve kendi sorunlarıma cevaben, forumların çerçeve hızını 12fps’ye kadar düşürmeyi ve sonra FlowFrames veya diğer AI tabanlı yeniden akış sistemlerini kullanarak böyle bir düşük çerçeve sayısının arasındaki boşlukları interpolasyon etmeyi önerdiğini not ediyorum.

İlk olarak 21 Mart 2025 Cuma günü yayınlandı

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'nin Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: [email protected]