Yapay zeka modelleri ve platformları

Uzun Video Oluşturma için Anlatı Sürekliliğini Pişirmek

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
ChatGPt 4o: 'an image with a width of 1792px and a height of 1024px. It should depict an orthographic view of an AI factory where rows of white-coated computer analysts are seated in front of PCs, and on the other side of their section is a conveyer belt with multiple stages of a recipe for a cake. Three video cameras are situated equidistant across the conveyer belt, aimed at the food items.'

Çok modelli görme-dil modellerinin bir gün tüm filmleri oluşturabileceği konusundaki potansiyel hakkında süregelen tartışmaları yoğunlaştıran Hunyuan Video üretken AI modelinin yakın zamanda halka açık şekilde yayınlanması

Ancak, gözlemlediğimiz gibi, bu çok uzak bir perspektiftir ve bunun birçok nedeni vardır. Bunlardan biri, çoğu AI video üreticisinin çok kısa dikkat penceresidir ve bu, bir dizi çekim yerine tek bir çekimde bile tutarlılığı sürdürmekte zorlanırlar.

Diğer bir neden, video içeriğine tutarlı referanslar (örneğin, keşfedilebilir ortamlar, bunlar rastgele değişmemelidir) yalnızca difüzyon modellerinde low-rank adaptation (LoRA) gibi özelleştirme teknikleri ile elde edilebilir ve bu da temel modellerin kutudan çıkan yeteneklerini sınırlar.

Bu nedenle, üretken video gelişimi, yeni anlatı sürekliliği yaklaşımları geliştirilmezse durma noktasına gelmek üzeredir.

Süreklilik Tarifi

Bunu göz önünde bulundurarak, ABD ve Çin arasında yeni bir işbirliği, gelecekteki anlatı sürekliliği sistemleri için olası bir şablon olarak talimatlı mutfak videoları kullanımını önerdi.

Oynatmak için tıklayın. VideoAuteur projesi, bir mutfak işleminin kısımlarının analizini sistematize eder ve yeni bir veri kümesi ve video oluşturma için bir orkestrasyon yöntemi üretir. Daha iyi çözünürlük için kaynak siteye başvurun. Kaynak: https://videoauteur.github.io/

VideoAuteur olarak adlandırılan çalışma, talimatlı mutfak videolarını oluşturmak için anahtar kareler ve altyazılar birleştiren iki aşamalı bir boru hattı önerir ve -kabul edilemez bir alanda- state-of-the-art sonuçlar elde eder.

VideoAuteur’un proje sayfası, aynı tekniği kullanan ve daha dikkat çekici beberapa videoyu da içerir, örneğin (var olmayan) bir Marvel/DC kesişme filmi için önerilen bir fragman:

Oynatmak için tıklayın. İki süper kahraman, alternatif evrenlerden bir araya gelir ve VideoAuteur’un sahte bir fragmanında yüzleşirler. Daha iyi çözünürlük için kaynak siteye başvurun.

Sayfa, benzer şekilde stilize edilmiş tanıtım videolarını da içerir, örneğin eşit derecede var olmayan bir Netflix hayvan serisi ve bir Tesla (TSLA ) araba reklamı.

VideoAuteur’u geliştirirken, yazarlar çeşitli kayıp fonksiyonları ve diğer yeni yaklaşımları denediler. Bir nasıl-yapılır oluşturma iş akışı geliştirmek için, ayrıca CookGen adlı, mutfak alanına odaklanan en büyük veri kümesini derlediler ve bu, ortalama 9,5 saniye süren 200.000 video klipten oluşur.

Ortalama 768,3 kelime/video ile CookGen, rahatça kendi türünün en kapsamlı olarak açıklanmış veri kümesidir. Çeşitli görme-dil modelleri, açıklamaların mümkün olduğunca ayrıntılı, ilgili ve doğru olmasını sağlamak için diğer yaklaşımlarla birlikte kullanılmıştır.

Mutfak videoları, mutfak talimatları yürüyüşlerinin yapılandırılmış ve açık bir anlatısı olması nedeniyle seçilmiştir, bu da açıklama ve değerlendirme işini daha kolay hale getirir. Bu konkrét bir alanda, muhtemelen bu alana girecek olan pornografik videolar dışında, başka hiçbir türün görsel ve anlatısal olarak “formül”e bu kadar yakın olduğunu düşünmek zordur.

Yazarlar şöyle diyor:

‘Önerdiğimiz iki aşamalı oto-regresif boru hattı, uzun bir anlatı direktörü ve görsel koşullu video oluşturma içerir ve üretilen uzun anlatı videolarında anlamsal tutarlılık ve görsel doğrulukta vaat edilen gelişmeler gösterir.

‘Deneyimlerimiz, video dizileri boyunca mekânsal ve zamanlı tutarlılıkta gelişmeler gözlememize olanak tanır. ‘

‘Umarız ki, çalışmamız uzun anlatı video oluşturma alanında weitere araştırmaları teşvik edebilir.’

Yeni çalışma yayınlandı ve VideoAuteur: Uzun Anlatı Video Oluşturma Doğru olarak adlandırıldı ve Johns Hopkins Üniversitesi, ByteDance ve ByteDance Tohumu’ndan sekiz yazar tarafından geldi.

Veri Kümesi Oluşturma

CookGen’i geliştirmek için, VideoAuteur’un yazarları YouCook ve HowTo100M koleksiyonlarından materyal kullandılar. Yazarlar, CookGen’in ölçeklerini, Flintstones veri kümesi, Pororo çizgi film veri kümesi, StoryGen, Tencent’in StoryStream ve VIST gibi önceki veri kümeleriyle karşılaştırdılar.

CookGen ve en yakın benzer veri kümeleri arasındaki görsel ve metin uzunluğu karşılaştırması. Kaynak: https://arxiv.org/pdf/2501.06173

CookGen ve en yakın benzer veri kümeleri arasındaki görsel ve metin uzunluğu karşılaştırması. Kaynak: https://arxiv.org/pdf/2501.06173

CookGen, gerçek dünya anlatılarına, özellikle prosedürel aktivitelere (örneğin, mutfak) odaklanır ve bu, daha açık ve daha kolay açıklanabilir hikayeler sunar, özellikle de görüntü tabanlı çizgi roman veri kümelerine kıyasla.

Araştırmacılar bir altyazı modelini LLaVA-NeXT metodolojisi temelinde fine-tuned etti. HowTo100M için elde edilen otomatik konuşma tanıma (ASR) pseudo-etiketleri, her video için “aksiyonlar” olarak kullanıldı ve daha sonra büyük dil modelleri (LLM) ile daha da geliştirildi.

Örneğin, ChatGPT-4o, bir altyazı veri kümesi üretmek için kullanıldı ve nesne-nesne etkileşimleri (örneğin, elilerin araçları ve gıdayı ele geçirmesi), nesne öznitelikleri ve zaman dinamikleri üzerinde odaklanması istendi.

ASR komut dosyalarının muhtemelen yanlışlıklar içerebileceği ve genellikle “gürültülü” olabileceği için, Kesişim-Üzeri-Birlik (IoU), altyazıların ele aldıkları video bölümüne ne kadar uyduğunu ölçmek için bir ölçüt olarak kullanıldı. Yazarlar, bu adımın anlatı tutarlılığının oluşturulması için çok önemli olduğunu belirttiler.

Derlenen klipler, Fréchet Video Distance (FVD) kullanılarak değerlendirildi, bu, gerçek dünya (gerçek) örnekleri ve üretilen örnekleri, hem ground truth ana kareleri hem de ground truth ana kareleri olmadan ölçen bir metriktir ve sonuç olarak bir performans elde edildi:

Yeni altyazılar ile oluşturulan videoların, hem ana kareleri hem de ana kareleri olmadan, FVD kullanarak uzaklığını değerlendirmek.

Yeni altyazılar ile oluşturulan videoların, hem ana kareleri hem de ana kareleri olmadan, FVD kullanarak uzaklığını değerlendirmek.

Ayrıca, klipler hem GPT-4o tarafından hem de altı insan annotatörü tarafından LLaVA-Hound‘un “hayal gücü” tanımına göre değerlendirildi (yani, bir modelin sahte içerik oluşturma yeteneği).

Araştırmacılar, altyazıların kalitesini Qwen2-VL-72B koleksiyonu ile karşılaştırdı ve biraz geliştirilmiş bir puan elde etti.

Qwen2-VL-72B ve yazarların koleksiyonu arasındaki FVD ve insan değerlendirme puanlarının karşılaştırılması.

Qwen2-VL-72B ve yazarların koleksiyonu arasındaki FVD ve insan değerlendirme puanlarının karşılaştırılması.

Yöntem

VideoAuteur’un üretken aşaması, Uzun Anlatı Yöneticisi (LND) ve Görsel Koşullu Video Oluşturma Modeli (VCVGM) arasında bölünmüştür.

LND, anlatı akışını karakterize eden görsel gömme veya ana kareler dizisi üretir, bu da “temel vurgulara” benzer. VCVGM, bu seçimlere dayanarak video klipleri üretir.

VideoAuteur işleme boru hattının şeması. Uzun Anlatı Yöneticisi, Seed-X güdümlü üretken modüle beslemek için uygun seçimler yapar.

VideoAuteur işleme boru hattının şeması. Uzun Anlatı Yöneticisi, Seed-X güdümlü üretken modüle beslemek için uygun seçimler yapar.

Yazarlar, araya giren görüntü-metin yönetici ve dil-merkezli ana kare yönetici arasındaki farklılıkları geniş çapta tartışır ve formerin daha etkili bir yaklaşım olduğunu sonucuna varırlar.

Araya giren görüntü-metin yönetici, metin tokenlerini ve görsel gömmeleri birleştiren bir dizi üretir, bir oto-regresif model kullanarak, her iki görüntü ve metin bağlamının birleşik bağlamına dayanarak bir sonraki tokeni öngörür. Bu, görseller ve metin arasında sıkı bir hizalama sağlar.

Diğer yandan, dil-merkezli ana kare yönetici, yalnızca altyazılar temelinde, görsel gömmeleri üretim sürecine dahil etmeden, bir metin koşullu difüzyon modeli kullanarak ana kareler sentezler.

Araştırmacılar, dil-merkezli yöntemin görsel olarak çekici ana kareler ürettiğini, ancak kareler arasında tutarlılık eksikliği olduğunu buldular. Araya giren yöntemin daha yüksek gerçeklik ve görsel tutarlılık puanları elde ettiğini, ancak bazen tekrarlayan veya gürültülü unsurlar üretebildiğini savundular.

Alışılmadık bir şekilde, Stable Diffusion ve Flux’un iş akışlarına dahil edildiği bir araştırma kolunda, yazarlar Tencent’in SEED-X 7B-parametreli çok modelli LLM temel modelini üretken boru hattı için kullandılar (ancak bu model, Stability.ai’nin SDXL sürümünü, mimarisinin sınırlı bir kısmında kullanır).

Yazarlar şöyle diyor:

‘Klasik Image-to-Video (I2V) boru hattının aksine, bizim yaklaşımımız, bir görüntüyü başlangıç çerçevesi olarak kullanmak yerine, [regresyonlu görsel latents] olarak sürekli koşulları kullanır. ‘

‘Ayrıca, üretilen videoların dayanıklılığını ve kalitesini, regresyon hataları nedeniyle mükemmel olmayabilecek regresyonlu görsel latents ile başa çıkmak için modeli uyarlayarak geliştiriyoruz.’

Tipik görsel koşullu üretken boru hatlarının aksine, VideoAuteur bu paradigmayı, çok parçalı görsel durumların üretilmesi ile genişletir, bu da “başlangıç çerçevelerine” dayalı daha sonraki üretimi temel alan potansiyel yanlılığı önler.

Görsel durum gömmelerinin bir üstün koşullama yöntemi olarak kullanılması şeması.

Görsel durum gömmelerinin bir üstün koşullama yöntemi olarak kullanılması şeması.

Testler

Araştırmacılar, SeedStory yöntemlerini izleyerek, SEED-X’i narrative veri kümesinde LoRA fine-tuning için uyguladılar ve sonucu “Sora benzeri bir model” olarak tanımladılar, büyük ölçekli video/metin çiftlerine önceden eğitilmiş ve hem görsel hem de metin koşullarını kabul edebilen bir model olarak tanımladılar.

32.000 narrative video, model geliştirme için kullanıldı ve 1.000 tanesi doğrulama örnekleri olarak ayrıldı. Videolar, kısa kenarına 448 piksel olarak kırpıldı ve ardından 448x448px olarak merkezden kırpıldı.

Eğitim için, narrative oluşturma öncelikle YouCook2 doğrulama kümesi üzerinde değerlendirildi. Howto100M kümesi, veri kalitesi değerlendirmesi için ve ayrıca görüntü-video oluşturma için kullanıldı.

Görsel koşullama kaybı için, yazarlar DiT difüzyon kaybı ve Stable Diffusion temelinde 2024 çalışmasını kullandılar.

Araya giren yöntemin daha üstün bir yaklaşım olduğunu kanıtlamak için, yazarlar VideoAuteur’u yalnızca metin tabanlı girişe dayanan yöntemlerle karşılaştırdı: EMU-2, SEED-X, SDXL ve FLUX.1-schnell (FLUX.1-s).

Küresel bir.prompt için, 'Mapo tofu pişirme adımları', araya giren yönetici, eylemleri, altyazıları ve görüntü gömmelerini sırayla üretir. İlk iki satır, EMU-2 ve SEED-X laten uzaylarından decoded ana kareleri gösterir. Bu görüntüler gerçekçi ve tutarlı, ancak SDXL ve FLUX gibi gelişmiş modellerinkine göre daha az parlaktır.

Küresel bir.prompt için, ‘Mapo tofu pişirme adımları’, araya giren yönetici, eylemleri, altyazıları ve görüntü gömmelerini sırayla üretir. İlk iki satır, EMU-2 ve SEED-X laten uzaylarından decoded ana kareleri gösterir. Bu görüntüler gerçekçi ve tutarlı, ancak SDXL ve FLUX gibi gelişmiş modellerinkine göre daha az parlaktır.

Yazarlar şöyle diyor:

‘Dil-merkezli yaklaşım, metin-görüntü modelleri kullanarak görsel olarak çekici ana kareler üretir, ancak kareler arasında tutarlılık eksikliği nedeniyle acı çeker. Buna karşılık, araya giren üretim yöntemi, dil-hizalı görsel latents kullanarak gerçekçi bir görsel stil elde eder ve eğitim yoluyla gerçekçi bir görsel stil elde eder. ‘

‘Ancak, bazen tekrarlayan veya gürültülü unsurlar üretebilir, çünkü oto-regresif model, tek bir geçişte doğru gömmeleri oluşturmakta mücadele eder.’

İnsan değerlendirmesi, yazarların araya giren yaklaşımın geliştirilmiş performans iddiasını daha da doğrular ve araya giren yöntemler bir ankette en yüksek puanları alır.

Makale için yapılan bir insan çalışmasından karşılaştırmalar.

Makale için yapılan bir insan çalışmasından karşılaştırmalar.

Ancak, dil-merkezli yaklaşımlar estetik puanlarında en iyisidir. Yazarlar, bunun uzun narrative videolarının oluşturulmasındaki temel vấnenin olmadığını iddia eder.

Oynatmak için tıklayın. VideoAuteur tarafından üretilen pizza inşa video segmentleri.

SONUÇ

Uzun-form video oluşturma中的 narrative tutarlılığı ile ilgili en popüler araştırma alanı, tek görüntülerle ilgilidir. Bu tür projeler arasında DreamStory, StoryDiffusion, TheaterGen ve NVIDIA’nın ConsiStory bulunur.

Bir anlamda, VideoAuteur da bu “statik” kategoriye girer, çünkü üretilen klibin bölümlerinden üretilen ana görselleri kullanır. Ancak, video ve anlamsal içeriğin araya girmesi, süreci daha pratik bir boru hattına bir adım daha yaklaştırır.

 

İlk olarak 16 Ocak 2025 Perşembe günü yayınlandı.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai