Anderson’un Açısı

1 Kareden Fazla Hızda Video Altyazılarının Zorluğu

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
Trails in a basketball scene - source: https://www.youtube.com/watch?v=ORfjgE6n2Pc

Makine öğrenimi sistemlerinin videolar içindeki olayları tanıma yeteneği, AI tabanlı video oluşturmanın geleceği için çok önemlidir – en azından video verisetlerinin kullanıcı taleplerine uygun ve fazla hayal görme yapmayan modeller üretmesi için doğru altyazılar gerektirir.

Google'un VidReCap projesinin bir altyazı şeması örneği. Kaynak: https://sites.google.com/view/vidrecap

Google’un VidReCap projesinin bir altyazı şeması örneği. Kaynak: https://sites.google.com/view/vidrecap

İhtiyaz edilen video ölçekli manuel altyazılar yapmak mantıksız bir prospektüs. AI sistemlerini video altyazılarını otomatik olarak oluşturmaya eğitmek mümkün olsa da, çeşitlilik ve kapsam için hala birçok insan tarafından oluşturulmuş örneklere ihtiyaç vardır.

Daha da önemlisi, neredeyse tüm güncel AI tabanlı video altyazı modelleri 1 kare/saniye hızında çalışır, bu da birçok senaryoda varyasyonları ayırt etmek için yeterli değildir: duygusal tanıma sistemleri için aniden değişen mikro ifadeler; yüksek hızlı sporlarda hızlı olaylar; şiddetli hareketler; dramatik filmlerde hızlı kesmeler, burada PySceneDetect gibi sistemler bunları tanımlayamayabilir veya kullanılmayabilir; ve daha birçok senaryo где dikkatin penceresi açıkça daha yoğun olmalıdır.

Oynatmak için tıklayın. Dünya şampiyonluğunu Ray Reardon’a karşı 1982’de kazanan Alex Higgins’in hızlı ancak hayat değiştiren bir aksiyonu, dünyanın en yavaş sporlarından birinde. Kaynak: https://www.youtube.com/watch?v=_1PuqKno_Ok

Hızlı Hareket Et ve Mantığı Boz

Bu düşük hız, çeşitli lojistik nedenlerle standarttır. Birincisi, video altyazıları kaynak yoğun bir faaliyettir, sistem bir kareyi sırayla inceleyerek veya çeşitli yöntemlerle bir dizi kareyi anlamlı bir altyazı dizisine semantik olarak birleştirebilir. Her iki durumda da, bağlam penceresi donanım kısıtlamaları tarafından sınırlıdır.

1 kare/saniye’nin güncel standart olmasının bir başka nedeni, videoların genellikle hızlı olaylarla dolu olmamasıdır; bu nedenle, 300 statik snooker masası karesine, şampiyonluğu kazanan pot edilen siyah topun saniyesine aynı ilgiyi göstermek gereksizdir (yukarıdaki örneğe bakın).

Videoyu daha geniş ikincil ipuçları kullanarak hızlı olayları tanımlamak mümkündür, örneğin bir basketbol maçında hızlı bir slam-dunk’a tepki gösteren kalabalığın sürekli tepkisi. Ancak bu ipuçları diğer nedenlerle de oluşabilir (örneğin, beklenmedik oyuncu yaralanmaları) ve bunlara güvenmek mümkün değildir. Bu, yanlış etiketlenmiş bir video verisetinin, talimatlara uymayan veya yanlış anlayan bir video oluşturma modeline yol açabileceği bir örnektir, yani model, bir slam-dunk oluşturmasını istendiğinde bir oyuncu yaralanmasını gösterebilir (çünkü ‘ikincil ipucu’ olan kalabalık tepkisi, belirli bir olaya özgü değildir).

Bu, birçok yönden bir ‘bütçe’ sorunudur ve diğer yönlerden bir prosedür sorunudur. Bugüne kadar kullanılan çerçeveler, seyrek ana karelerin temel bilgileri etkili bir şekilde yakalayabileceği ilkesine dayanıyordu, ancak bu, video konusunun diğer yönlerini, örneğin türünü belirlemede daha etkiliydi, çünkü bu durumda kanıtlar birden fazla kare boyunca sürer.

F-16

Çin’den bir yeni makale, 16 kare/saniye hızında video analiz edebilen ilk çok modelli büyük dil modeli (MLLM veya basitçe LLM) olarak F-16 adlı bir çözüm sunuyor ve bu, artan analiz hızının büyük tuzaklarını tránh ediyor.

Testlerde, yazarlar, yeni sistemin, GPT-4o ve Google’ın Gemini-1.5 Pro gibi özel state-of-the-art modelleri geçtiğini iddia ediyor. Diğer güncel modeller, F-16’nın sonuçlarını denemelerde eşleyebiliyor veya geçebiliyordu, ancak rekabetçi modeller çok daha büyük ve daha zor kullanılıyordu.

F-16, bazı ciddi donanımlarda eğitilmiş olsa da (bunu yakında inceleyeceğiz), çıkarım genellikle eğitimin çok daha az talepkardır. Bu nedenle, kodun (yakın bir gelecekte yayınlanacağı sözü verildi) orta veya yüksek düzeyde ev tipi GPU’lar üzerinde çalışabilmesi umulabilir.

Hobi sahnesinin (ve çoğu zaman profesyonel VFX sahnesinin) canlı kalması için bu tür bir video altyazı modeline ihtiyaç vardır, tüketici sistemlerinde çalışabilen, böylece tüm video oluşturma sahnesi API tabanlı ticari sistemlere göç etmez veya tüketicileri yerel çerçeveleri ticari online GPU hizmetlerine bağlamaya zorlamadığından emin olmak gerekir.

Beyond Scaling Up

Yazarlar, bu yaklaşımın veri setlerini ölçeklendirme alternatifinin pratik bir yolu olduğunu gözlemliyorlar. Ayrıca, daha fazla veri sorununa yaklaşıldığında, bu tür bir yaklaşımın tercih edilebileceği de çıkarılabilir, çünkü yeni sistem olayları daha ince bir şekilde ayırt eder.

Aşağıdaki ifadeleri kullanıyorlar:

‘Düşük kare hızı örneklemesi, özellikle hızlı değişen sahneler, karmaşık ayrıntılar veya hızlı hareketler içeren videolarda kritik görsel bilgi kaybına neden olabilir. Ayrıca, ana kareler kaçırıldığında, ancak model ana kare bilgilerine dayalı etiketlerle eğitildiğinde, modelin tahminlerini beklenen içerikle hizalaması zor olabilir, bu da hayaller görme ve performansın bozulmasına yol açabilir…

‘… F-16, benzer büyüklükteki modeller arasında genel video QA’da SOTA performans gösterir ve yüksek kare hızı video anlama konusunda net bir avantaj gösterir, GPT-4o gibi ticari modelleri geçer. Bu çalışma, çok modelli büyük dil modellerinde yüksek kare hızı video anlama alanını ilerletmek için yeni yollar açar.’

Yeni makale, Improving LLM Video Understanding with 16 Frames Per Second olarak adlandırılır ve Tsinghua Üniversitesi ve ByteDance’den sekiz yazar tarafından gelir.

Method

Ardışık kareler genellikle冗余 bilgileri içerir, bu nedenle F-16, ana hareket ayrıntılarını sıkıştırmak ve görsel anlamları korurken bir yüksek kare hızı hizalama uygulayıcısı kullanır. Her kare önce, özellik temsilcilerini çıkarmak için önceden eğitilmiş bir görüntü kodlayıcısı tarafından işlenir ve daha sonra bir Gaussian Error Linear Units (GELUs) tabanlı hizalama uygulayıcısına geçirilir.

F-16 mimarisi, videoyu 16 FPS'de işler, geleneksel düşük kare hızı modellerinden daha fazla kare yakalar ve yüksek kare hızı hizalama uygulayıcısı görsel anlamları korurken hareket dinamiklerini verimli bir şekilde kodlar, ek görsel tokenler eklemeksizin. Kaynak: https://arxiv.org/pdf/2503.13956

F-16 mimarisi, videoyu 16 FPS’de işler, geleneksel düşük kare hızı modellerinden daha fazla kare yakalar ve yüksek kare hızı hizalama uygulayıcısı görsel anlamları korurken hareket dinamiklerini verimli bir şekilde kodlar, ek görsel tokenler eklemeksizin. Kaynak: https://arxiv.org/pdf/2503.13956

Kare sayısını verimli bir şekilde işlemek için, F-16 kareleri küçük işlem pencerelerine gruplar ve görsel özellikleri, motion ayrıntılarını koruyarak ve gereksiz tekrarları azaltarak, üç katmanlı bir Multi-Layer Perceptron (MLP) kullanarak birleştirir. Bir mekansal max-pooling katmanı, token sayısını daha da sıkıştırır ve hesaplama maliyetlerini sınırlar içinde tutar.

İşlenen video tokenleri, daha sonra Qwen2-7B LLM’ye verilir ve bu, çıkarılan görsel özelliklere ve verilen bir kullanıcı talebine dayalı metin yanıtları üretir.

Bu şekilde video girişini yapılandırarak, F-16, yazarların iddia ettiği gibi, dinamik sahnelerde daha kesin olay tanıma sağlar ve verimliliği korur.

Kısa Versiyon

F-16, bir görüntü LLM’sini, LLaVA-OneVision‘u, yüksek kare hızı hizalama uygulayıcısını kullanarak video işleme yeteneği kazandırır; bu, modelin görsel girdi pipeline’ını değiştirir. Standart görüntü LLM’leri izole karelerle çalışırken, F-16’nin yüksek kare hızı hizalama uygulayıcısı, birden fazla kareyi modelin daha verimli bir şekilde işleyebileceği bir forma dönüştürür; bu, sistemi冗余 bilgilerle boğulmaktan korurken, doğru video anlama için gerekli ana hareket ipuçlarını korur.

İmage tabanlı temel ile uyumluluk sağlamak için, F-16, hizalama uygulayıcısını alt matrislere dönüştürerek önceden eğitilmiş parametreleri yeniden kullanır. Bu yaklaşım, modelin, sıralı video girişine uyum sağlarken, tek kareli modellerden kazandığı bilgileri entegre etmesini sağlar.

Hizalama uygulayıcısı, kare dizilerini, modelin daha verimli bir şekilde işleyebileceği bir forma sıkıştırır, en bilgilendirici özellikleri korurken gereksiz ayrıntıları atar. Mimarinin tasarımı, sistemin yüksek kare hızı video işlerken, hesaplama taleplerini kontrol altında tutmasını sağlar ve bu, ölçeklendirme değil, video altyazıları için ilerlemenin başka bir yolu olduğunu öne sürer.

Hızın Değişimi

16 FPS’de video işleme, hareket anlama kabiliyetini geliştirir, ancak hesaplama maliyetini artırır, özellikle de çıkarım sırasında. F-16, değişken kare hızı çözme yöntemini tanıtarak, kare hızını dinamik olarak değiştirebilir, yeniden eğitme gereksinimi olmadan.

F-16'nin tek kare ve yüksek kare hızı hizalama uygulayıcıları.

F-16’nin tek kare ve yüksek kare hızı hizalama uygulayıcıları.

Bu esneklik, modelin, yüksek doğruluk gerektirilmediğinde daha düşük FPS’de verimli bir şekilde çalışabilmesini sağlar ve hesaplama yükünü azaltır.

Test zamanında, daha düşük bir kare hızı seçildiğinde, F-16, önceden eğitilmiş hizalama uygulayıcı parametrelerini, beklenen boyutları eşleştirmek için girdi karelerini tekrarlayarak yeniden kullanır. Bu, modelin, mimarisini değiştirmeden videoyu etkili bir şekilde işleyebildiğini garantiler.

Basit bir şekilde örnekleme yapmak (yani sadece kareleri çıkarmak), kritik hareket ayrıntılarını kaybetme riskini taşır, ancak bu yöntem, hizalama uygulayıcısının öğrenilmiş hareket temsilcilerini korur, böylece düşük kare hızlarında bile performansı korur. Genel video anlama için, daha düşük bir FPS ayarı, çıkarımı hızlandırabilir, ancak önemli bir performans kaybı olmadan, yüksek hızlı hareket analizi hala 16 FPS yeteneğinden yararlanabilir.

Veri ve Testler

Qwen2-7B üzerine inşa edilen F-16, SigLIP‘i bir görüntü kodlayıcısı olarak kullanır. 16 FPS’de örneklenen video kareleri, her videodan 1,760 kare elde edilebilir. Daha uzun video klipleri için kareler, daha seyrek bir şekilde örneklenmiştir.

Eğitim için, F-16, LLaVA-Video ile aynı genel video verisetlerini kullandı, bunlar arasında LLaVA-Video-178K, NExT-QA, ActivityNet-QA ve PerceptionTest bulunuyordu.

F-16, ayrıca yüksek hızlı spor verisetleri FineGym, Diving48 ve SoccerNet üzerinde uyarlanmıştır. Yazarlar ayrıca, 13 Kasım – 25 Kasım 2024 tarihleri arasında oynanan 276 NBA maçı koleksiyonunu derledi ve modelin, bir atışın başarılı olup olmadığını (yüksek kare hızı işleme gerektiren bir görev) belirleyebilmesi üzerinde odaklandı, NSVA test seti ile F1 puanı kullanılarak değerlendirildi.

Model, NSVA test seti kullanılarak, F1 puanı ile ölçüldü.

Jimnastik ve dalma modelleri, olay tanıma doğruluğu temelinde değerlendirildi, futbol ve basketbol modelleri ise pas ve atış sonuçlarını izledi.

Model, 1 epoch için 128 NVIDIA H100 GPU ile eğitildi (her bir GPU için 80GB VRAM ile, bu, 10,24 terabayt GPU belleği kullanımını gerektiriyordu; bu, bilgisayar vizyonu araştırma literatürünü takip ederken karşılaştığım en yüksek donanım spekli GPU kümesidir). 2×10⁻⁵’lik bir öğrenme hızı eğitimi sırasında kullanıldı.

Ek olarak, LoRA adlı bir model, spor verisi üzerinde 64 GPU ile 5 epoch için uyarlandı. Burada, yalnızca LLM eğitildi ve görüntü kodlayıcısı donduruldu.

İlk turda test edilen karşıt çerçeveler, ‘genel video anlama’ için GPT-4o; Gemini-1.5-Pro; Qwen2-VL-7B; VideoLLaMA2-7B; VideoChat2-HD-7B; LLaVA-OV-7B; MiniCPM-V2.6-8B; LLaVA-Video-7B; ve NVILA-7B idi;

Modeller, Video-MME; VideoVista; TemporalBench; MotionBench; Next-QA; MLVU; ve LongVideoBench üzerinde değerlendirildi.

Çeşitli modellerin video QA sonuçlarının karşılaştırması, FPS sınırlarını ve çoklu benchmark'lerdeki performansını gösterir. F-16, Video-MME, NQA, TPB ve MB'de 7B modeller arasında SOTA'ya ulaşır ve GPT-4o ve Gemini-1.5-Pro gibi özel modellerle rekabet eder.

Çeşitli modellerin video QA sonuçlarının karşılaştırması, FPS sınırlarını ve çoklu benchmark’lerdeki performansını gösterir. F-16, Video-MME, NQA, TPB ve MB’de 7B modeller arasında SOTA’ya ulaşır ve GPT-4o ve Gemini-1.5-Pro gibi özel modellerle rekabet eder.

Bu sonuçlardan, yazarlar şunları belirtir:

‘Video-MME Short, Medium ve NeXT-QA veri setlerinde – her biri kısa video anlama için tasarlanmış – model, önceki 7B SOTA modelini 3.2%, 1.0% ve 0.9% oranında geçer, kısa videolarda güçlü performansını vurgular.

‘Uzun video anlama için tasarlanmış benchmark’ler gibi Video-MME Long, LongVideoBench ve MLVU’da, zorluk daha büyüktür, çünkü daha seyrek kare örneklemesi, işleme penceresindeki karelerin daha önemli varyasyonlar göstermesine neden olur.

‘Bu, modality hizalama uygulayıcısının, sınırlı token temsilinde zaman içinde değişiklikleri etkili bir şekilde kodlaması için daha zor bir görevdir. Sonuç olarak, F-16, aynı video verisetinde eğitilen [LLaVA-Video-7B]’ye kıyasla biraz performans kaybı yaşar.’

F-16’nın yüksek kare hızı işleme yeteneği, yazarlara göre, TemporalBench’de %13.5’lik bir iyileşme ve MotionBench’de %2.5’lik bir kazanç sağladı ve bu, mevcut 7B modellerine kıyasla daha iyi bir performans gösterdi ve GPT-4o ve Gemini-1.5-Pro gibi özel modellerle benzer bir seviyede performans gösterdi.

Yüksek Hızlı Spor Video Anlama

F-16, FineGym, Diving48, SoccerNet ve NBA veri setleri üzerinde test edildi ve yüksek hızlı spor eylemlerini anlama kabiliyeti değerlendirildi.

10,000 manuel olarak etiketlenmiş NBA klipleri kullanılarak, eğitim, top hareketi ve oyuncu eylemleri üzerinde odaklandı ve modelin, bir atışın başarılı olup olmadığını doğru bir şekilde belirleyip belirleyemeyeceği test edildi, F1 puanı kullanılarak NSVA test seti üzerinden değerlendirildi.

Yüksek hızlı spor video analizi sonuçları. F-16, yüksek kare hızı hizalama uygulayıcısıyla, tüm spor görevlerinde düşük kare hızı karşıtı tarafından daha iyi performans gösterdi. GPT-4o ve Gemini-1.5-Pro de NBA ve SoccerNet QA'da değerlendirildi, burada alan içi eğitim bilgisi gerekmiyordu.

Yüksek hızlı spor video analizi sonuçları. F-16, yüksek kare hızı hizalama uygulayıcısıyla, tüm spor görevlerinde düşük kare hızı karşıtı tarafından daha iyi performans gösterdi. GPT-4o ve Gemini-1.5-Pro de NBA ve SoccerNet QA’da değerlendirildi, burada alan içi eğitim bilgisi gerekmiyordu.

Jimnastik eylemini tanıma ölçen FineGym’de, F-16, önceki 7B SOTA modelinden %13.8 daha iyi performans gösterdi, ince hareket anlama yeteneğinde iyileşme gösterdi.

Diving48, kompleks hareket dizilerini tanımlamayı gerektiriyordu, örneğin, atış, flip, çevirme ve uçuş aşamaları ve F-16, bu geçişleri tanımada daha yüksek doğruluk gösterdi.

SoccerNet için model, 10 saniyelik klipleri analiz etti, top paslarını tanımladı ve mevcut 7B modellerine kıyasla bir iyileşme gösterdi, bu da daha yüksek FPS’nin küçük ve hızlı hareketleri izlemeye katkıda bulunduğunu gösterdi.

NBA veri setinde, F-16’nın atış sonuçlarını belirleme yeteneği, GPT-4o ve Gemini-1.5-Pro gibi daha büyük özel modellerinkine yaklaştı, bu da daha yüksek kare hızının dinamik hareketleri işleme yeteneğini daha da geliştirdiğini gösterdi.

Değişken Kare Hızı

F-16, farklı kare hızlarında test edildi ve uyum yeteneği ölçüldü. Yeniden eğitim yerine, daha düşük FPS’de hizalama uygulayıcısının girdi yapısını eşleştirmek için kareleri tekrarlayarak çalıştı.

Sonuçlar, kare hızının azaltılmasının hareket tanıma üzerinde bir etkisi olduğunu, ancak F-16’nin masih düşük kare hızı modellerinden daha iyi performans gösterdiğini ve 16 FPS’nin altında bile güçlü sonuçlar elde ettiğini gösterdi.

Solda, F-16 modülünün çeşitli bileşenlerinin zaman consumo, Video-MME Long setinden 300 video üzerinde ve farklı test FPS'lerinde ve dizi uzunluklarında ölçüldü. Sağda, modellerin eğitim ve test FPS'lerine göre Video-MME performansı karşılaştırması. Çizgi, aynı FPS'de eğitilen ve test edilen modelleri temsil eder, mentre kesik çizgi, 16 FPS'de eğitilen ve daha düşük bir FPS'de test edilen modelin performansını gösterir.

Solda, F-16 modülünün çeşitli bileşenlerinin zaman consumo, Video-MME Long setinden 300 video üzerinde ve farklı test FPS’lerinde ve dizi uzunluklarında ölçüldü. Sağda, modellerin eğitim ve test FPS’lerine göre Video-MME performansı karşılaştırması. Çizgi, aynı FPS’de eğitilen ve test edilen modelleri temsil eder, mentre kesik çizgi, 16 FPS’de eğitilen ve daha düşük bir FPS’de test edilen modelin performansını gösterir.

F-16’nın yüksek kare hızı işleme, hesaplama gereksinimlerini artırdı, ancak hizalama uygulayıcısı,冗余 görsel tokenleri sıkıştırarak bu maliyetleri yönetmeye yardımcı oldu.

Model, daha düşük FPS’de çalışan modellerden daha fazla FLOP gerektirdi, ancak token başına daha iyi doğruluk elde etti, bu da kare seçimi ve token sıkıştırma stratejilerinin ek hesaplama yükünü dengelediğini gösterdi.

SONUÇ

Bu araştırma alanının önemi ve zorluğu, özellikle bu yıl, video oluşturma için bir突破 yılı olacak, video veriseti oluşturma ve altyazı kalitesi eksikliklerini vurgulayacaktır.

Ayrıca, video içindeki iç ayrıntıların doğru tanımlarını elde etmenin, yalnızca VRAM, zaman veya disk alanı ekleyerek çözülemeyeceği vurgulanmalıdır. Olayların video içindeki uzun ve sıkıcı bölümlerden (örneğin golf veya snooker video klipleri gibi) nasıl izole edildiği ve çıkarıldığı, özellikle bazı sınırlamaların daha az kaynakla çalışılan zamanlardan kaynaklandığı için, mevcut SOTA çözümlerini şekillendiren semantik yaklaşımların ve mekanizmaların yeniden düşünülmesinden yararlanabilir.

(yanlışlıkla, 16 FPS’nin 2025 yılı için çok düşük bir kare hızı gibi görünse de, bu aynı zamanda popüler Wan 2.1 video oluşturma modelinin video kliplerinin yerel eğitim hızıdır ve en az sorunla çalıştığı hız budur. Umarız araştırma sahnesi, burada olası ‘standart entropi’yi göz önünde bulundurur; bazen eski kısıtlamalar gelecekteki standartları sürdürülebilir.

 

İlk olarak 19 Mart 2025 Çarşamba günü yayınlandı.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai