Anderson’un Açısı

Yapay Zeka Kitapları İzlemekten Çok Okumayı Tercih Ediyor

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin
AI-generated image of an industrial robot seated in an armchair and reading a book, while ignoring a movie playing on TV. ChatGPT-o4, Nano-Banana; Firefly.

resimler olarak – analiz edebilse de, kullanıcının kendi çerçevelerini çıkarmasını ve bunları resim olarak yüklemesini tercih ederler. OpenAI GPT serisinde, bir video

 

Yapay zeka modelleri, gerçek video içeriğini izlemekte ve yorumlamakta şaşırtıcı derecede zorlanıyor. Yazılı kelimelerle daha çok ilgileniyorlar. ChatGPT veya benzeri popüler bir görüntü/dil modeline kısa bir video klibi yüklemeyi denediyseniz, videoyu gerçekten yorumlayamadıklarını fark etmiş olabilirsiniz. ChatGPT-4o+ gibi modeller, JPEG ve PNG gibi tek tek kareleri yorumlar. video klibin tüm çerçevelerini çıkarmak ve bunları ChatGPT’ye yüklemek mümkündür. Örneğin, yapay zeka tarafından oluşturulmuş bir anlatı izi oluşturmak için: OpenAI tutorialundan alınan resim ve kod, klibin birden fazla çıkarılan çerçevesini işleyen

OpenAI tutorialundan alınan resim ve kod, video klibin birden fazla çıkarılan çerçevesini işleyen ve yapay zeka tarafından oluşturulmuş bir yorum oluşturmak için. ve yapay zeka tarafından oluşturulmuş bir yorum oluşturmak için. Kullanıcı, videoyu çerçevelere dönüştürmekle sorumludur, ya daha büyük 

bir rutinde fonksiyonları çağırarak ya da FFMPEG veya çeşitli ücretsiz ve ücretli video düzenleme çözümleri kullanarak. Video analizi sınırlamaları, büyük ölçekli ürünlerde, örneğin ChatGPT’de, büyük ölçüde ile ilgilidir: Bir yapay zeka örneğini en popüler video kodekleri ile donatmak ve çıkarma ve işleme sürecine kaynaklarıgereken tahsis etmek, milyonlarca kullanıcının bu işlevleri her gün kullanmaya başlaması durumunda küçük bir sorun değildir. kaynak kullanımı Ek olarak, zamansal analiz , tek bir çerçeveden çok farklı bir resim çizebilir (örneğin, biri mutluluk içinde bir eve girerken ve sonra bir ceset keşfederken); bu nedenle, kısa bir video klibin bile tüm zamansal “imzasını” dikkate almak, kaynak yoğun bir görevdir ve ayrıca araştırma literatürünün özel bir alanıdır, örneğin Optical Flow gibi çerçevelerin geliştirilmesiyle – bu, esasen videoyu statik bir belge gibi ele alınabilmesi için “açar”. Optical akış diyagramları, video dizisi içindeki çerçeveler arasındaki

Optical akış diyagramları, video dizisi içindeki çerçeveler arasındaki hareketin nasıl izlendiğini gösterir, yeşil vektörler hareket yönünü ve yoğunluğunu gösterir. Bu eşlemeler, VLM'ler için gerekli zamansal sürekliliği sağlar ve ayrıca VFX iş akışlarında yapısal rehberler olarak hizmet edebilir. hareketin nasıl izlendiğini gösterir, yeşil vektörler hareket yönünü ve yoğunluğunu gösterir. Bu eşlemeler, VLM’ler için gerekli zamansal sürekliliği sağlar ve ayrıca VFX iş akışlarında yapısal rehberler olarak hizmet  edebilir.

Cliff’in Notlarına İhtiyacımız Var

Bununla birlikte, Google’ ın Notebook LM ve daha yeni ChatGPT girişleri gibi modeller, ilgili meta verilere (yani, videoyu bağlamlandıran gömülü metin içeriğine) erişebildikleri ve bazen bu verileri yorumlamaya çalıştıkları için video dosyası yüklemelerini yasaklamazlar. Bu durumda, NotebookLM’ye (VQA) gibi görevleri işleyebilen modellerin, yararlı metin içermese bile, her zaman metin tabanlı bilgilere öncelik verdiğini söylerler. kurmaya devam etti: içermeyen 6 saniyelik bir video klip yükledim. NotebookLM, video ile ilgili olmayan ve saçma bir beş dakikalık yüz yüze podcast ile birlikte ayrıntılı bir şekilde hayal

İtalyan bir filmdeki altı saniyelik bir klibin NotebookLM tarafından nasıl yanlış yorumlandığı. İtalyan bir filmdeki altı saniyelik bir klibin NotebookLM tarafından nasıl yanlış yorumlandığı. Notbook, ChatGPT gibi, YouTube videosunu girdi olarak kabul edecektir, ancak yalnızca video, yorumlanabilir bir metin katmanı veya altyazı içeriyorsa (videoya işlenen altyazılar değil). Bu şekilde, video içeriğini olarak gerçekten Gerçek video yorumu pahalıdır ve yorucudur ve bu, video yorumunu gerçekleştirmek için özel eğitilmişmodeller bile dahil olmaküzere, modellerin videoyu gerçekten ve anlamak ve semantik yorumunu gerçekleştirmek için yapılan zorlu iş, kullanıcı yükleme sonrasında, kaynaklar tahsis edilebildiğinde ve gerektiğinde gerçekleştirilir. görmek çok metni okumayı tercih ettiğini gösterir. görmekten

TL;DW

Bu, İngiltere’nin Bristol Üniversitesi’nden yeni bir makale tarafından doğrulanmaktadır. çaba gerektiren bir şekilde analiz edebilenMakale, “Bir Video Bin Kelimeye Değmez” başlığını taşır ve yazarlar, mevcut durumun en iyi yapay zeka vizyon dil modellerinin (VLM’ler), videoyu daha daha fazla Video soru cevaplama: Makale yazarları, animasyonlu görüntüler, yazılı sorular ve çoktan seçmeli cevaplar verildiğinde, modellerin genellikle ekran olaylarına değil, metindeki kalıplara dayandığını test ederler. bile aynıetkilenmediklerini bulmuşlardır – birçok durumda, soru performansı gösterirler.tamamen kaldırıldığında Bu, kısayol veya hile gibi bir durum gibi görünmektedir; burada önemli olan, modellere cevapların kalıplarını bulabilmeleridir; ancak görevi daha zorlaştırmak için daha fazla cevap seçeneği eklediğinde, AI’ler videoya daha fazla dikkat etmeye başlar. Yazarlar, çeşitli bağlam uzunluklarına sahipaltı VLM modelini, dört uygun veri setinde test etti ve sonuçlar, modellerin

Bir video analizi modelinin, gördüklerine kıyasla okuduklarına verdiği önemi gösteren bir örnek. Klib, bir kişinin bambu dokumasını gösterir, ancak model, video çerçevelerine kıyasla yazılı soru ve cevap metnine çok daha fazla önem verir. Mavi vurgular, seçilen cevaba destek olan öğeleri gösterirken, kırmızı olanlar bunun tersini gösterir ve modelin nedeninin metinde değil, hareketli resimlerde olmadığını gösterir. video içeriğinden daha çok metne bağlı olduklarını gösterdi. Bir video analizi modelinin, gördüklerine kıyasla okuduklarına verdiği önemi gösteren bir örnek. Klib, bir kişinin bambu dokumasını gösterir, ancak model, video çerçevelerine kıyasla yazılı soru ve cevap metnine çok daha fazla önem verir. Mavi vurgular, seçilen cevaba destek olan öğeleri gösterirken, kırmızı olanlar bunun tersini gösterir ve modelin nedeninin metinde değil, hareketli resimlerde olmadığını gösterir.

Yöntem

Her girdinin modelin kararına ne kadar katkıda bulunduğunu anlamak için, yeni çalışma, oyun teorisi nden bir yöntemkullanır: Shapley Değerleri . Aslen, bir koalisyon içindeki oyuncular arasında bir ödeneği adil bir şekilde bölmek için tasarlanan Shapley Değerleri, her bir “oyuncu”ya bireysel etkisine göre kredi verir. Bu senaryoda, oyuncular, video çerçeveleri veya VQA görevinin metin bileşenleri (yorumlar, altyazılar, vb.); ve “ödeme”, modelin nihai cevabıdır. Her bir parçasının ne olduğu sistematik olarak test edilerek, her bir unsurun modelin çıktısına ne kadar katkıda bulunduğunu gösterir. Bu çalışmada, Shapley Değerleri, video ve metin bileşenlerinin ayrı ayrı ele alınabileceği şekilde, çoklu modaliteyi işleyecek şekilde uyarlandı ve modellerin çıkışlarına olan etkileri ölçüldü, böylece video içeriğinin gerçekten yorumlanıp yorumlanmadığı veya metin ipuçlarının kısa yollar olarak kullanıldığı belirlendi.

Metrikler

Modellerin kararlarına her modalitenin (yani video, soru veya cevap) ne kadar katkıda bulunduğunu karşılaştırmak için iki basit ölçüt tanımlanmıştır: Katkısı , , her bir tür girdiden gelen toplam açıklamanın ne kadarının geldiğini ölçer; burada, tüm mevcut Shapley değerleri toplanır ve her modaliteye ait pay, toplamın yüzdesi olarak hesaplanır. İkincisi, Modalite Öznitelik Katkısı bazı modalitelerin, video gibi, diğerlerinden daha fazla özniteliğe sahip olabileceği gerçeğini düzeltir. Bunun yerine, her özniteliğin ortalama Shapley değeri hesaplanır ve bu ortalamalar, hangi modalitenin etkisinin baskın olduğunu belirlemek için karşılaştırılır.

Veri ve Testler

Yazarlar, yaklaşımı, çeşitli özelliklere sahip altı VLM modelinde test etti. Modeller, farklı bağlam uzunluklarına, yaşlara (yani, çerçevesinin ne zaman yayınlandığına) ve mimari yapılandırmalarına göre seçildi. Modeller arasında FrozenBiLM ; InternVideo ; VideoLLaMA2 ; VideoLLaMA3 ; LLaVa-Video (Qwen2’yi kullanır); ve LongVA (ayrıca Qwen2 kullanır)bulunuyordu. Aynı çeşitlilikamacı  iledört hedef veri seti seçildi:EgoSchema , video ile ilgili tam olarak görülmeyen bir VQA veri seti; HD-EPIC , mutfakodaklı bir veri seti, bazı uzun videolara sahip; MVBench , diğer veri setlerinden katkıların toplandığıbir derleme; ve LVBench , çok uzun videolariçin VQA sorguları sunan. Bunlardan, yazarlar 60 soruoluşturdu – her soru türünden on soru. Modellerin videoya göre metne daha az güvendiği, özellikle de çerçeveler çerçevesinde açıkça görüldüğü için, katkı ölçümleri netti. Video, genel olarak makul bir gösteri yaptığında bile, her bir çerçevedeki etkisi genellikle minimaldi, bu da modelin videoyu toplu olarak kullandığını, ancak bireysel çerçevelere dikkat etmediğini gösteriyordu. VideoLLaMA3, bu konuda ana istisnaydı, özellikle LVBench’teki daha uzun dizilerde daha ağır bir görsel bağımlılığa sahipti: Modeller ve veri setleri boyunca video (V), soru (Q) ve cevap (A) girdilerinin

Modeller ve veri setleri boyunca video (V), soru (Q) ve cevap (A) girdilerinin göreli ağırlığını gösteren Modality Contribution (MC) ve Per-Feature Contribution (PFC) puanları. Soğuk renkler daha güçlü katkıları, sıcak renkler daha zayıf veya ihmal edilebilir bir etkiye işaret eder. Çoğu ayar için dil açıkça baskındır ve video genellikle kenara itilir - özellikle de çerçeveler arasındaki etkiye bakıldığında. göreli ağırlığını gösteren Modality Contribution (MC) ve Per-Feature Contribution (PFC) puanları. Soğuk renkler daha güçlü katkıları, sıcak renkler daha zayıf veya ihmal edilebilir bir etkiye işaret eder. Çoğu ayar için dil açıkça baskındır ve video genellikle kenara itilir – özellikle de çerçeveler arasındaki etkiye

bakıldığında. Metin için, soru genellikle cevapdan daha önemliydi, özellikle daha güçlü modellerde. Bu, EgoSchema gibi veri setlerinde daha belirgindi, burada sorular daha uzun ve daha doğalken, cevaplar kısa ve bazen şematiktir. MVBench bu durumu biraz tersine çevirdi, çünkü ikili cevap yapısı, cevap tokenlerinin görünür önemini şişirdi. Tüm modeller ve veri setleri boyunca, görme her zaman kenara itildi, dil ise ağır işleri yaptı. Makale

şöyle diyor: ‘Uzun bağlam modelleri için, video katkıları büyük ölçüde azaltılır, bu da her bir çerçevedeki Shapley değerlerinin metin

Ayrıca, ‘Video, bir yöntem olarak açıkça çok önemlidir, ancak bu, video karelerinin Shapley değerlerinin sıfıra daha yakın olduğu ve modelin bu karelere olan dikkatinin metne olan dikkatine daha çok benzediği anlamına gelir.

özelliklerine kıyasla çok daha küçük olduğunu gösterir. ‘ Araştırmacılar, her girdinin (video, metin, vb.) modelin doğruluğuna ne kadar ablasyon kadar yönlendirilmediğini gösterir.’ testleri yaptılar – bir veya daha fazla girdiyi kasıtlı olarak gizleyerek ve modelin doğruluğunun ne kadar değiştiğini görerek. maskleme Eğer bir girdinin kaldırılması performansı önemli ölçüde düşürürse, bu girdi muhtemelen önemlidir; eğer model aynı performansı gösterirse, bu, eksik parçanın çok fazla kullanılmadığını gösterir. Bu sentido, maskleme testleri, bir tür çalışması dır.Dört

Dört VQA benchmarkindeki video, soru veya cevap girdilerinin maskelenmesinin performansa etkisi. Puanlar, maskelenmemiş temel çizgiden değişimi gösterir. Kırmızı, daha düşük doğruluğu, yeşil daha yüksek doğruluğu gösterir. Modeller genellikle video olmadan yüksek puanları korurken, cevap çıkarıldığında daha fazla kayıp yaşadılar. Soru genellikle maskelemeyle minimal bir etkiye sahipti. VQA benchmarkindeki video, soru veya cevap girdilerinin maskelenmesinin performansa etkisi. Puanlar, maskelenmemiş temel çizgiden değişimi gösterir. Kırmızı, daha düşük doğruluğu, yeşil daha yüksek doğruluğu gösterir. Modeller genellikle video olmadan yüksek puanları korurken, cevap çıkarıldığında daha fazla kayıp yaşadılar. Soru genellikle maskelemeyle

minimal bir etkiye sahipti. Sonuçlar (yukarıda görselleştirilmiştir), cevapların genel olarak en önemli girdi olduğunu gösterir. Cevapları maskeleme genellikle doğruluğu önemli ölçüde düşürür, modelleri çoğu zaman rastgele performansa indirger. Maskelenmiş genellikle çok daha az durumlarda, bir etkiye sahipti, bu da daha önce bulunan, modellerin soruyu düşük değerli olarak değerlendirdiği bulgusunu destekledi. soru Bazı zorlamak için ek olarak,doğruluk bile arttı, bu da modellerin bazen cevapları görsel veya metinsel ipuçlarına göre eşleştirdiğini, ancak soruyu gerçekten değerlendirmediklerini gösterdi. soru kaldırıldığında Modeller, videoya olan bağımlılıkları açısından farklılık gösterdi: bazıları videosuz olarak makul bir doğrulukta kalırken, bu da video özelliklerinin birçok güncel kurulumda sınırlı bir katkıda bulunduğunu doğruladı. Araştırmacılar, modelleri videoya güvenmeye video çoklu seçim seçeneklerine ekledi. yanlış cevaplar Yanlış cevaplar kolay ve diğer sorulardan geri dönüştürüldüğünde, performansı iyileştirdi, modeller metin kalıplarını eşleştirdi, ancak fazla akıl yürütme yapmadı. Ancak on veya daha fazla ilgili olmayan cevap eklediğinde,

Her VQA testine eklenen yanlış cevapların sayısı arttıkça, video, soru ve cevap girdilerine ait öznitelik katkıları ve doğruluk. Metin baskınlığını azaltıp görsel ve soru özelliklerinin göreli etkisini artırdığı görülüyor. ve soruya daha fazla dikkat etmeye başladılar: Her VQA testine eklenen yanlış cevapların sayısı arttıkça, video, soru ve cevap girdilerine ait öznitelik katkıları ve doğruluk. Metin baskınlığını azaltıp görsel ve soru özelliklerinin göreli etkisini

artırdığı görülüyor. VideoLLaMA3 için, videoyu maskeleme, EgoSchema’da doğruluğu %40, LVBench’de %15 oranında düşürdü, bu da basit bir şekilde cevap sayısını artırmanın, modelleri metin kısayollarından uzaklaştırmaya ve gerçek çok modalli akıl yürütmeye yöneltmeye yetebileceğini gösterdi. Araştırmacılar, girdilere nasıl bir atribüt dağıldığını da araştırdı ve aşağıdaki Shapley değerleri

Dört veri seti için her model girişi için Shapley değerleri ısı haritaları. Her satır bir VQA üçlüsünü, her sütun tek bir özelliği gösterir. Video özellikleri solda, metin özellikleri sağda yer alır. Metin bölgelerindeki (kırmızı) daha güçlü değerler, modellerin dil yerine görmeye güvendiğini gösterir. ısı haritalarını gördük: Dört veri seti için her model girişi için Shapley değerleri ısı haritaları. Her satır bir VQA üçlüsünü, her sütun tek bir özelliği gösterir. Video özellikleri solda, metin özellikleri sağda yer alır. Metin bölgelerindeki (kırmızı) daha

güçlü değerler, modellerin dil yerine görmeye güvendiğini

güçlü bir şekilde gösterir. Video ‘Her ısı haritasındaki değerlerin büyüklüğü, sağ tarafta, soru ve cevap atribütlerini temsil eden yerlerde çok daha büyüktür. Bu, video çerçevelerinin bittiği ve metin özelliklerinin başladığı nettir, bu da video modalite katkılarının metin/soru katkılarından çok daha az

gösterir. Yukarıdaki sonuçları yorumlarken yazarlar şunları söylüyor: Özetle, tüm veri setleri boyunca, değerler metin ucunda spektrumun çok daha güçlü, bu da modellerin dil yerine görmeğe güvendiğini bir olduğunu gösterir.’ bile, katkı, birçok çerçeveye ince bir şekilde dağıtılır, genellikle tutarlı bir desen olmadan. kullanıldığında Aşağıda, EgoSchema’dan bir örnek verilmiştir. Shapley değerleri kullanılarak seçilen 16 en “önemli” çerçeve, etkilerine göre renklendirilmiştir, mavi olumlu, kırmızı ise olumsuz katkıları gösterir: EgoSchema’dan

EgoSchema'dan bir örnekte Shapley atribütleri, 16 en önemli çerçevenin tümünü ve metin girdilerini gösterir. Video katkıları, metininkine kıyasla minimaldir ve modelin akıl yürütmesi metne hakimdir. Mavi ve kırmızı, seçilen cevaba olumlu ve olumsuz etkiyi gösterir. örnekte Shapley atribütleri, 16 en önemli çerçevenin tümünü ve metin girdilerini gösterir. Video katkıları, metininkine kıyasla minimaldir ve modelin akıl yürütmesi metne hakimdir. Mavi ve kırmızı, seçilen cevaba olumlu ve olumsuz etkiyi gösterir. Sonuç,

neredeyse her bir çerçevede zayıf bir etkiye sahip olmasıdır, soru ve cevaplardaki kelimelere kıyasla. Görsel ipuçları seyrek ve tutarlı değildir, oysa “sandalye” ve “çit” gibi isimler, modeli doğru seçime yöneltir veya ona karşı directive eder, bağlama bağlı olarak.

Sonuç

Herhangi bir video düzenleme veya video analizi deneyimi olan herkes, bu işlemlerin ne kadar kaynak yoğun olduğunu bilir ve şirketlerin milyonlarca AI tabanlı talebi günlük olarak işlerken, RAG kullanıcıların düzenleme ve yorumlama video işlemlerini çalıştırmasına izin veremeyeceklerini anlar. ad hoc Bu bağlamda hatırlanması gereken bir şey, neredeyse denediğiniz her API AI arayüzünün (muhtemelen yeni bir bilimsel araştırma çalışması için kısa süreli bir demo dışında) kullanıcıların isteklerini mümkün olan en düşük kaynak harcamayla gerçekleştirmeye çalışmasıdır. Bu, mevcut meta verilere veya geri Bu, çağrı işlemlerine güvenmek ve gerekirse daha işlenebilir formatlar için (örneğin PDF’ler, belgeler ve tek görüntüler) meta verileri çıkarmak anlamına gelir. Stol, yüklenen video CLIP veya son YOLO sürümünden geçirmek veya herhangi bir güç ve zaman alan VLM’den geçirmek ve gerçekten video çerçevelerinde ne olduğunu anlamak, temporallik için hesap verebilir. Bununla birlikte, belgelenen olgular, kaynak tasarrufu mimari yaklaşımlarından kaynaklanmıyor. Yazarlar, metnin, çok modalli eğitim paradigmalarında da baskın olduğunu gözlemliyorlar, bu da “görsel dil”in çok modalli bir bağlamda daha az gelişmiş, menos önemli veya anlaşılmaz olabileceğini veya şu anda daha az iyi anlaşıldığını gösteriyor. * İlginçtir, NotebookLM tarafından üretilen materyalin, tamamen orijinal veya Google tarafından dizine eklenmemiş gibi görünüyor, çünkü bu çıktıyı tetikleyebilecek hiçbir arama sonucu bulamadım. İlk olarak 31 Ekim

2025 Cuma günü yayımlandı; 14:20’de düzenleme için düzenlendi

Makine öğrenimi üzerine yazar, insan görüntüsü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başıydı, DNEG'in Brahma.ai'ye çözülene kadar.
Web Sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai