Anderson’un Açısı
Hatta En Gelişmiş Dillerin Anlama Gücü, Zamansal Mantığı Anlamakta Zorlanıyor

Gelecek durumları öngörme, bilgisayar görüşü araştırmalarında kritik bir görevdir – özellikle robotikte, gerçek dünya durumlarının dikkate alınması gerekir. Misyon açısından kritik görevlerle görevlendirilen makine öğrenimi sistemleri, fiziksel dünyanın yeterli anlayışına sahip olmalıdır.
Ancak, bazı durumlarda, görünüşte etkileyici bir zaman gerçekliği bilgisi aldatıcı olabilir: Birleşmiş Arap Emirlikleri’nden yeni bir makale, Multimodal Büyük Dil Modelleri (MLLM’ler) dahil olmak üzere en gelişmiş MLLM’lerin, GPT-4o ve Google Gemini gibi sektörün liderlerinin, görüntülerde zamanın nasıl temsil edildiğini yorumlamakta zorlandığını ortaya koydu.
Örneğin, sıralı çiftler (aşağıdaki resme bakınız), insanların yanlış sırayla yerleştirilmesiyle bile zorlanmayacakları, gelişmiş MLLM’leri beklenmedik bağlamlarda veya yapılandırmalarda (ikinci resim ilk, tek bir resme eklenerek sıralı çoklu resimler vb.) zorlayabilir.

Yeni çalışmada derlenen veri setlerinden örnekler, ‘önce ve sonra’ resimleri olarak sıralı olayları gösterir. Araştırmacılar bu veriyi https://huggingface.co/datasets/fazliimam/temporal-vqa/viewer adresinde kullanıma sundu.
Araştırmacılar, modellere temel zaman mantığı zorlukları verdi, chẳng hạn như olay sırasını belirleme veya zaman aralıklarını tahmin etme, ve yedi MLLM’nin test edildiğini ve bunların insan doğruluğundan đáng kể şekilde düşük performans gösterdiğini buldu:
‘Genel olarak, sonuçlar mevcut tüm MLLM’lerin, değerlendirmemizdeki en gelişmiş model olan GPT-4o dahil, önerilen testte zorlandığını ortaya koyuyor. GPT-4o’nun diğer modellere göre üstün performansı rağmen, tutarlı olarak doğru zaman mantığını farklı ayarlamalar boyunca göstermeyi başaramıyor.
‘Tutarlı doğruluk puanları tüm modeller için düşük, bu da görüntülerden zaman sıralarını anlamak ve yorumlamak konusundaki önemli sınırlılıklarını gösteriyor. Bu eksiklikler, modellere çoklu resim girişleri veya optimize edilmiş promt’lar sağlandığında bile belirgin, bu da mevcut mimari ve eğitim yöntemlerinin zaman sıralamasını anlamak için yetersiz olduğunu gösteriyor.’
Makine öğrenimi sistemleri, en doğru ve aynı zamanda en verimli ve insanları memnun eden sonuçları optimize etmeye tasarlanmıştır. Seit mereka açıkça akıl yürütmelerini ortaya koymazlar, bunu belirlemek zor olabilir. Aldatmak veya ‘kısayollar’ kullanmak.
Böyle bir durumda, MLLM doğru cevapya yanlış methodla ulaşabilir. Böyle bir cevap doğru olabileceği için, modelde yanlış güven duygusu yaratabilir ve daha sonra aynı yöntemle yanlış sonuçlar üretebilir.
Kötüdür, bu yanlış yönlendirme, insanların etkileyici bulduğu ve deneme ve açıklama oturumlarında olumlu geri bildirim verdiği takdirde, geliştirme zincirine daha da derinlemesine gömülebilir.
Bu durumda, öneri, MLLM’lerin kronoloji ve zaman fenomenleri hakkında真正 bir anlayış taklit ettiği, ancak ikincil göstergeleri gözlemleyerek ve bunlara bağlı kalarak (örneğin, video verisinde zaman damgaları gibi) veya hatta sıralı numaralı dosya adları gibi) melakukan.
Bu ayrıca, MLLM’lerin hiện tại olarak zaman fenomenleri kavramını genelleştiremediğini belirtir – en azından, insanların yapabildiği kadar.
Yeni makale, Çoklu Modalı MLLM’ler Görsel Zaman Anlama ve Mantığını Yapabilir mi? Cevap Hayır! başlığını taşıyor ve Mohamed bin Zayed Üniversitesi ve Alibaba International Digital Commerce’dan üç araştırmacı tarafından yazılmıştır.
Veri ve Testler
Yazarlar, önceki benchmark’lerin ve çalışmaların, chẳng hạn như MMMU ve TemporalBench, tek resim girişlerine odaklandığını veya MLLM’ler için çok kolay cevaplayabilecekleri sorular oluşturduğunu belirtiyorlar ve bu da kısayol davranışına eğilimlerini ortaya koyamayabilir.
Bu nedenle yazarlar iki güncellenmiş yaklaşım sunuyor: Zamansal Sıra Anlama (TOU) ve Zaman Aralığını Tahmin Etme (TLE). TOU yaklaşımı, modellerin video karelerinden olayların doğru sırasını belirleme yeteneklerini test ediyor; TLE yöntemi, MLLM’nin iki resim arasındaki zaman farkını, saniyelerden yıllara kadar değişen zaman ölçeklerinde tahmin etme yeteneklerini değerlendiriyor.

Makaledeki TemporalVQA benchmark’ın iki ana görevi: Zamansal Sıra Anlama’da model, hangi resmin önce gerçekleştiğini belirler; Zaman Aralığını Tahmin Etmede, model iki resim arasındaki zaman farkını, saniye, dakika, gün veya yıl gibi seçeneklerden seçerek tahmin eder. Bu görevler, MLLM’lerin görsel olayların zamanlama ve sıralaması hakkında akıl yürütme yeteneklerini test etmeyi amaçlar. Source: https://arxiv.org/pdf/2501.10674
Araştırmacılar, TOU benchmark’ı için 360 resim çifti oluşturdu, Pixabay ve Pexels’den açık kaynaklı videolar kullanarak, böylece verisetinin GUI aracılığıyla erişilebilir olmasını sağladı.
Videolar, günlük aktivitelerdeki insanlardan hayvanlara ve bitkilere kadar çeşitli konuları kapsıyordu. Bunlardan, olayları gösteren resim çiftleri seçildi ve başlangıç çerçevesi ‘açık’ olacak şekilde yeterli varyasyon ile olayların sırasını belirlemek için kullanıldı.

Bu iki resim arasındaki zaman mantığı kaçınılmazdır, çünkü çay küpünden geri emilemez.
Bu şekilde, 360 resim çifti elde edildi.
TLE yaklaşımı için, Google ve Flickr’dan telif hakkı olmayan resimler ve YouTube’daki telif hakkı olmayan videolardan seçilen kareler kullanıldı. Bu videoların konusu, saniyelerden günlerine, mevsimlerin değişimine kadar değişen zaman aralıklarındaki değişimleri gösteren sahneler veya nesneleri içeriyordu.
Bu şekilde, TLE yöntemi için 125 resim çifti oluşturuldu.
Test edilen tüm MLLM’lerin çoklu resim işleme yeteneği yoktu; bu nedenle testler her modelin yeteneklerine göre farklılaştı.
Derlenen veri setlerinin birden fazla sürümü oluşturuldu, bazı çiftler dikey olarak birleştirilirken, diğerleri yatay olarak birleştirildi. Daha fazla varyasyon, çiftlerin doğru zaman sıralamasını değiştirdi.
İki tür promt geliştirildi. İlk promt aşağıdaki şablonu izledi:
İlk resimdeki olay (sol / üst / ilk) resimdeki olaydan önce gerçekleşti mi? Doğru veya yanlış olarak cevaplayın ve nedeninizi belirtin.
İkinci promt aşağıdaki şemaya uyuyor:
İki resim arasında, hangi resim önce gerçekleşen olayı gösterir? (sol veya sağ / üst veya alt / ilk veya ikinci) olarak cevaplayın ve nedeninizi belirtin.
TLE için sorular çoktan seçmeli idi ve modellere iki resim arasındaki zaman aralığını değerlendirmeleri, saniye, saat, dakika, gün, ay ve yıl gibi zaman ölçekleri sunuldu.
Kullanılan promt şu şekildeydi:
Verilen resimdeki zaman aralığını, ilk resim (sol) ve ikinci resim (sağ) arasındaki zamanı tahmin edin.
Aşağıdaki seçeneklerden birini seçin:
-
15 saniyeden az
B. 2 dakika ile 15 dakika arasında
C. 1 saat ile 12 saat arasında
D. 2 gün ile 30 gün arasında
E. 4 ay ile 12 ay arasında
F. 3 yıldan fazla
Test edilen MLLM’ler şunlardı: ChatGPT-4o; Gemini1.5-Pro; LlaVa-NeXT; InternVL; Qwen-VL; Llama-3-vision; ve LLaVA-CoT.
Zamansal Sıra Anlama: Sonuçlar

Farklı modeller ve giriş düzenleri için Zamansal Sıra Anlama sonuçları, çeşitli kurulumlar ve promt’lar için doğruluk ve tutarlılığı gösterir.
Yukarıdaki sonuçlara ilişkin olarak, yazarlar, test edilen tüm MLLM’lerin, GPT-4o (en iyi genel performansı gösteren model) dahil olmak üzere, TemporalVQA benchmark’ında önemli ölçüde zorlandığını buldu – ve hatta GPT-4o, farklı kurulumlar boyunca tutarlı olarak güvenilir zaman mantığı göstermeyi başaramadı.
Yazarlar, MLLM’lerin tutarlı olarak düşük doğruluk puanlarının, modellerin görüntülerden zaman sıralarını anlamak ve yorumlamak konusundaki önemli sınırlılıklarını vurguladığını belirtiyorlar. Araştırmacılar, bu zorlukların, çoklu resim girişleri ve optimize edilmiş promt’lar kullanıldığında bile devam ettiğini, bu da mevcut mimari ve eğitim yöntemlerinin zaman sıralamasını anlamak için yetersiz olduğunu gösterdiğini belirtiyorlar.
Testler, promt stratejileri arasında önemli performans farklılıklarını gösterdi. GPT-4o, optimize edilmiş promt’lar ile (tek resim için %4 ve çoklu resim için %65,3’e ulaştı) performansını iyileştirdi, ancak performans kabul edilebilir seviyelerin altında kaldı.
LLaVA-NeXT ve Qwen-VL gibi modeller, alternatif promt’lar kullanıldığında performansını daha da düşürdü, bu da promt mühendisliğinin MLLM’lerin zaman mantığı konusundaki temel sınırlılıklarını aşabileceğini göstermedi.
Testler ayrıca, resim düzeninin (dikey vs. yatay) model performansı üzerinde önemli bir etkisi olduğunu gösterdi. GPT-4o, dikey düzenlerde tutarlılığını iyileştirdi, %39,2’den %52,8’e yükseldi; ancak, LLaVA gibi diğer modeller, güçlü yönsel önyargılara sahipti, bir yönde excelled ancak diğerinde başarısız oldu.
Makale, bu tutarsızlıkların, MLLM’lerin真正 zaman mantığı yerine, resimlerin düzeni veya konumuna bağlı kalma eğiliminde olduklarını, olayların sırasını veya zaman içindeki ilerlemesini gerçekten analiz etmediklerini gösterdiğini belirtiyor.

GPT-4o’nun farklı giriş sıralamalarına karşı tahminlerini vurgulayan nitel testler. İlk sıralamada, resim çiftleri orijinal sıralarında sunulurken, ikinci sıralamada sıralama tersine çevrilir. Doğru sınıflandırmalar yeşille, saf yanlış sınıflandırmalar kırmızıyla, hayal edilen akıl yürütme turuncuyla ve mantıksız veya ‘geçersiz’ akıl yürütme kahverengiyle işaretlenmiştir, modelin farklı giriş konfigürasyonlarındaki tutarsızlıklarını ortaya koyar.
Tek resim ve çoklu resim girişleri arasındaki karşılaştırmalar, sınırlı bir genel iyileşme gösterdi, GPT-4o (P1 ile %31,0’dan %43,6’ya ve P2 ile %46,0’dan %65,3’e) çoklu resim girişinde biraz daha iyi performans gösterdi.
Diğer modeller, chẳng hạn như InternVL, stabil ancak düşük doğruluk gösterdi, Qwen-VL ise küçük kazançlar elde etti. Yazarlar, bu sonuçların, ek görsel bağlamın zaman mantığı yeteneklerini önemli ölçüde geliştirmediğini, modellerin zaman bilgisini etkili bir şekilde entegre etmekte zorlandığını belirtiyorlar.
İnsan Çalışması
İnsan çalışması, en iyi performing multimodal MLLM’nin (GPT-4o) insan tahminine karşı nasıl performans gösterdiğini değerlendirmek için üç anket yapıldı.
İnsanlar %90,3’lük doğruluk oranıyla GPT-4o’nun %65,3’lük doğruluk oranını %25 oranında aştı. Veri seti güvenilir oldu, insan hataları minimal düzeydeydi ve doğru cevaplar üzerinde tutarlı bir anlaşma vardı.

İlk tur testleri için insan kullanıcı çalışması sonuçları.
Zaman Aralığını Tahmin Etme: Sonuçlar

Zaman Aralığını Tahmin Etme sonuçları: zaman aralığını tahmin etme, resim çiftleri arasındaki zaman aralığını, saniyelerden yıllara kadar olan ölçeklerde değerlendiren model doğruluğunu değerlendirir.
Bu testlerde, MLLM’ler zaman aralığını tahmin etmekte yalnızca yeterli performans gösterdi: GPT-4o %70 doğruluk oranıyla performans gösterdi, ancak diğer modeller önemli ölçüde daha kötü performans gösterdi (yukarıdaki tabloya bakınız) ve performans ayrıca çeşitli zaman ölçeklerinde önemli ölçüde değişti.
Yazarlar yorumluyor:
‘Zaman aralığını tahmin etme görevi, MLLM’lerin resim çiftleri arasındaki zaman aralığını çıkarabilme yeteneğini test ediyor. Tüm MLLM’ler, en iyi performans gösteren modeller gibi GPT-4o ve Gemini1.5-Pro, bu görevde zorlanıyor ve yalnızca %60-70’lik orta düzey doğruluk oranlarına ulaşıyor. GPT-4o, saniye ve yıl gibi zaman ölçeklerinde güçlü performans gösteriyor, ancak saat gibi diğer zaman ölçeklerinde zayıf performans gösteriyor.’
‘Benzer şekilde, LLaVA-CoT, saniye ve gün gibi zaman ölçeklerinde olağanüstü performans gösteriyor, ancak diğer zaman aralıklarında önemli ölçüde zayıf performans gösteriyor.’
İnsan Çalışması
Zaman Aralığını Tahmin Etme için yapılan insan çalışması, ortalama insan performansı, en iyi performans gösteren model (GPT-4o) tarafından elde edilen %12,3’lük bir artış gösterdi.
Yazarlar, bazı zorlukların özellikle zor olduğunu ve tüm insan katılımcılarının yanı sıra tüm AI katılımcılarının da yanlış cevap verdiğini belirtiyorlar.
Yazarlar, GPT-4o’nun makul olarak güçlü akıl yürütme yetenekleri sergilediğini, sunulan resimlerin sırasına bağlı kalmaksızın belirtiyorlar.
SONUÇ
Eğer MLLM’ler, sunulan zorlukların en zorlarını kapsayacak kadar ‘kısayol’ verilerini biriktirip emerse, bu alanda insan benzeri genelleme yetenekleri geliştirebildiklerini söyleyip söyleyemeyecekleri belirsiz olacaktır.
Ne de tam olarak bizim kendi zaman mantığı yeteneklerini nasıl kazandığımız bilinmemektedir – acaba biz de ‘aldatmak’ mı yapıyoruz, öğrenilen deneyimlerin miktarı, bu tür testlerde ‘içgüdü’ gibi çalışan bir modeli ortaya çıkarmadan önce?
* Modellerin, insan geri bildirimi katkıda bulunan kayıp fonksiyonlarıyla giderek daha fazla optimize edildiği ve insan denemeleri ve sonraki triaj tarafından etkili bir şekilde optimize edildiği bakış açısına göre.
İlk olarak 27 Ocak 2025 Pazartesi günü yayımlandı.












