Anderson’un Açısı
Video Eleştirisini İyileştirmek İçin AI’yi Eğitmek

Büyük Görsel-Dil Modelleri (LVLMs), bilgisayar görüşü literatüründeki bazı daha az bilinen veya zorlu gönderilerde yorumlama konusunda faydalı yardımcılar olabilir, ancak bir alanda sınırlıdırlar: eşlik eden yeni makalelerin *video örneklerinin* niteliklerini ve öznel kalitesini belirleme.
Bu, bir gönderinin kritik bir yönüdür, çünkü bilimsel makaleler genellikle metin veya görseller aracılığıyla veya her ikisi aracılığıyla heyecan yaratmayı amaçlar.
Video sentezi içeren projelerde, yazarlar gerçek video çıkışını göstermek zorundadır, yoksa çalışmalarının reddedilmesiyle karşı karşıya kalabilirler ve bu gösterilerde iddialar ile gerçek dünya performansı arasındaki fark genellikle ortaya çıkar.
Kitabı Okudum, Filmi Görmedim
Şu anda, popüler API tabanlı Büyük Dil Modelleri (LLM’ler) ve Büyük Görsel-Dil Modelleri (LVLM’ler), video içeriğini doğrudan analiz etmez, bunun yerine yalnızca ilgili metinleri analiz edebilir ve belki de yorum ipleri ve diğer salt metin tabanlı yardımcı materyalleri yorumlayabilir.

GPT-4o, Google Gemini ve Perplexity’nin, metin tabanlı kaynaklara başvurmadan doğrudan video analizini istediğinde ortaya çıkan çeşitli itirazlar.
Bununla birlikte, bir LLM, videoyu gerçekten izleyemeyeceği gerçeğini gizleyebilir veya inkar edebilir, ancak bunu ancak onu bu konuda sıkıştırırsanız:

Bir araştırma makalesinin ilgili videolarının subjektif bir değerlendirmesini sağlamakla görevlendirilen ve gerçek bir görüşü taklit eden ChatGPT-4o, sonunda gerçekten videoyu doğrudan izleyemeyeceğini itiraf eder.
ChatGPT-4o gibi modeller çok modelli ve en azından (video’dan çıkarılan bir kare gibi) bireysel fotoğrafları analiz edebilir, ancak bununla ilgili bazı sorunlar vardır: önce, bir LLM’nin subjektif görüşüne güvenmek için gerçek bir temel yoktur, en azından LLM’lerin insanları memnun etme eğiliminde olduklarından dolayı.
İkincisi, bir oluşturulan videoyun sorunlarının çoğu, bir karede kaybolan zamansal bir yönü içerecektir.
Son olarak, LLM yalnızca metin tabanlı bilgiyi emerek edindiği (örneğin, derin sahte görüntüler veya sanat tarihi hakkında) öğrenilmiş gömme tabanına dayalı bir “değer yargısı” verebilir:

FakeVLM projesi, özel bir çok modelli görsel-dil modeli aracılığıyla hedeflenen derin sahte tespiti sunar. Kaynak: https://arxiv.org/pdf/2503.14905
Bu, bir LLM’nin videoyu doğrudan analiz edemeyeceği anlamına gelmez; Örneğin, YOLO gibi yardımcı AI sistemleri kullanılarak, bir LLM bir videoyu nesneleri tanımlayabilir veya bunu doğrudan yapabilir, eğer çok modelli işlevler için ortalamanın üzerinde bir sayıda eğitim almışsa.
Ancak, bir LLM’nin bir videoyu subjektif olarak değerlendirebileceği (yani, “Bana gerçekçi görünmüyor”)唯一 yolu, insan görüşünü iyi yansıtan bir kayıp fonksiyonu tabanlı metriği uygulamaktır.
Kayıp fonksiyonları, eğitim sırasında modelin tahminlerinin doğru cevaplarla ne kadar uzakta olduğunu ölçmek için kullanılan matematiksel araçlardır. Modelin öğrenmesini yönlendiren geri bildirimi sağlar: hata ne kadar büyükse, kayıp o kadar yüksek olur.
Eğitim ilerledikçe, model parametrelerini bu kaybı azaltmak için ayarlar ve böylece doğru tahminler yapma yeteneğini渐渐 artırır.
Kayıp fonksiyonları, modellerin eğitimi düzenlemek ve AI modellerinin çıktısını değerlendirmek için tasarlanmış algoritmaları ayarlamak için kullanılır.
Koşullu Görüş
En popüler metriklere/loss fonksiyonlarından biri Fréchet Inception Distance (FID)’dir, bu, oluşturulan görüntülerin kalitesini, bunların dağılımını (burada “görsel özelliklerle nasıl dağıldıkları veya gruplandıkları” anlamında) ve gerçek görüntülerin dağılımını ölçerek değerlendirir.
Özellikle, FID, (sık sık eleştirilen) Inception v3 sınıflandırma ağı kullanılarak her iki görüntü kümesinden çıkarılan özellikler arasındaki istatistiksel farkı, ortalama ve kovaryans kullanarak hesaplar.
Daha düşük bir FID puanı, oluşturulan görüntülerin gerçek görüntülere daha benzer olduğunu ve dolayısıyla görsel kalite ve çeşitlilik bakımından daha iyi olduğunu gösterir.
Ancak FID esasen karşılaştırmalı ve doğası gereği özreferansiyeldir. Bunu gidermek için, daha sonraki Koşullu Fréchet Mesafesi (CFD, 2021) yaklaşımı, FID’den farklı olarak oluşturulan görüntüleri gerçek görüntülere karşılaştırır ve bir ek koşula ne kadar iyi uyduğunu temel alan bir puan sağlar, Örneğin, (kaçınılmaz olarak öznel) bir sınıf etiketi veya girdi görüntüsü.
Bu şekilde, CFID yalnızca gerçeklik veya çeşitliliklerini değil, aynı zamanda görüntülerin amaçlanan koşulları ne kadar iyi karşıladığını değerlendirir.

2021 CFD’den örnekler. Kaynak: https://github.com/Michael-Soloveitchik/CFID/
CFD, loss fonksiyonlarına ve metrik algoritmalarına insan yorumunu dahil etme yönündeki recent trendi takip eder. Bu tür bir insan merkezli yaklaşım, ortaya çıkan algoritmanın “ruhsuz” veya yalnızca mekanik olmayacağını garantiler, ancak aynı zamanda bir dizi sorunu da sunar: önyargı olasılığı, algoritmayı yeni uygulamalarla güncellemenin yükü ve bu, yıllar boyunca projeler arasında tutarlı karşılaştırmalı standartların olmayacağı gerçeği; ve bütçe kısıtlamaları (daha az insan katılımcı, kararların daha kuşkulu olmasına neden olurken, daha yüksek bir sayı, faydalı güncellemeleri maliyet nedeniyle engelleyebilir).
cFreD
Bu, bizi ABD’den gelen bir yeni makaleye getirir, bu makale apparent olarak Koşullu Fréchet Mesafesi (cFreD) sunar, bu, görsel kalite ve metin-görüntü hizalamasını değerlendirerek insan tercihlerini daha iyi yansıtmak için tasarlanmış CFD’nin yeni bir yorumudur

Yeni makaleden kısmi sonuçlar: “Bir kanepe ve kanepe上的 bir laptop bilgisayarı olan bir oturma odası” promtı için farklı metriklere göre görüntü sıralamaları (1–9). Yeşil, en yüksek insan tarafından derecelendirilen modeli (FLUX.1-dev) vurgular, mor en düşük (SDv1.5)’i. Sadece cFreD insan sıralamalarına karşılık gelir. Lütfen tam sonuçlar için kaynak makaleye başvurun, burada onları yeniden üretmeye yerimiz yok. Kaynak: https://arxiv.org/pdf/2503.21721
Yazarlar, mevcut metin-görüntü sentezi değerlendirme yöntemlerinin, örneğin Inception Skoru (IS) ve FID, insan yargısına iyi uymaz çünkü yalnızca görüntü kalitesini dikkate alır, görüntülerin promtlara uyup uymadığını dikkate almaz:
“Örneğin, iki görüntü ve her biri için karşılık gelen promt içeren bir veri kümesini düşünün: bir köpek ve bir kedi. Bir mükemmel metin-görüntü modeli, bu eşleştirmeleri yanlışlıkla değiştirirse (yani, köpek promtı için bir kedi oluşturur ve tersi), FID neredeyse sıfır olur, çünkü kediler ve köpeklerin genel dağılımı korunur, ancak promtlarla uyumsuzluk rağmen.”
“cFreD’nin, görüntü kalitesi değerlendirmesi ve girdi metnine koşullandırma konusunda daha iyi bir uyum sağladığını ve insan tercihleriyle daha iyi bir korelasyon sağladığını gösteriyoruz.”

Makalenin testleri, yazarların önerdiği metriğin, cFreD’nin, FID, FDDINOv2, CLIPScore ve CMMD’ye kıyasla üç referans veri kümesinde (PartiPrompts, HPDv2 ve COCO) insan tercihleriyle daha yüksek korelasyon sağladığını sürekli olarak gösteriyor.
Kavram ve Yöntem
Yazarlar, metin-görüntü modellerini değerlendirmek için güncel altın standartın, insan tercih verilerini toplamak için kalabalık karşılaştırmalar aracılığıyla insan tercih verisi toplamak olduğunu belirtirler, benzer yöntemler büyük dil modelleri (örneğin, LMSys Arena) için kullanılır.
Örneğin, PartiPrompts Arena, 1.600 İngilizce promt kullanır, katılımcılara farklı modellerden gelen görüntü çiftleri sunar ve tercih edilen görüntüyü seçmelerini ister.
Benzer şekilde, Metin-Görüntü Arena Liderlik Tablosu, model çıktılarının kullanıcı karşılaştırmalarını kullanarak ELO puanlarıyla sıralamalar oluşturur. Ancak, bu tür insan değerlendirme verilerini toplamak pahalı ve zaman alıcıdır, bu nedenle bazı platformlar – PartiPrompts Arena gibi – güncellemeleri durdurma noktasına gelmiştir.

Şu anda ước edilen liderleri sıralayan Yapay Zeka Görüntü Arena Liderlik Tablosu. Kaynak: https://artificialanalysis.ai/text-to-image/arena?tab=Leaderboard
Alternatif yöntemler, insan tercih verilerine dayalı olarak eğitilmiştir, ancak gelecekteki modelleri değerlendirmek için etkinlikleri belirsizdir, çünkü insan tercihleri sürekli olarak evrim geçirir. Dolayısıyla, FID, CLIPScore ve yazarların önerdiği cFreD gibi otomatik metriklere ihtiyaç duyulacaktır.
Yazarlar, hem gerçek hem de oluşturulan görüntülerin, bir promt koşuluyla koşullandırılmış Gaussian dağılımları izlediğini varsayar, her biri koşullu ortalama ve kovaryanslar tarafından tanımlanır. cFreD, bu koşullu dağılımlar arasındaki beklenen Fréchet mesafesini ölçer. Bu, doğrudan koşullu istatistikler açısından veya koşulsuz istatistiklerle promt içeren çapraz kovaryanslar kullanılarak formüle edilebilir.
Bu şekilde, cFreD, görüntülerin gerçekliğini ve verilen metinle tutarlılığını değerlendirebilir.
Veri ve Testler
cFreD’nin insan tercihleriyle ne kadar iyi korelasyon sağladığını değerlendirmek için, yazarlar aynı metinle promplandırılan farklı modellerden görüntü sıralamalarını kullandılar. Değerlendirmeleri, İnsan Tercih Puanı v2 (HPDv2) test kümesi ve PartiPrompts Arena gibi iki kaynaktan yararlandı.
Yazarlar, Arena’dan dağınık veri noktalarını tek bir veri kümesine topladılar; gerçek görüntü, insan değerlendirmelerinde en yüksek sıralamaya ulaşmazsa, en yüksek sıralamaya ulaşan görüntüyü referans olarak kullandılar.
Yeni modelleri test etmek için, COCO’nun eğitim ve doğrulama kümelerinden 1.000 promt örnekledi, HPDv2 ile örtüşmeyecek şekilde; bu bölümdeki orijinal COCO görüntüleri referans olarak kullanıldı.
cFreD yaklaşımı, dört istatistiksel metrik aracılığıyla değerlendirildi: FID; FDDINOv2; CLIPScore; ve CMMD. Ayrıca, dört öğrenilmiş metriklerle karşılaştırıldı, bunlar insan tercih verilerine dayalı olarak eğitilmiştir: Estetik Puan; Görüntü Ödülü; HPSv2; ve MPS.
Yazarlar, her bir metrik için model puanlarını bildirdiler ve sıralamaları hesapladılar, bunların insan değerlendirme sonuçlarıyla hizalamasını değerlendirdiler, cFreD DINOv2-G/14 için görüntü gömme ve OpenCLIP ConvNext-B Metin Kodlayıcı için metin gömme kullanıyordu†.
Önceki çalışmalar, insan tercihlerini öğrenirken, her bir görüntü-metin çifti için sıralama doğruluğunu hesaplayarak performansı ölçmüştür, ardından bu sonuçların ortalamasını alır.
Yazarlar, bunun yerine cFreD’yi küresel sıralama doğruluğu kullanarak değerlendirdiler, bu, tüm veri kümesi boyunca genel sıralama performansını değerlendirir; istatistiksel metriklere gelince, sıralamaları doğrudan ham puanlardan türettiler ve insan tercihlerine dayalı metriklere gelince, her bir model için tüm örnekler boyunca atanan sıralamaları önce ortalamalarını aldılar, ardından bu ortalamalardan nihai sıralamayı belirlediler.
İlk testler, GLIDE; COCO; FuseDream; DALLE 2; VQGAN+CLIP; CogView2; Stable Diffusion V1.4; VQ-Diffusion; Stable Diffusion V2.0; ve LAFITE gibi on çerçeve içeriyordu.

HPDv2 test kümesinde istatistiksel metriklere (FID, FDDINOv2, CLIPScore, CMMD ve cFreD) ve insan tercihine dayalı metriklere (Estetik Puan, Görüntü Ödülü, HPSv2 ve MPS) göre model sıralamaları ve puanları. En iyi sonuçlar kalın, ikinci en iyi sonuçlar alt çizgili olarak gösterilir.
İlk sonuçlardan, yazarlar şunları belirtirler:
“cFreD, insan tercihleriyle en yüksek hizalamayı sağlar, 0,97’lik bir korelasyon elde eder. İstatistiksel metriklere gelince, cFreD en yüksek korelasyonu elde eder ve insan tercihlerine dayalı olarak eğitilen HPSv2’ye (0,94) benzerdir. HPSv2, test kümesindeki dört modelin eğitim kümesini içerir ve aynı anketörleri kullanır, bu nedenle bu ayarın spesifik insan tercih önyargılarını kodlar.”
“Karşılaştırıldığında, cFreD, insan tercih training veri kümesi olmadan, insan değerlendirmeyle benzer veya daha iyi korelasyonu elde eder. Bu sonuçlar, cFreD’nin, çeşitli modeller boyunca daha güvenilir sıralamalar sağlayan güçlü bir otomatik metriğin olduğunu gösterir.”
Tüm değerlendirilen metriklere gelince, cFreD en yüksek sıralama doğruluğunu elde etti (91,1%), yazarlara göre insan yargılarıyla güçlü bir hizalama gösteriyor.
HPSv2, 88,9% ile takip etti, FID ve FDDINOv2 rekabetçi puanlar elde etti (86,7%). İnsanların tercihlerine dayalı olarak eğitilen metriklere gelince, cFreD, genel olarak en güçlü ve en güvenilir oldu.
Aşağıda, ikinci test turunun sonuçlarını görüyoruz, bu kez SDXL; Kandinsky 2; Würstchen; ve Karlo V1.0 kullanarak PartiPrompts Arena’da:

PartiPrompt’ta istatistiksel metriklere (FID, FDDINOv2, CLIPScore, CMMD ve cFreD) ve insan tercihine dayalı metriklere (Estetik Puan, Görüntü Ödülü ve MPS) göre model sıralamaları ve puanları. En iyi sonuçlar kalın, ikinci en iyi sonuçlar alt çizgili olarak gösterilir.
Burada makale şunları belirtir:
“İstatistiksel metriklere gelince, cFreD, insan değerlendirmeleriyle en yüksek korelasyonu elde eder (0,73), FID ve FDDINOv2’nin her ikisi de 0,70’lik bir korelasyona ulaşır. Karşılaştırıldığında, CLIP puanı, insan yargılarıyla çok düşük bir korelasyona sahiptir (0,12).”
“İnsan tercihine dayalı kategoride, HPSv2 en güçlü hizalamayı elde eder, en yüksek korelasyonu elde eder (0,83), onu ImageReward (0,81) ve MPS (0,65) takip eder. Bu sonuçlar, cFreD’nin güçlü bir otomatik metrik olduğunu vurgularken, HPSv2’nin PartiPrompts Arena’da insan değerlendirme eğilimlerini yakalamada en etkili olduğunu gösterir.”
Son olarak, yazarlar COCO veri kümesi üzerinde, FLUX.1[dev]; Playgroundv2.5; Janus Pro; ve Stable Diffusion varyantları SDv3.5-L Turbo, 3.5-L, 3-M, SDXL, 2.1 ve 1.5 ile bir değerlendirme gerçekleştirdiler.
İnsan tercih sıralamaları, Metin-Görüntü Liderlik Tablosu’ndan ELO puanları olarak alındı:

Rasgele seçilen COCO promt’larında otomatik metriklere (FID, FDDINOv2, CLIPScore, CMMD ve cFreD) ve insan tercihine dayalı metriklere (Estetik Puan, Görüntü Ödülü, HPSv2 ve MPS) göre model sıralamaları. 0,5’in altındaki sıralama doğruluğu, uyumlu çiftlerden daha fazla uyumsuz çift olduğunu gösterir ve en iyi sonuçlar kalın, ikinci en iyi sonuçlar alt çizgili olarak gösterilir.
Bu tur ile ilgili olarak, araştırmacılar şunları belirtirler:
“İstatistiksel metriklere gelince (FID, FDDINOv2, CLIP, CMMD ve önerdiğimiz cFreD), yalnızca cFreD, insan tercihleriyle güçlü bir korelasyona ulaşır (0,33) ve önemli bir sıralama doğruluğuna ulaşır (66,67%). Bu sonuç, cFreD’yi genel olarak üçüncü en uyumlu metrik olarak yerleştirir, yalnızca insan tercihine dayalı metriklere, ImageReward, HPSv2 ve MPS tarafından geçilir.”
“Diğer tüm istatistiksel metriklere gelince, insan sıralamalarıyla önemli ölçüde daha zayıf bir hizalama gösterir ve bunun sonucunda sıralamaları tersine çevirir, bu da 0,5’in altındaki bir Sıralama Doğruluğuna yol açar. Bu bulgular, cFreD’nin hem görsel Sadakat hem de promt tutarlılığına duyarlı olduğunu vurgular ve metin-görüntü oluşturmanın benchmark’lanması için pratik, eğitim gerektirmeyen bir alternatif olarak değerini güçlendirir.”
Yazarlar ayrıca, literatürdeki yaygınlığına dikkat çekerek Inception V3’ü bir arka uç olarak test etti ve makul bir performans sergiledi, ancak DINOv2-L/14 ve ViT-L/16 gibi transformer tabanlı arka uçların daha tutarlı bir şekilde insan sıralamalarıyla uyumlu olduğunu buldu ve bu, modern değerlendirme kurulumlarında InceptionV3’ü değiştirmeyi desteklediğini iddia etti.

Her bir görüntü arka ucunun sıralamalarının, COCO veri kümesindeki gerçek insan türetilen sıralamalarla ne sıklıkla eşleştiği gösteren kazanma oranları.
SONUÇ
İnsan katılımcılı解决ümler, metrik ve loss fonksiyonlarının geliştirilmesinde optimal yaklaşımdır, ancak bu tür şemaların gerekli güncelleme ölçeği ve sıklığı, insan katılımının yaygın kamu katılımı ile teşvik edilmediği veya CAPTCHA’lar gibi zorunlu kılınmadığı sürece pratik olmayacaktır.
Yazarların yeni sisteminin güvenilirliği, insan yargısına olan hizalamasına bağlıdır, ancak birçok recent insan-katılımcı yaklaşımın aksine, bir düzey daha uzaktadır; ve cFreD’nin meşruiyeti, insan tercih verilerine bağlıdır (elbette, böyle bir referans olmadan, cFreD’nin insan benzeri değerlendirme yaptığını iddia etmek ispatlanamaz).
Argüman edilebilir ki, oluşturulan çıktıdaki “gerçeklik” için当前 kriterlerimizi loss fonksiyonuna dahil etmek uzun vadede bir hata olabilir, çünkü bu kavram, yeni nesil oluşturucu AI sistemlerinin saldırısı altında olan ve sık sık önemli revizyonlara tabi tutulacak bir kavramdır.
* Şu anda, bir örnekleyici illustratif video örneği ekleyecektim, belki de bir akademik gönderiden; ancak bu, Arxiv’in oluşturucu AI çıktısını 10-15 dakikadan fazla taramış olan herkesin zaten karşılaştığı, ilgili gönderinin bir kilometre taşı olarak kabul edilmeyeceğini gösteren subjektif olarak düşük kaliteli video örnekleriyle karşılaşacağı için kötü niyetli olurdu.
† Deneylerde toplam 46 görüntü arka uc modeli kullanıldı, ancak grafik sonuçlarda hepsi dikkate alınmamıştır. Tam liste için lütfen makalenin ekine başvurun; tablo ve figürlerde listelenenlere yer verilmiştir.
İlk olarak 1 Nisan 2025 Salı günü yayınlandı












