Anderson’un Açısı
Görüntü Sentez Sektörü, Hatalı Bir Metriği Benimsemiştir, Araştırmalar İddia Ediyor

2021, görüntü sentez sektöründe görülmemiş bir ilerleme ve yayın hızının yılı oldu ve yeni yenilikler ve teknolojilerde büyük ilerlemeler kaydedildi. Bu teknolojiler, nöral rendering, deepfakes ve diğer yeni yaklaşımlar aracılığıyla insan kişiliklerini yeniden üretebiliyor.
Ancak Almanya’dan araştırmacılar, sentetik görüntülerin gerçekçiliğini otomatik olarak değerlendiren standardın ölümcül şekilde hatalı olduğunu ve bu standarda güvenen binlerce araştırmacının yanlış bir yola girebileceğini iddia ediyorlar.
Araştırmacılar, FID standardının insan standartlarına göre görüntüleri değerlendirmekte yetersiz olduğunu göstermek için kendi GAN’larını (Generative Adversarial Networks) FID’ye göre optimize ettiler. FID, underlying kodunun farklı bir amaç için tasarlandığını ve görüntü sentezinin amaçlarına uygun olmadığını keşfettiler. FID, insan standartlarına göre görüntüleri değerlendirmekte başarısız oluyor.

FID puanları (daha düşük daha iyi) çeşitli modeller tarafından üretilen görüntüler için. Araştırmacılar, ‘Bu sıralamayla souhlas ediyor musunuz?’ diye sordu. Kaynak: https://openreview.net/pdf?id=mLG96UpmbYz
Araştırmacılar, FID standardının yerine geçebilecek diğer standartların da benzer sorunlara sahip olabileceğini belirtiyorlar. FID standardının, insanları tatmin edecek görüntüler üretebilecek yeni ölçütlere ihtiyaç duyulduğunu vurguluyorlar.
The makale, Steffen Jung ve Margret Keuper tarafından yazıldı.
Görüntü Sentez için Puanlama Sisteminin Arayışı
Yeni araştırmaya göre, görüntü sentez çerçevelerindeki ilerleme, GAN’lar ve kodlayıcı/çözücü mimarileri, sonuçların insan tarafından değerlendirilmesini gerektiriyor. Ancak insan değerlendirmesi, sonuçların empirical ve tekrar edilebilir bir şekilde değerlendirilmesini sağlamıyor.
Bu nedenle, çeşitli ölçüt çerçeveleri ortaya çıktı, bunlar arasında Inception Score (IS) ve Fréchet Inception Distance (FID) bulunuyor.
FID, GAN’ların eğitildiği veri kümesinin ve GAN tarafından üretilen görüntülerin özelliklerini karşılaştırıyor. FID puanı düşükse, GAN’ın gerçekçi görüntüler üretebildiği anlamına geliyor.

Makaleden, FFHQ64 veri kümesiyle eğitilen GAN’ın sonuçları. FID puanı 5.38 olmasına rağmen, sonuçlar insan tarafından inandırıcı bulunmuyor.
Araştırmacılar, FID standardının, Inception v3’ün özelliklerine dayandığını ve bu özelliklerin görüntü sentezinin amaçlarına uygun olmadığını belirtiyorlar.
Fréchet Inception Distance
FID, GAN’ların eğitildiği veri kümesinin ve GAN tarafından üretilen görüntülerin özelliklerini karşılaştırıyor. FID puanı düşükse, GAN’ın gerçekçi görüntüler üretebildiği anlamına geliyor.
FID, Inception v3’ün özelliklerine dayanıyor, ancak Inception v3’ün amaçları, görüntü sentezinin amaçlarından farklı.
Veri ve Yöntem
Araştırmacılar, hipotezlerini test etmek için iki GAN mimarisi, DCGAN ve SNGAN, kullanarak FFHQ64 veri kümesiyle eğitilen GAN’ları karşılaştırdılar.
Üç farklı GAN eğitimi yöntemi kullanıldı: GAN G+D, standart bir ayrımcı tabanlı ağ; GAN FID|G+D, FID’nin ayrımcı olarak kullanıldığı bir ağ; ve GAN FID|G, FID’nin GAN’ın eğitimi için kullanılan tek ölçüttü.
Araştırmacılar, FID’nin, GAN’ların eğitimi için kullanılan ölçüttü ve GAN’ların gerçekçi görüntüler üretebilmesi için yeterli olmadığını belirtiyorlar.
Araştırmacılar, FID standardının, insan tarafından tatmin edici görüntüler üretebilecek yeni ölçütlere ihtiyaç duyulduğunu vurguluyorlar.
Kolay Alternatifler Yok
Araştırmacılar, FID standardının yerine geçebilecek diğer standartların da benzer sorunlara sahip olabileceğini belirtiyorlar.
Araştırmacılar, FID standardının insan tarafından tatmin edici görüntüler üretebilecek yeni ölçütlere ihtiyaç duyulduğunu vurguluyorlar.
Araştırmacılar, makaleyi, insan tarafından tatmin edici görüntüler üretebilecek yeni ölçütlere ihtiyaç duyulduğunu vurgulayarak bitiriyorlar.
* Araştırmacıların vurgusu.
İlk olarak 20 Aralık 2021, 13:00 GMT+2’de yayınlandı.













