Anderson’un Açısı

DALL-E 2 Gibi Saf İmaj Sentez Çerçeveleri için Bir Tespit Sistemi

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Kaliforniya Üniversitesi, Berkeley’den yeni bir araştırma, yeni nesil görüntü sentez çerçevelerinin – zoals Open AI’nin DALL-E 2‘si ve Google’ın Imagen ve Parti‘si – çıkışını belirlemek için bir yöntem sunuyor. bu, sentezlenmiş görüntülerdeki geometri, gölgeler ve yansımaları inceleyerek.

DALL-E 2’de metin promtleri ile oluşturulan görüntüleri inceleyen araştırmacılar, mimarinin gerçekçi olmasına rağmen, bazıpersistent tutarsızlıkların ortaya çıktığını bulmuşlardır. Bunlar, küresel perspektifin oluşturulması, gölgelerin oluşturulması ve özellikle de yansıtılan nesnelerin oluşturulması ile ilgili olarak ortaya çıkar.

Makalede şöyle denir:

‘[Geometrik] yapılar, atılan gölgeler ve yansıtıcı yüzeylerdeki yansımalar, doğal sahnelerin beklenen perspektif geometrisi ile tam olarak tutarlı değildir. Geometrik yapılar ve gölgeler genellikle yerel olarak tutarlıdır, ancak küresel olarak tutarlı değildir.

‘Yansımalar, diğer taraftan, genellikle inanılmaz bir şekilde oluşturulur, muhtemelen eğitim görüntü verisi setinde daha az ortak olduklarından.’

DALL-E 2 görüntüsünü tespit etmek için güvenilir bir yol, oluşturulan nesne ile onun yansımasının tutarlı kesişimlerinin eksikliğidir. Kaynak: https://arxiv.org/pdf/2206.14617.pdf

DALL-E 2 görüntüsünü tespit etmek için güvenilir bir yol, oluşturulan nesne ile onun yansımasının tutarlı kesişimlerinin eksikliğidir. Kaynak: https://arxiv.org/pdf/2206.14617.pdf

Bu makale, bilgisayar görüşü araştırma topluluğunda eventually önemli bir dal olabilecek Görüntü Sentez Tespiti alanına erken bir giriş olarak kabul edilebilir.

2017’de deepfake’lerin ortaya çıkmasından bu yana, deepfake tespiti (primarily otoencoder çıkışından paketler gibi DeepFaceLab ve FaceSwap) aktif ve rekabetçi bir akademik dal haline gelmiştir. çeşitli makaleler ve metodolojiler, sentezlenmiş yüzlerin gerçek video görüntülerindeki ‘ipuçlarını’ hedeflemektedir.

Ancak, çok yakın zamanda ortaya çıkan hyperscale-eğitimli görüntü oluşturma sistemlerine kadar, metin promt sistemlerinin çıkışları – zoals CLIP – ‘fotogerçeklik’ statükosuna tehdit oluşturmamıştır. Makale yazarları, bu durumun değişmek üzere olduğunu ve DALL-E 2 çıkışındaki tutarsızlıkların, görüntülerin aldatma potansiyelini önemli ölçüde etkilemeyeceğini düşünmektedir.

Yazarlar şöyle diyor:

‘[Bu] başarısızlıklar, insan görsel sisteminin, bazı geometrik yargılarda, özellikle aydınlatma, gölgeler, yansımalar, görünüm konumu ve perspektif bozulması konusunda şaşırtıcı bir şekilde yeteneksiz olduğu bulunmuştur.’

Kaybolan Güvenilirlik

Yazarların DALL-E 2 çıkışının ilk adli incelemesi, perspektif projeksiyonu ile ilgilidir – yakındaki nesnelerin ve dokuların düz kenarlarının nasıl uniform olarak bir ‘kaybolma noktasına’ çözümlendiği.

Solda, aynı düzlemdeki paralel çizgiler ortak bir kaybolma noktasına çözülür; sağda, aynı ve paralel düzlemlerdeki birden fazla kaybolma noktası bir kaybolma çizgisini (kırmızı olarak gösterilir) tanımlar.

Solda, aynı düzlemdeki paralel çizgiler ortak bir kaybolma noktasına çözülür; sağda, aynı ve paralel düzlemlerdeki birden fazla kaybolma noktası bir kaybolma çizgisini (kırmızı olarak gösterilir) tanımlar.

Araştırmacılar, DALL-E 2’nin bu konuda tutarlılığını test etmek için, DALL-E 2’yi kullanarak 25 sentezlenmiş mutfak görüntüsü oluşturdular – genellikle iyi döşenmiş konutlarda bile sıklıkla bulunan bir alandır ve çeşitli nesne ve dokular için birden fazla kaybolma noktası sağlar.

‘Mutfakta fayanslı zeminin fotoğrafı’ promtından oluşturulan görüntüleri inceleyen araştırmacılar, her durumda genel olarak inandırıcı bir temsil bulmuşlardır, ancak nesnelerin doğru bir şekilde birleşmediğini bulmuşlardır.

Araştırmacılar, her bir paralel çizgi setinin tutarlı ve tek bir kaybolma noktasında kesiştiğini, ancak tezgahın kaybolma noktasının hem vanishing çizgileri (kırmızı) hem de fayanslardan türetilen kaybolma noktası ile uyuşmadığını belirtiyorlar.

Araştırmacılar, tezgahın fayanslara paralel olmasa bile, mavi kaybolma noktasının (kırmızı) vanishing çizgisine çözümlenmesi gerektiğini gözlemlediler.

Makalede şöyle denir:

‘Bu görüntülerin perspektifi – etkileyici bir şekilde – yerel olarak tutarlıdır, ancak küresel olarak tutarlı değildir. Aynı model, 25 sentezlenmiş mutfak görüntüsünde de bulundu.’

Gölge Adli

Herhangi bir ray-tracing ile uğraşan herkesin bildiği gibi, gölgeler de kaybolma noktalarına sahiptir, bu da tek veya çoklu ışık kaynağını gösterir. Dış mekan gölgeleri için, bir ışık kaynağından (güneş) gelen gölgelerin tümü tutarlı bir şekilde çözümlenmelidir.

Araştırmacılar, önceki deney gibi, 25 DALL-E 2 görüntüsü oluşturdu, ‘güneşli bir günde kaldırımda üç küp’ ve ‘bulutlu bir günde kaldırımda üç küp’ promtlarını kullandılar.

Üst satırda, 'bulutlu bir günde kaldırımda üç küp' promtından oluşturulan görüntüler; alt satırda, 'güneşli bir günde kaldırımda üç küp' promtından oluşturulan görüntüler.

Üst satırda, ‘bulutlu bir günde kaldırımda üç küp’ promtından oluşturulan görüntüler; alt satırda, ‘güneşli bir günde kaldırımda üç küp’ promtından oluşturulan görüntüler.

Araştırmacılar, DALL-E 2’nin bulutlu koşulları temsil ederken, daha dağınık gölgeleri inandırıcı ve mümkün bir şekilde oluşturabildiğini, muhtemelen bu tür gölgelerin eğitim görüntü verisi setinde daha yaygın olmasından dolayı belirtiyorlar.

Ancak, ‘güneşli’ fotoğrafların bazıları, tek bir ışık kaynağından gelen sahneyi temsil etmedi.

Üstteki görüntü, her bir nesnenin kendi ‘güneş’ ini göstermek için gri tonlarına dönüştürülmüştür.

Bazı oluşturulan görüntüler, daha belirgin ‘gölge hataları’ gösterdi:

Bazı gölgeler yanlış yerdeyken, birçokları da CGI modellemede sanal bir ışık için örnekleme oranının çok düşük olduğu zaman ortaya çıkan görsel uyumsuzluğa karşılık geliyor.

DALL-E 2’de Yansımalar

En ağır sonuçlar, yazarların DALL-E 2’nin yüksek yansıtıcı yüzeyler oluşturma yeteneğini test ettiğinde ortaya çıktı, bu da geleneksel rendering algoritmalarında da zor bir hesaplama işlevidir.

Araştırmacılar, bu deney için 25 DALL-E 2 görüntüsü oluşturdu, ‘bir oyuncak dinozorun ve bir güzellik aynasındaki yansımasının fotoğrafı’ promtını kullandılar.

Tüm durumlarda, araştırmacılar, oluşturulan dinozorun yansımasının, ‘gerçek’ dinozorun görünümü ve durumundan bazı şekilde kopuk olduğunu belirttiler. Yazarlar, sorunun metin promtındaki varyasyonlara karşı dirençli olduğunu ve sistemin temel bir zayıflığı gibi göründüğünü söylüyorlar.

Bazı hataların mantıklı bir nedeni var gibi görünüyor – üst satırdaki ilk ve üçüncü örnekler, dinozorun çok iyi bir şekilde kopyalandığını, ancak yansıtılmadığını gösteriyor.

Yazarlar şöyle diyor:

‘Önceki bölümlerdeki atılan gölgeler ve geometrik yapılar gibi, DALL·E-2, inandırıcı yansımalar oluşturmada zorluk çekiyor, muhtemelen bu tür yansımaların eğitim görüntü verisi setinde daha az ortak olmasından dolayı.’

Bu tür hatalar, gelecekteki metin-görüntü modelleri tarafından düzeltilmeyecek gibi görünüyor. Bunlar, çıkışlarının genel semantik mantığını daha etkili bir şekilde gözden geçirebilecek ve sahnelere soyut fiziksel kurallar uygulayabileceklerdir.

Araştırmacılar, her geçen gün daha büyük sentez mimarilerine doğru bir eğilimin ışığında, şöyle diyor:

‘[Bu] sadece bir zaman meselesi olabilir, resim-yazı sentez motorlarının tam perspektif tutarlılığı ile görüntüler oluşturmayı öğrenmeden önce. O zamana kadar, geometrik adli analizler bu görüntüleri analiz etmek için faydalı olabilir.’

 

* Yazarların inline alıntılarını hyperlinklere dönüştürdüm.

İlk olarak 30 Haziran 2022’de yayınlandı.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai