Anderson’un Açısı

DALL-E 2 Sadece Şeyleri Birleştirmek Mi Yapıyor, İlişkilerini Anlamadan?

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Harvard Üniversitesi’nden yeni bir araştırma makalesi, OpenAI’nin dikkat çekici metin-görsel çerçevesi DALL-E 2’nin, sentezlenen fotoğrafları oluştururken bile bileşenleri arasındaki ilişkileri yeniden üretmede önemli zorluklar yaşadığını öne sürüyor.

Araştırmacılar, 169 katılımcıdan oluşan bir kullanıcı çalışması yaptı. Katılımcılara, DALL-E 2 görselleri ve bunları oluşturan metin promt’ları gösterildi. Katılımcılardan, görsellerin promt’larla ilgili olup olmadığını belirlemeleri istendi. Ancak, görsellerin yalnızca %22’si promt’larla ilgili olarak algılandı.

Araştırmada kullanılan bir ekran görüntüsü. Katılımcılardan, görselleri seçmeleri istendi. Arayüze eklenen açıklamaya rağmen, tüm görseller aslında gösterilen promt'tan oluşturulmuştu. Kaynak: https://arxiv.org/pdf/2208.00005.pdf

Araştırmada kullanılan bir ekran görüntüsü. Katılımcılardan, görselleri seçmeleri istendi. Arayüze eklenen açıklamaya rağmen, tüm görseller aslında gösterilen promt’tan oluşturulmuştu. Kaynak: https://arxiv.org/pdf/2208.00005.pdf

Sonuçlar, DALL-E 2’nin, gerçek dünya eğitim verisinde moins olası olan bileşenleri birleştirmekte zorluk yaşadığını da gösteriyor.

Örneğin, “çocuk bir kaseye dokunuyor” promt’ına verilen cevapların %87’si anlaşma sağladı, ancak “maymun bir iguanaya dokunuyor” promt’ına verilen cevapların yalnızca %11’i anlaşma sağladı.

DALL-E, olasılık dışı olayları, örneğin 'maymun bir iguanaya dokunuyor' gibi olayları betimlemek için zorluk yaşıyor.

DALL-E, olasılık dışı olayları, örneğin ‘maymun bir iguanaya dokunuyor’ gibi olayları betimlemek için zorluk yaşıyor.

DALL-E 2, bu gibi olayları betimlemekte zorluk yaşadığından, gerçek dünya eğitim verisinde bu tür olayların bulunmaması muhtemeldir.

DALL-E’nin, bileşenleri birleştirmekte zorluk yaşaması, insanların DALL-E 2’nin fotogerçekçi ve geniş yorumlama yeteneklerine karşı eleştirel bir göz geliştirememesine neden olabilir.

DALL-E 2'nin resmi örneklerinden birleştirme sentezi. Kaynak: https://openai.com/dall-e-2/

DALL-E 2’nin resmi örneklerinden birleştirme sentezi. Kaynak: https://openai.com/dall-e-2/

Makalede* deniyor ki:

‘İnsan zekasının temel bir bileşeni olan ilişkisel anlayış, erken dönemde gelişir ve algıda hızlı ve otomatik olarak hesaplanır.

‘DALL-E 2’nin, basit uzaysal ilişkileri bile zorlukla tái üretmesi, sistemlerin henüz insanların dünyayı esnek ve güçlü bir şekilde yapılandırmasına izin veren türden temsilleri öğrenmediğini gösteriyor.

‘DALL-E 2 gibi sistemlerin ilişkisel bileşimlilikten yoksun olduğu anlamına gelen doğrudan bir yorum, bu sistemlerin henüz şeyler arasındaki kuralları öğrenmediğini gösteriyor.’

Araştırmacılar, DALL-E serisi gibi metin-görsel sentez sistemlerinin, robotikte kullanılan algoritmaları kullanabileceğini ve böylece ilişkileri ve kimlikleri aynı anda modelleyebileceğini öne sürüyorlar.

Bu yaklaşımın adı CLIPort ve DALL-E 2’de kullanılan CLIP mekanizmasını kullanıyor.

CLIPort, Washington Üniversitesi ve NVIDIA arasındaki 2021 işbirliği, CLIP'i pratik bir bağlamda kullanıyor ve sistemlerin fiziksel ilişkileri anlamasını gerektiriyor.

CLIPort, Washington Üniversitesi ve NVIDIA arasındaki 2021 işbirliği, CLIP’i pratik bir bağlamda kullanıyor ve sistemlerin fiziksel ilişkileri anlamasını gerektiriyor. Kaynak: https://arxiv.org/pdf/2109.12098.pdf

Araştırmacılar, DALL-E 2’nin mimarisinin, tek bir hesaplama katmanında çarpıcı etkileri içerebileceğini ve böylece ilişkilerin biyolojik sistemlerin bilgi işlem kapasitelerine ilham veren bir şekilde hesaplanmasına izin verebileceğini öne sürüyorlar.

Makale yeni ve Colin Conwell ve Tomer D. Ullman tarafından Harvard Psikoloji Bölümü’nden yazılmıştır.

Erken Eleştirilerin Ötesinde

Yazarlar, DALL-E 2’nin gerçeklik ve bütünlüğünün arkasındaki “gösteri”yi yorumlarken, DALL-E tarzı generatif görüntü sistemlerinde eksikliklerin daha önce keşfedildiğini belirtiyorlar.

Bu yıl Haziran ayında, Berkeley Üniversitesi, DALL-E’nin yansıma ve gölgeleri işlemede zorluk yaşadığını belirtti;

Çalışma

Yeni proje, psikolojik prensiplere dayalı bir yaklaşım benimsemekte ve DALL-E 2’nin sınırlılıklarını araştırmak ve ele almak için DALL-E 2’ye olan ilgi patlamasından uzaklaşmaktadır.

Makalede* deniyor ki:

‘Bu çalışma, daha önce bilişsel, gelişimsel veya dilbilim literatüründe tanımlanan, incelenen veya önerilen 15 temel ilişkiye odaklanıyor.

‘Prompt’lar kasıtlı olarak basit ve öznitelik karmaşıklığı veya açıklamadan yoksundur.

‘Basitlik, insan psikolojisinin çeşitli alt alanlarından geniş bir ilişki yelpazesini yakalar ve potansiyel model hatalarını daha belirgin ve spesifik hale getirir.’

Araştırmacılar, çalışmada 169 katılımcıya 18 görseli bir 3×6 ızgara içinde sundular ve katılımcılardan görselleri seçmelerini istediler.

Görseller, dilbilim, gelişimsel ve bilişsel literatürden alınan sekiz fiziksel ve yedi “etkin” ilişkiyi içeriyordu.

Fiziksel İlişkiler
içinde, üzerinde, altında, kaplayarak, yakında, örtülü, asılı ve bağlı.

Etken İlişkiler
itme, çekme, dokunma, vurma, tekmelendirme, yardım etme ve engel olmak.

Bu ilişkiler, daha önce belirtilen non-CS alanlarından alındı.

On iki varlık, promt’lar için kullanılmak üzere türetilmiştir: altı nesne ve altı ajan.

Nesneler
kutu, silindir, battaniye, kase, çay fincanı ve bıçak.

Ajanlar
adam, kadın, çocuk, robot, maymun ve iguana.

Araştırmacılar, her ilişki için beş farklı promt oluşturdu ve her birini DALL-E 2’ye sundu.

Sonuçlar

Makalede* deniyor ki:

‘Katılımcılar, DALL-E 2’nin görselleri ile promt’lar arasında düşük bir anlaşma düzeyi bildirdiler, ortalama %22,2 [18,3, 26,6] 75 farklı promt boyunca.

‘Etken promt’lar, ortalama %28,4 [22,8, 34,2] 35 promt boyunca, fiziksel promt’lardan daha yüksek bir anlaşma düzeyi sağladı, ortalama %16,9 [11,9, 23,0] 40 promt boyunca.’

Çalışmanın sonuçları. Siyah noktalar tüm promt'ları gösterir ve her nokta bir promt'u temsil eder. Renk, promt konusunun etken veya fiziksel olup olmadığını gösterir.

Çalışmanın sonuçları. Siyah noktalar tüm promt’ları gösterir ve her nokta bir promt’u temsil eder. Renk, promt konusunun etken veya fiziksel olup olmadığını gösterir.

Araştırmacılar, insan ve algoritmik algı arasındaki farkı karşılaştırmak için görselleri OpenAI’nin açık kaynaklı ViT-L/14 CLIP tabanlı çerçevesinden geçirdiler.

CLIP (ViT-L/14) karşılaştırma sonuçları.

CLIP (ViT-L/14) karşılaştırma sonuçları.

Araştırmacılar, DALL-E 2’nin yalnızca ilişkisel anlama yeteneği olmadığını, temel bir insan zekası bileşenini yeniden üretmekte zorluk yaşadığını belirtiyorlar.

‘DALL-E 2 gibi sistemlerin, şeyler arasındaki kuralları öğrenmediğini gösteren bir yorum, bu sistemlerin henüz şeyler arasındaki ilişkileri anlamadığını gösteriyor.

‘Kompozisyon, şeyler arasındaki kuralları anlamak demektir. İlişkiler, bu kurallardır.’

Adam T-Rex’i ısırmak

Yorum OpenAI, DALL-E 2’ye daha fazla kullanıcıya erişim sağladıktan sonra, özellikle de ücretli generations için, DALL-E 2’nin ilişkisel anlama konusundaki eksiklikleri daha belirgin hale gelebilir.

Örneğin, bir Jurassic Park hayranı için, DALL-E 2’de bir dinozorun bir insanı kovalamasını elde etmek çok zordur, çünkü bu kavram DALL-E 2’nin sansür sistemine dahil edilmemiştir ve dinozor filmlerinin uzun tarihi, bu imkansız karşılaşma için yeterli eğitim örnekleri sağlamalıdır.

DALL-E 2'nin 'Renkli bir fotoğrafında bir T-Rex bir adamı bir yolda kovalıyor' promt'ına verilen tipik bir cevap.

DALL-E 2’nin ‘Renkli bir fotoğrafında bir T-Rex bir adamı bir yolda kovalıyor’ promt’ına verilen tipik bir cevap. Kaynak: DALL-E 2

Bu gibi promt’lar için DALL-E 2’nin verdiği cevaplar, T-Rex’in insanı kovalamak yerine, insanı kovalayan veya ona yaklaşan bir T-Rex’i gösterir.

Bu, DALL-E 2’nin, yalnızca “adam dinozoru dövüyor” gibi eski filmlerin tanıtım görüntülerinden oluşan küçük bir veri kümesiyle eğitilmiş olabileceğini ve Jeff Goldblum’un dinozordan kaçışının bu küçük veri kümesindeki bir istisna olduğunu gösteriyor.

 

* Yazarların satır içi alıntılarını hyperlink’e dönüştürdüm.

İlk olarak 4 Ağustos 2022’de yayımlandı.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai