Anderson’un Açısı

DALL-E 2’nin Çift Anlamlara Özel Çözümü

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

İtalyanca öğrenen herkes, bir süpürge tarif ederken bağlamına dikkat etmeyi öğrenir, çünkü İtalyanca bu günlük ev eşyasının çok NSFW ikinci anlamı vardır*. Kelimelerin çoklu anlamlarını ve (uygun) uygulanabilirliğini ayırt etmeyi öğrenmek kolay bir iş değildir, ancak bu beceriyi DALL-E 2 ve Stable Diffusion gibi hiperscale görüntü sentez sistemlerine aktarmak kolay değildir, çünkü bunlar OpenAI’nin Karşılaştırmalı Dil-Görüntü Ön Eğitimi (CLIP) modülünü kullanır, bu modül nesneleri ve özelliklerini daha gevşek bir şekilde ele alır (ancak latent difüzyon görüntü ve video sentez alanında her geçen gün daha fazla ilerleme kaydediyor).

Bu eksikliği inceleyen bir yeni araştırma işbirliği Bar-Ilan Üniversitesi ve Allen Enstitüsü için Yapay Zeka’dan, DALL-E 2’nin bu tür semantik hatalara eğilimini kapsamlı bir şekilde inceleyen bir çalışma sunuyor:

Çift anlamlar DALL-E 2'de birden fazla nesneye bölünmüştür - herhangi bir latent difüzyon sistemi böyle örnekler üretebilir. Üst sağdaki resimde, 'altın' kelimesini.prompt'tan çıkarmak balığın türünü değiştirir, 'zebra geçidi' durumunda ise yol yüzeyini açıkça belirtmek gerekir. Kaynak: https://export.arxiv.org/pdf/2210.10606

Çift anlamlar DALL-E 2’de birden fazla yoruma bölünmüştür – herhangi bir latent difüzyon sistemi böyle örnekler üretebilir. Üst sağdaki resimde, ‘altın’ kelimesini.prompt’tan çıkarmak balığın türünü değiştirir, ‘zebra geçidi’ durumunda ise yol yüzeyini açıkça belirtmek gerekir. Kaynak: https://export.arxiv.org/pdf/2210.10606

Yazarlar, kelimelerin ve cümlelerin çift yorumlanmaya eğilimlerinin, sadece DALL-E 2’ye özgü olmadığını, aynı zamanda tüm CLIP rehberli difüzyon modellerinde ortak olduğunu ve bu modeller daha yüksek miktarda veri ile eğitildikçe bu hataların arttığını bulmuşlardır. Makale, ‘azaltılmış’ metin-görüntü modellerinin, DALL-E Mini (şimdi Craiyon) gibi, bu tür hataları çok daha az sıklıkla ürettiğini ve Stable Diffusion‘un da daha az hata yaptığını, ancak genellikle prompt’a uymadığını belirtiyor – bu da başka bir tür hatadır.

Basit bir 'tarih' prompt'ı DALL-E 2'yi kelimenin birkaç anlamından ikisine çağırır, 'fan' kelimesi de iki anlamsal eşlemesine bölünür ve üçüncü resimde 'koni' kelimesi, belirtilen gıda yerine Reliable ice cream'a dönüşür.

Basit bir ‘tarih’ prompt’ı DALL-E 2’yi kelimenin birkaç anlamından ikisine çağırır, ‘fan’ kelimesi de iki anlamsal eşlemesine bölünür ve üçüncü resimde ‘koni’ kelimesi, belirtilen gıda yerine Reliable ice cream’a dönüşür.

Etkin sözlüksel ayrımların nasıl gerçekleştirildiğini açıklayan makale şöyle diyor:

‘Semboller – aynı zamanda cümle yapıları – belirsiz olabilir, ancak bir yorum oluşturulduktan sonra bu belirsizlik already çözülür. Örneğin, bir ‘yayar’ kelimesi bir uçan yay olarak yorumlanabilir, ancak olası yorumlarımız ya bir uçan tahta ya da bir uçan hayvan olabilir, ancak aynı anda her ikisi birden değil. Bir kelime bir nesneyi (örneğin, bir tahta) belirtmek için kullanıldıktan sonra, aynı yorumda başka bir nesneyi (hayvan) belirtmek için yeniden kullanılamaz.’

DALL-E 2, makaleye göre, bu şekilde sınırlı değildir;

'Bir yayar bir beyzbol stadyumunun üzerinde uçuyor' - ilk resim makaleden, diğer üç resim aynı prompt'ı DALL-E 2'ye vererek elde edilmiştir.

‘Bir yayar bir beyzbol stadyumunun üzerinde uçuyor’ – ilk resim makaleden, diğer üç resim aynı prompt’ı DALL-E 2’ye vererek elde edilmiştir.

Bu özellik kaynak kaynak duyarlılığı olarak adlandırılmıştır.

Makale, DALL-E 2’nin üç anormal davranışını tanımlamaktadır: bir kelime veya cümle iki ayrı varlığa bölünebilir ve sahnedeki her bir varlık için bir nesne veya kavram oluşturabilir; bir kelime iki farklı varlığın bir özelliğini olarak yorumlanabilir (yukarıdaki ‘altın balığı’ ve diğer örnekleri görüntüleyin); ve bir kelime aynı anda hem bir özelliğin hem de başka bir varlığın bir özelliğinin olarak yorumlanabilir – ‘bir mühür bir mektup açıyor’ prompt’ıyla gösterildiği gibi:

'Bir mühür bir mektup açıyor' - ilk resim makaleden, diğer üç resim DALL-E 2'den elde edilmiştir. Aşağıdaki fotoğraflar 'foto, Canon50, 85mm, F5.6, ödül kazanan fotoğraf' metniyle elde edilmiştir.

‘Bir mühür bir mektup açıyor’ – ilk resim makaleden, diğer üç resim DALL-E 2’den elde edilmiştir.

Yazarlar, bu konuda iki hata modunu tanımlamaktadır: kullanıcı prompt’larındaki anlamsal olarak belirsiz kelimelerin sonuçları genellikle somutlaşan kelime ile bir kavramın bir проявını gösterecektir; ve kavram sızıntısı, bir nesnenin özellikleri başka bir nesneye aktarılabilir.

‘Bir araya getirilen fenomenler, DALLE-2’nin dilbilimsel yeteneklerinde sınırlılıklar için kanıt sağlar ve bu sınırlılıkların nedenlerinin metin kodlaması, üretken model veya her ikisiyle ilgili olup olmadığını ortaya çıkarmak için gelecekteki araştırmalar için yollar açar. Daha genel olarak, önerilen yaklaşım, kod çözme işleminin inductive bias ve text-to-image modellerinin yetersizliklerini ortaya çıkarmak için diğer senaryolara da genişletilebilir.’

Araştırmacılar, DALL-E 2’yi iki katına çıkaran 17 kelime kullanarak, homonym çoğaltmasının %80’den fazla görüldüğünü gözlemlediler.

Araştırmacılar, bu çoğaltmaların oluşmasını önlemek için gerekli spesifik ve açık dili incelemek için stimulus-kontrol çiftlerini kullandılar. Varlık-özelliği testleri için 10 böyle çift oluşturuldu ve yazarlar, stimulus prompt’larının %92,5’inde paylaşılan özelliği ortaya çıkardığını, kontrol prompt’ının ise sadece %6,6’sında ortaya çıkardığını belirtiyorlar.

‘Göstermek için, bir zebra ve bir sokak düşünün, burada zebra bir varlık, ancak sokak için bir özelliğe sahiptir ve DALL-E 2 homonym sürekli olarak geçiş yolları oluşturur, muhtemelen zebra şeritlerinin bir geçiş yoluna benzemesi nedeniyle. Ve bizim varsayımımıza uygun olarak, kontrol bir zebra ve bir çakıl sokak, genellikle geçiş yolu olmayan bir sokak türünü belirtir ve gerçekten de bu prompt için tüm kontrol örneklerimizde bir geçiş yolu yoktur.’

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai