Anderson’un Açısı
İnsanların Diyalogda Resimleri Kullanma Şekline İlişkin AI’ı Eğitme

Güney Koreli araştırmacılar, AI’ın insanların diyalogda resimleri kullanma şekline ilişkin anlayışını desteklemek ve doğal dil modellerinin bu son gelişmede insan iletişimine katılmasına yardımcı olmak için tasarlanmış bir veri seti geliştirdiler.
Makale, KAIST’ten Daedeok Innopolis’te, son on yılda çok modlu diyalog sistemleri üzerine yapılan araştırmaların, konuya peripheral disiplinlere odaklanan veri setleri ve metodolojiler nedeniyle engellenmiş olduğunu belirtiyor. Bu disiplinler arasında görsel soru cevaplaması ve resim altyazısı yer alıyor.
Bu eski yaklaşımlarda, resimler, konuşmanın leksikal bağlamı dışında değerlendirilir ve diyalogdaki görüntü yanıtlarının konuşmayı nasıl geliştirdiği ve geliştirdiği konusunda hiçbir anlayış yoktur ve görsel katkıların konuşmaya katkısını çözmek için hiçbir şema yoktur.
Diyaloga İlk Sınıf Özellikleri Olarak Resimler
Bu güne kadar yapılan birçok yaklaşım, Microsoft’ un AI araştırma kolunun girişimleri veya geliştirmeleri olmuştur. Microsoft, 2017 yılında da incelemiştir ve resimlerle başlayan çok modlu konuşmaları ele almıştır.
Araştırmada eksikliği gidermek için, Güney Koreli araştırmacılar, resimlerin ad hoc kullanımını içeren 45.000 diyalog örneği içeren bir veri seti geliştirdiler. Bu veri setinde, viral ‘meme’ resimleri üzerine odaklanılmamıştır. Bu tür resimler, dil araştırmalarında ilgi çekici olabilir, ancak anlamı sosyal medya platformlarında binlerce bağlamda daha kolaylıkla çıkarılabilir.
Metin Yerine İllüstrasyon Geliştirme
Kelime/ibare > resim bilateral transliterasyon metodolojisi geliştirmek için, Güney Koreli araştırmacılar, bir makine öğrenimi sistemini, metin tabanlı bir konuşmanın kısımlarını anlamsal olarak ilgili resim içeriğine dönüştürmek için eğittiler.

Kore sistemini çok modlu diyalog araştırması için veri seti oluşturma mimarisi. Kaynak: https://arxiv.org/pdf/2107.08685.pdf
Hedef cümlelerin ön işleme aşamasında, konuşmanın sonraki bölümünün öngörülmesini engelleyebilecek durdurma kelimelerinin silinmesi ve bağlamsal benzerlik filtreleri aracılığıyla düşük kaliteli değişimlerin budanması yer almıştır.
Veri setinin faydasını test etmek için, araştırmacılar, konuşmanın bağlamını ve ilgili resimleri dikkate alarak diyalogun sonraki ‘dönemini’ öngören bir modül oluşturdular.

Araştırmada kullanılan insan değerlendirme GUI’si.
45k veri seti (GitHub’da mevcut) için beş dış veri seti kullanıldı. Üçü metin tabanlı bileşenlerdir: DailyDialog, 2017’den itibaren el ile annotasyonlu çok turda metin tabanlı bir set; ve Facebook’un EmpatheticDialogues ve PersonaChat, her ikisi de 2018’den. Kullanılan iki resim tabanlı veri seti ise MS-COCO ve Flicker30k idi.

Resim/metin çiftleri – Veri setindeki cümlelerin JSON şeması, Microsoft’un COCO görüntü veritabanından resimlerle ilişkili.
Sistem için metin/resim ikamesi, 2019’da Boston’daki Northeastern Üniversitesi’nden geliştirilen önceden eğitilmiş Görsel Anlamsal Mantık Ağı (VSRN) tarafından sağlandı. VSRN, katkıda bulunan metin veri setlerinden el ile seçilen cümleler üzerinde çalışmak üzere ayarlandı.
Uyum Sağlama
Kaynak veri setlerinin tutarlılığı, her bir diyalog veri setinin her bir resim veri setine karşılık gelen altı kombinasyonunun geliştirilmesi ve birkaç tur boyunca insan tarafından değerlendirilmesi ile sağlandı.
İnsan puanlaması, üç kriter temelinde yapıldı: değişim bağlamına tutarlılık; resmin temel kavramını ifade etmeye ilişkin görüntü alakalığı; ve resmin hedef cümleden ana nesneleri içerme düzeyi.
Son kriteri dikkate alarak, araştırmacıların seçtiği şema, bir resmin bir metin konuşmasına enjekte edilebilecek mizah, alay, soyut veya metafizik anlamlarının olasılığını büyük ölçüde göz ardı etmiş olabilir.
Ancak, bu, başlangıç noktası olan önemli bir çalışmadır ve doğal dil işleme (NLP) sektöründe diğer placeslerde sarkazm örneklerini haritalamak için önemli çaba sarf edilmektedir.
Test Etme
Veri oluşturma çerçevesini test etmek için, araştırmacılar, Facebook’un 2020 Image-Chat araştırmasına dayanan üç parçalı bir geri alma modeli kullandılar. Modül, Resnext-101‘i resim kodlayıcı olarak; Google’ın BERT‘ini metin kodlayıcı olarak; ve bu iki bileşen için özel bir birleştirme modülünü içerir.
Sistem, mevcut ve sonraki cümle öngörme görevinde 50.35 ve 14.38 puan elde etti ve her görev için temel puanı geliştirdi.
Daha sonra, iki araştırmacı, resimleri konuşmalara manuel olarak yerleştirerek 100 çok modlu diyalog oluşturmak ve sistemi bu ‘organik’ çok modlu konuşmalarla çalıştırmakla görevlendirildi. Sistem, bu ad hoc örnekler için bile yüksek bağlam farkındalığı ile mevcut ve sonraki döngüdeki değişimleri öngörebildi.













