Anderson’un Açısı

Twitch Emotiklerini Anlama: Sentiment Analizi

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Halkın, artan kullanımı ile emojis, emoticons, emotes, memes, GIF’ler ve diğer sözel olmayan iletişim yolları, son yıllarda sosyal medya platformlarında veri bilimcilerin küresel sosyolojik manzarayı anlamalarına engel olmuştur; en azından, dünya çapındaki sosyolojik eğilimleri kamuoyu tartışmalarından anlaşılabilir.

Doğal Dil İşleme (NLP), son on yılda sentiment analizi alanında güçlü bir araç haline gelmiş olmasına rağmen, sektörün hem sürekli değişen argo ve dil kısaltmaları sözlüğünü takip etme hem de sosyal medya platformlarındaki görüntü tabanlı gönderilerin anlamını çözme konusunda zorlukları vardır.

Sosyal medya platformlarının sınırlı sayıda olması ve bu tür araştırmalar için tek gerçek hyperscale kaynağı olması nedeniyle, AI sektörünün bunu takip etmeye çalışması önemlidir.

Temmuz ayında, bir kağıt, yeni bir yöntem sundu, kullanıcı sentimentini sosyal medya ipliklerine yapılan ‘reaksiyon GIF’lerine dayanarak kategorize etti (aşağıdaki resme bakınız) ve 30.000 tweet veritabanını kullanarak bir gönderiye tepkileri tahmin etmek için bir yol geliştirdi. Kağıt, görüntü tabanlı yanıtların souvent daha kolay ölçülebileceğini, çünkü alaycılık içermeyeceğini buldu, bu da sentiment analizi alanında önemli bir zorluktur.

Araştırmacılar, 2021’de bir makalede animasyonlu reaksiyon GIF’lerini sentiment göstergesi olarak incelediler.

Bu yılın başlarında, Boston Üniversitesi’nden bir araştırma ekibi, makine öğrenimi modellerini Twitter’da viral olacak görüntü memesini tahmin etmek için eğitti ve Ağustos ayında İngiliz araştırmacılar, sosyal medyada emoticon’ların emojis ile karşılaştırılmasını incelediler (fark vardır) ve büyük ölçekli 7 dil Twitter sentiment veritabanını derlediler.

Twitch Emotikileri

Şimdi, ABD’li araştırmacılar, sentiment analizi alanında sürekli değişen emotes pseudo-sözlüğünü daha iyi anlamak, kategorize etmek ve ölçmek için bir makine öğrenimi metodolojisi geliştirdiler.

Emotes, Twitch’de duygu, ruh hali veya iç şakalar ifade etmek için kullanılan neologizmlerdir. Tanımı gereği yeni ifadeler olduklarından, bir makine öğrenimi sisteminin zorluğu, yeni emotes’i sonsuza kadar kataloglamak değil, bunları sürekli üreten çerçeveyi daha iyi anlamak ve sentimentini tamamen bağlamdan ölçmek için gereken sistemleri geliştirmektir.

FeelsGoodMan emotesinin komşuları, anlamları belirsiz soneklerle değiştirilebilir. Kaynak: https://arxiv.org/pdf/2108.08411.pdf

FeelsGoodMan emotesinin komşuları, anlamları belirsiz soneklerle değiştirilebilir. Kaynak: https://arxiv.org/pdf/2108.08411.pdf

Araştırmacıların makalesi, FeelsGoodMan: Twitch Neologizmlerinin Anlamlarını Çıkarımı adlı bir çalışmadır ve San Francisco’daki bir sosyal medya analiz şirketinden üç araştırmacı tarafından yapılmıştır.

Bait and Switch

Twitch emotes, genellikle kültürel materyali (daha eski emotes dahil) yeniden kullanır ve sentiment analizi çerçevelerini yanlış yöne yönlendirebilir. Bir emotenin anlamındaki değişimi izlemek, sogar orijinal sentiment veya amacın tamamen tersine dönüştüğünü gösterebilir.

Araştırmacılar, orijinal sağcı FeelsGoodMan Pepe-the-frog memesinin, Twitch’deki kullanımı bağlamında neredeyse tamamen orijinal siyasi tadını kaybettiğini belirtiyorlar.

Bu cümle, birlikte bir 2005 çizgi romanı karakterinin resmi ile, sağcı bir meme haline geldi. Vox, 2017’de yazdı ki, sağın bu meme kullanımının, Furie’nin böyle bir kullanımla ilişkisini kesmesinden sonra da hayatta kalmıştır, ancak San Francisco’daki araştırmacılar, bunun böyle olmadığını bulmuşlardır*:

‘Furie’nin çizgi roman karakteri, 2010’larda 4chan gibi çeşitli çevrimiçi forumlarda sağcı posterler tarafından benimsendi. O zamandan beri Furie, karakterinin anlamını geri kazanmaya çalıştı ve emote, daha çok ana akım nefret içermeyen ve pozitif kullanımını gördü. Twitch’de yaptığımız çalışmalar, “FeelsGoodMan” ve “FeelsBadMan” emotelerinin genellikle literal olarak kullanıldığını gösteriyor.’

Trouble Downstream

Bu tür ‘bait and switch’, bir meme’nin genel özelliklerini yanlış yönlendirebilir ve NLP araştırmalarını engelleyebilir. Daha önceki NLP projeleri, bu verileri uzun süreli açık kaynak depolara.dump edebilir ve daha sonra bu verilerin güncelliğini denetlemeyebilir.

Bunun sonucu, 2017 Twitch tabanlı verilerini kullanarak ‘siyasi kategorizasyon’ algoritması geliştirmek, Twitch’de FeelsGoodMan emotesinin sıklığına dayanarak önemli sağcı faaliyetlere işaret edecektir. Ancak araştırmacılara göre, bu emote ile bunu kanıtlamak mümkün değildir.

‘Pepe’ memesinin siyasi anlamı, Twitch’in 140 milyon kullanıcısı (bunların %41’i 24 yaşın altındadır) tarafından kolayca terk edilmiştir ve bu kullanıcılar, orijinal hırsızlardan çalışmayı geri almış ve kendi renkleriyle boyamışlardır, herhangi bir ajanda olmadan.

Yöntem ve Veri

Araştırmacılar, etiketli Twitch emote verilerinin neredeyse yok olduğunu bulmuşlardır, daha önceki bir çalışmanın sonucuna rağmen, 8 milyon toplam emote ve bir hafta içinde 400.000 emote vardır.

2017’de yapılan bir çalışma, Twitch’de emote tahmini ile sınırlı kaldı ve sadece en iyi 30 Twitch emotesini tahmin etti, emote tahmini için 0.39 puan aldı.

Araştırmacılar, bu eksikliği gidermek için eski verilere yeni bir yaklaşım geliştirdiler, veriyi 80/20 oranında eğitim ve test için ayırdılar ve ‘geleneksel’ makine öğrenimi yöntemlerini kullandılar, bunlar arasında Naive Bayes (NB), Random Forest (RF), Support Vector Machine (SVM, lineer çekirdeklerle) ve Lojistik Regresyon yer almaktadır.

Bu yaklaşım, önceki Twitch sentiment baseline’lerini %63,8 oranında aşmıştır ve araştırmacıların LOOVE (Learning Out Of Vocabulary Emotions) çerçevesini geliştirmesine olanak tanımıştır, bu çerçeve yeni tanımları tanımlayabilen ve mevcut modelleri zenginleştirebilen bir emote pseudo-sözlüğüdür.

Araştırmacılar tarafından geliştirilen LOOVE (Learning Out Of Vocabulary Emotions) çerçevesinin mimarisi.

Araştırmacılar tarafından geliştirilen LOOVE (Learning Out Of Vocabulary Emotions) çerçevesinin mimarisi.

LOOVE, kelime gömme eğitimini destekler ve periyodik olarak yeniden eğitim ve fine-tuning’i sağlar, bu da etiketli veritabanlarının gereksiz olmasını sağlar, bu tür bir görevin ölçeği ve emotes’in hızlı evrimi düşünüldüğünde.

Araştırmacılar, bir emote ‘Pseudo-Sözlüğü’nu etiketsiz bir Twitch veritabanında eğittiler ve bu süreçte 444.714 kelime, emote, emoji ve emoticon gömme oluşturdular.

Daha sonra, bir VADER sözlüğünü bir emoji/emoticon sözlüğü ile zenginleştirdiler ve ayrıca üç diğer kamu veritabanını ternary sentiment sınıflandırması için kullandılar, Twitter, Rotten Tomatoes ve örneklenen bir YELP veritabanından.

Sonuçlar çeşitlilik göstermektedir, ancak araştırmacılar, en iyi baseline’lerinin önceki en yakın ölçütü %7,36 puan aşmıştır.

Araştırmacılar, projenin devam eden değerinin, 313 milyonun üzerinde Twitch sohbet mesajı ile K-Nearest Neighbor (KNN) kullanarak eğitilen word-to-vector (W2V) gömmeleri temel alan LOOVE çerçevesinin geliştirilmesi olduğunu düşünmektedir.

Yazarlar şöyle diyor:

‘Çerçevesinin temel bir özelliği, bilinmeyen emotes için sentiment türetmek için kullanılabilen bir emote pseudo-sözlüğüdür. Bu emote pseudo-sözlüğü kullanarak, 22.507 emote için bir sentiment tablosu oluşturduk. Bu, bu ölçekte emote anlama açısından ilk durumdur.’

 

* İçsel alıntıları hyperlink’e dönüştürmektir.

Makine öğrenimi üzerine yazar, insan görüntü sentezi alanında uzman. Metaphysic.ai'de araştırma içeriği başkanı, DNEG'in Brahma.ai'ye dönüşümüne kadar.
Portfolio sitesi: martinanderson.ai
İletişim: martin@martinanderson.ai