زاوية Anderson

فهم لغة Twitch Emotes في تحليل المشاعر

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

ازداد استخدام الجمهور للرموز التعبيرية، والرموز التعبيرية، واللغة المصورة، والصور المتحركة، وغيرها من الطرق غير اللفظية للتواصل على منصات التواصل الاجتماعي، مما أثار حيرة جهود علماء البيانات لفهم المناظر الاجتماعية العالمية؛ على الأقل، إلى الحد الذي يمكن من خلاله استخلاص الاتجاهات الاجتماعية العالمية من الخطاب العام.

على الرغم من أن معالجة اللغة الطبيعية (NLP) أصبحت أداة قوية في تحليل المشاعر خلال العقد الماضي، إلا أن القطاع يواجه صعوبات ليس فقط في مواكبة المعجم المتطور باستمرار من اللهجات والاختصارات اللغوية عبر لغات متعددة، ولكن أيضًا في محاولة فك شفرة معنى المنشورات القائمة على الصور على منصات التواصل الاجتماعي مثل فيسبوك وتويتر.

منذ أن كان عدد منصات التواصل الاجتماعي المكتظة بالسكان محدودًا، فمن الضروري للقطاع الاصطناعي على الأقل محاولة مواكبة ذلك.

في يوليو، قدمت ورقة من تايوان طريقة جديدة لتصنيف مشاعر المستخدمين بناءً على “الردود المتحركة” المنشورة في خيوط التواصل الاجتماعي (انظر الصورة أدناه)، باستخدام قاعدة بيانات من 30,000 تغريدة لتطوير طريقة للتنبؤ بالردود على المنشور. وجدت الورقة أن الاستجابات القائمة على الصور أكثر سهولة في تقييمها، لأنها أقل احتمالاً لاحتوائها على سخرية، وهو تحدي ملحوظ في تحليل المشاعر.

دراسة باحثين من تايوان حول استخدام الرسوم المتحركة كدلالات مختزلة على المشاعر في ورقة عام 2021.

في وقت سابق من هذا العام، قاد جهود بحث بجامعة بوسطن لتدريب نماذج التعلم الآلي لتنبؤ بالصور المتحركة التي من المحتمل أن تصبح شائعة على تويتر؛ وفي أغسطس، قام باحثون بريطانيون بدراسة نمو الرموز التعبيرية مقارنة بالرموز التعبيرية (هناك فرق) على منصات التواصل الاجتماعي، وجمّعوا مجموعة بيانات كبيرة الحجم من 7 لغات لتحليل المشاعر على تويتر.

رموز Twitch التعبيرية

الآن، طور باحثون أمريكيون منهجية تعلم الآلة لفهم وتقسيم وتقييم المعجم الزائف المتطور باستمرار لرموز Twitch التعبيرية على شبكة Twitch الشهيرة.

رموز التعبيرية هي كلمات جديدة تستخدم على Twitch للتعبير عن المشاعر أو المزاج أو النكات الداخلية. منذ أن هي كلمات جديدة بالتعريف، فإن التحدي لنظام التعلم الآلي ليس بالضرورة لتسجيل رموز التعبيرية الجديدة (التي قد تستخدم مرة واحدة أو تتوقف عن الاستخدام بسرعة)، ولكن لتطوير أنظمة قادرة على التعرف على رمز تعبيري ككلمة أو عبارة صالحة مؤقتًا التي قد تحتاج إلى تقييمها تمامًا من السياق.

جيران رمز التعبير

جيران رمز التعبير “FeelsGoodMan”، الذي يمكن تغيير معناه بواسطة لاحقات غامضة. مصدر: https://arxiv.org/pdf/2108.08411.pdf

الورقة بعنوان FeelsGoodMan: استنتاج دلالات رموز Twitch الجديدة، وهي من ثلاثة باحثين في شركة تحليل وسائل التواصل الاجتماعي في سان فرانسيسكو.

الخدعة والتبديل

على الرغم من nouveتها وأحيانًا حياة قصيرة، فإن رموز Twitch التعبيرية تكرر المواد الثقافية (بما في ذلك رموز التعبيرية القديمة) بطريقة يمكن أن توجه إطارات تحليل المشاعر في الاتجاه الخاطئ. تتبع تحول معنى رمز التعبيرية مع تطورها يمكن أن يكشف حتى عن عكس أو نفي كامل للمشاعر أو النية الأصلية.

على سبيل المثال، يشير الباحثون إلى أن الاستخدام الأصلي لرمز التعبيرية “FeelsGoodMan” قد فقد معظم طابعه السياسي الأصلي في سياق استخدامه على Twitch.

استخدام الجملة، مع صورة قطة كرتونية من قصص مصورة عام 2005 من قبل الفنان مات فوري، أصبح رمزًا متطرفًا لليمين في عام 2010. على الرغم من أن موقع Vox كتب في عام 2017 أن تبني اليمين للرمز قد نجح في البقاء على قيد الحياة بعد انفصال فوري المعلن عنه مع هذا الاستخدام، إلا أن الباحثين في سان فرانسيسكو وجدوا عكس ذلك*:

‘adopted by rightwing posters on various online forums like 4chan in the early 2010s. Since then, Furie has campaigned to reclaim the meaning of his character, and the emote has seen an upsurge in more mainstream non hate usage and positive usage on Twitch. Our results on Twitch agree, showing that “FeelsGoodMan” and its counterpart “FeelsBadMan” are mainly being used literally.’

المشاكل في hạ游

يمكن أن تعيق هذه الأنواع من “الخدعة والتبديل” مشاريع بحث NLP التي قد صنفت بالفعل رمز التعبيرية على أنه “كره” أو “يمين” أو “قومي [الولايات المتحدة]”، والتي قد ألقت هذه المعلومات في مستودعات مفتوحة طويلة الأمد. قد لا تختار مشاريع NLP اللاحقة مراجعة عملة بيانات أقدم؛ قد لا يكون لديها آلية عملية للقيام بذلك؛ وقد لا تكون حتى على دراية بالحاجة.

النتيجة هي أن استخدام مجموعات بيانات Twitch لعام 2017 لصياغة خوارزمية “تصنيف سياسي” سيعزى إلى نشاط اليمين المتطرف على Twitch، بناءً على تكرار رمز التعبيرية “FeelsGoodMan”. قد تكون Twitch مليئة بمؤثرين من اليمين المتطرف، أو قد لا تكون كذلك، ولكن وفقًا للباحثين في الورقة الجديدة، لا يمكن إثبات ذلك من خلال القطة.

يبدو أن رمز التعبيرية “Pepe” قد تخلى عن دلالته السياسية بشكل عفوي من قبل 140 مليون مستخدم على Twitch (41% منهم تقل أعمارهم عن 24 عامًا)، الذين سرقوا العمل بشكل فعال من اللصوص الأصليين ولوّنوه بألوانهم الخاصة، دون أي خطة معينة.

المنهج والبيانات

وجد الباحثون أن بيانات رموز Twitch التعبيرية المسمى كانت “غير موجودة تقريبًا”، على الرغم من استنتاج دراسة سابقة أن هناك ثمانية ملايين رمز تعبيري إجمالي، و400,000 منها كانت موجودة في أسبوع واحد من إخراج Twitch في الأسبوع الذي اختاره الباحثون السابقون.

دراسة عام 2017 حول تنبؤ رمز التعبيرية على Twitch محدودة في التنبؤ برموز التعبيرية الأعلى على Twitch، وبلغت 0.39 فقط لتنبؤ رمز التعبيرية.

لمواجهة النقص، اتبع الباحثون في سان فرانسيسكو نهجًا جديدًا للبيانات القديمة، وقسموها إلى 80/20 بين التدريب والاختبار، وتطبيق أساليب التعلم الآلي التقليدية، والتي لم تُستخدم من قبل لدراسة بيانات Twitch. وشملت هذه الأساليب Naive Bayes (NB) وRandom Forest (RF) وSupport Vector Machine (SVM) مع نوى خطية، وLogistic Regression.

هذا النهج تفوق على أسس خطوط قاعدة Twitch السابقة بنسبة 63.8٪، وأمكن للباحثين بعد ذلك تطوير إطار LOOVE (Learning Out Of Vocabulary Emotions) القادر على تحديد الكلمات الجديدة و”تخصيص” النماذج الحالية بالتعريفات الجديدة.

هيكل إطار LOOVE (Learning Out Of Vocabulary Emotions) الذي طوّره الباحثون.

هيكل إطار LOOVE (Learning Out Of Vocabulary Emotions) الذي طوّره الباحثون.

يسمح إطار LOOVE بتدريب التضمين الكلمات بدون إشراف، ويتضمن أيضًا إعادة التدريب والتعدين الدوري، مما يلغي الحاجة إلى مجموعات بيانات مسماة، والتي سيكون من الصعب تنفيذها логистически، بالنظر إلى حجم المهمة وتطور رموز التعبيرية السريع.

في خدمة المشروع، درب الباحثون “قاموسًا زائفًا” لرموز التعبيرية على مجموعة بيانات Twitch غير مسماة، وأنتجوا 444,714 تضمينًا للكلمات ورموز التعبيرية والرموز التعبيرية والرموز التعبيرية.

علاوة على ذلك، أضافوا إلى قاموس VADER معجمًا للرموز التعبيرية والرموز التعبيرية، وإلى جانب مجموعة بيانات EC المذكورة أعلاه، استغلوا ثلاث مجموعات بيانات عامة أخرى لتصنيف المشاعر الثلاثي من تويتر وRotten Tomatoes ومجموعة بيانات YELP العينة.

نظرًا للتنوع الكبير في الأساليب ومجموعات البيانات المستخدمة في الدراسة، فإن النتائج متنوعة، لكن الباحثين يؤكدون أن أفضل حالة قاعدة لهم تفوقت على أقرب مقياس سابقة ب 7.36 نقطة مئوية.

يعتبر الباحثون أن قيمة المشروع المستمرة هي تطوير إطار LOOVE، الذي يعتمد على تضمين الكلمات إلى المتجهات (W2V) المدرّب على أكثر من 313 مليون رسالة دردشة على Twitch بمساعدة K-Nearest Neighbor (KNN).

يختم المؤلفون بالقول:

‘ميزة قيادية وراء الإطار هي قاموس زائف لرموز التعبيرية يمكن استخدامه لاستخلاص المشاعر لرموز التعبيرية غير المعروفة. باستخدام هذا القاموس الزائف، قمنا بإنشاء جدول مشاعر ل 22,507 رمز تعبيري. هذا هو أول حالة لفهم رمز التعبيرية على هذا النطاق.’

 

* تحويلي لمراجع داخلية إلى روابط.

كاتب في التعلم الآلي، متخصص في مجال合成 الصور البشرية. سابقًا رئيس محتوى البحث في Metaphysic.ai، حتى انحلت في DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai