Η γωνία του Anderson

Κατανοώντας τις Emotes του Twitch στη Σημαντική Ανάλυση

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Η αυξανόμενη χρήση των εικονιδίων, emoticon, emotes, memes, GIF και άλλων μη λεκτικών τρόπων επικοινωνίας στα κοινωνικά μέσα από το κοινό έχει, τα τελευταία χρόνια, αυξήσει την σύγχυση των προσπαθειών των επιστημόνων δεδομένων για την κατανόηση του παγκόσμιου κοινωνιολογικού τοπίου· τουλάχιστον, στον βαθμό που οι παγκόσμιες κοινωνιολογικές τάσεις μπορούν να διακριθούν από τη δημόσια συζήτηση.

Αν και η Φυσική Γλωσσική Επεξεργασία (NLP) έχει γίνει ένα ισχυρό εργαλείο στη σημαντική ανάλυση τα τελευταία δέκα χρόνια, ο τομέας έχει δυσκολία όχι μόνο στο να跟κει την εξέλιξη του λεξικού των ιδιωμάτων και γλωσσικών συντομεύσεων σε πολλές γλώσσες, αλλά και στη προσπάθεια να αποκωδικοποιήσει τη σημασία των εικονικών αναρτήσεων στα κοινωνικά μέσα όπως το Facebook και το Twitter.

Επειδή ο περιορισμένος αριθμός των πολύ πληθυσμιακών κοινωνικών μέσων είναι η μόνη πραγματικά υπερκλίμακα πηγή για αυτό το είδος έρευνας, είναι απαραίτητο για τον τομέα του AI να προσπαθήσει να διατηρήσει το ρυθμό με αυτό.

Τον Ιούλιο, μια εργασία από την Ταϊβάν πρόσφερε một νέα μέθοδο για την κατηγοριοποίηση της στάσης του χρήστη με βάση τα ‘reaction GIFs’ που αναρτώνται στα νήματα των κοινωνικών μέσων (βλέπε εικόνα παρακάτω), χρησιμοποιώντας μια βάση δεδομένων 30.000 tweets για την ανάπτυξη ενός τρόπου για να προβλέψει τις αντιδράσεις σε μια ανάρτηση. Η εργασία βρήκε ότι οι εικονικές απαντήσεις είναι σε πολλά σημεία ευκολότερες να μετρηθούν,既然 ότι είναι λιγότερο πιθανό να περιέχουν σαρκασμό, μια σημαντική πρόκληση στη σημαντική ανάλυση.

Ερευνητές από την Ταϊβάν μελέτησαν τη χρήση των κινούμενων εικονιδίων ως ‘αναγωγικών δεικτών’ της στάσης σε μια εργασία του 2021.

Νωρίτερα αυτό το έτος, μια ερευνητική προσπάθεια υπό την ηγεσία του Πανεπιστημίου της Βοστώνης εκπαίδευσε μοντέλα μηχανικής μάθησης για να προβλέψουν εικονικά memes που είναι πιθανό να γίνουν ιδιαίτερα δημοφιλή στο Twitter· και τον Αύγουστο, Βρετανοί ερευνητές εξέτασαν την αύξηση των εικονιδίων σε σύγκριση με τα emoticon (υπάρχει διαφορά) στα κοινωνικά μέσα, συγκεντρώνοντας ένα μεγάλο dataset 7 γλωσσών για τη σημαντική ανάλυση του Twitter.

Emotes του Twitch

Τώρα, Αμερικανοί ερευνητές έχουν αναπτύξει μια μεθοδολογία μηχανικής μάθησης για να κατανοήσουν, να κατηγοριοποιήσουν και να μετρήσουν το συνεχώς εξελισσόμενο ψευδολεξιλόγιο των emotes στο εξαιρετικά δημοφιλές δίκτυο Twitch.

Οι emotes είναι νεολογισμοί που χρησιμοποιούνται στο Twitch για την έκφραση συναισθήματος, διάθεσης ή εσωτερικών αστείων.既然 ότι είναι ουσιαστικά νέες εκφράσεις, η πρόκληση για ένα σύστημα μηχανικής μάθησης δεν είναι απαραίτητα να καταγράψει απεριόριστα νέους emotes (οι οποίοι μπορεί να χρησιμοποιηθούν μόνο μια φορά, ή να εξαφανιστούν γρήγορα), αλλά να αποκτήσει μια καλύτερη κατανόηση του πλαισίου που συνεχώς τους παράγει· και να αναπτύξει συστήματα ικανά να αναγνωρίζουν ένα emote ως ‘προσωρινά έγκυρο’ λόγο ή σύνθετη φράση της οποίας η συναισθηματική/πολιτική θερμοκρασία μπορεί να χρειαστεί να μετρηθεί αποκλειστικά από το контекст.

Γείτονες του emote 'FeelsGoodMan', του οποίου η σημασία μπορεί να αλλάξει από ασαφείς επικαλύψεις. Πηγή: https://arxiv.org/pdf/2108.08411.pdf

Γείτονες του emote ‘FeelsGoodMan’, του οποίου η σημασία μπορεί να αλλάξει από ασαφείς επικαλύψεις. Πηγή: https://arxiv.org/pdf/2108.08411.pdf

Η εργασία έχει τον τίτλο FeelsGoodMan: Inferencing Semantics of Twitch Neologisms, και προέρχεται από τρεις ερευνητές στη Spiketrap, μια εταιρεία ανάλυσης κοινωνικών μέσων στο Σαν Φρανσίσκο.

Παγίδα και Αλλαγή

Παρά την καινοτομία και την συχνά βραχύβια ζωή τους, τα emotes του Twitch ανακυκλώνουν συχνά πολιτισμικό υλικό (συμπεριλαμβανομένων παλαιότερων emotes) με έναν τρόπο που μπορεί να οδηγήσει τα πλαισια της σημαντικής ανάλυσης σε λάθος κατεύθυνση. Η αναζήτηση της αλλαγής της σημασίας ενός emote καθώς εξελίσσεται μπορεί ακόμη και να αποκαλύψει μια πλήρη αναστροφή ή άρνηση της αρχικής της στάσης ή προθέσεως.

Για παράδειγμα, οι ερευνητές σημειώνουν ότι η αρχική alt-right καταχρήστευση του ομώνυμου meme Pepe-the-frog έχει σχεδόν πλήρως χάσει την αρχική της πολιτική χροιά στο контекστ της χρήσης του στο Twitch.

Η χρήση της φράσης, μαζί με μια εικόνα ενός καρτούν φρογκ από ένα κόμικ του 2005 από τον καλλιτέχνη Matt Furie, έγινε ένα far-right meme στη δεκαετία του 2010.尽管 το Vox έγραψε το 2017 ότι η κατάχρηση του meme από τη δεξιά είχε επιβιώσει της αυτο-αποσύνδεσης του Furie από τέτοια χρήση, οι ερευνητές του Σαν Φρανσίσκο πίσω από την καινούρια εργασία έχουν βρει το αντίθετο*:

‘Το καρτούν φρόγκ του Furie υιοθετήθηκε από δεξιούς αναρτητές σε διάφορα διαδικτυακά φόρουμ όπως το 4chan στις αρχές της δεκαετίας του 2010. Από τότε, ο Furie έχει αγωνιστεί για να ανακτήσει τη σημασία του χαρακτήρα του, και το emote έχει δει μια αύξηση σε πιο κυρίαρχη μη μισαλλόδοξη χρήση και θετική χρήση στο Twitch. Τα αποτελέσματά μας στο Twitch συμφωνούν, δείχνοντας ότι το “FeelsGoodMan” και το αντίθετό του “FeelsBadMan” χρησιμοποιούνται κυρίως字義τικά.’

Δυσκολίες Κατωτέρω

Είδος ‘παγίδας και αλλαγής’ σχετικά με τις γενικευμένες ‘ιδιότητες’ ενός meme μπορεί να εμποδίσει τα ερευνητικά προγράμματα NLP που έχουν ήδη κατηγοριοποιήσει ως ‘μίσος’, ‘δεξιά’ ή ‘εθνικιστικό [ΗΠΑ]’, και τα οποία έχουν ρίψει αυτή την πληροφορία σε ανοιχτές πηγές. Αργότερα προγράμματα NLP μπορεί να μην επιλέξουν να ελέγξουν την τρέχουσα αξιολόγηση των παλαιότερων δεδομένων· μπορεί να μην έχουν κανένα πρακτικό μηχανισμό για να το κάνουν· και μπορεί να μην είναι καν vědomi της ανάγκης.

Το αποτέλεσμα αυτού είναι ότι η χρήση των δεδομένων του Twitch του 2017 για να διαμορφώσετε einen ‘πολιτικό αλγόριθμο κατηγοριοποίησης’ θα αποδώσει αξιοσημείωτη alt-right δραστηριότητα στο Twitch, με βάση τη συχνότητα του emote FeelsGoodMan. Το Twitch μπορεί ή δεν μπορεί να είναι γεμάτο με δεξιούς επιρροείς, αλλά, σύμφωνα με τους ερευνητές της καινούριας εργασίας, δεν μπορείτε να το αποδείξετε με το φρόγκ.

Η πολιτική σημασία του meme ‘Pepe’ φαίνεται να έχει εγκαταλειφθεί από τους 140 εκατομμύρια χρήστες του Twitch (41% των οποίων είναι κάτω από 24), οι οποίοι έχουν αποτελεσματικά ξανακλέψει το έργο από τους αρχικούς κλέφτες και το έχουν ζωγραφίσει με τα δικά τους χρώματα, χωρίς κανένα ιδιαίτερο πρόγραμμα.

Μέθοδος και Δεδομένα

Οι ερευνητές βρήκαν ότι τα δεδομένα των emotes του Twitch με ετικέτες ήταν ‘πρακτικά μη υπάρχοντα’, παρά την καταλήξη μιας παλαιότερης μελέτης ότι υπάρχουν οκτώ εκατομμύρια συνολικά emotes, και 400.000 ήταν παρόντα στη seule εβδομάδα της παραγωγής του Twitch που επιλέχθηκε από τους παλαιότερους ερευνητές.

Μια μελέτη του 2017 που ασχολήθηκε με την πρόβλεψη emotes στο Twitch περιόρισε τον εαυτό της στην πρόβλεψη μόνο των top 30 emotes του Twitch, με βαθμολογία 0,39 για την πρόβλεψη emotes.

Για να αντιμετωπίσουν την ελλειπή, οι ερευνητές του Σαν Φρανσίσκο ακολούθησαν μια νέα προσέγγιση στα παλαιότερα δεδομένα, χωρίζοντάς τα 80/20 μεταξύ εκπαίδευσης και δοκιμής, και εφαρμόζοντας ‘παραδοσιακές’ μεθόδους μηχανικής μάθησης, οι οποίες δεν είχαν χρησιμοποιηθεί προηγουμένως για τη μελέτη των δεδομένων του Twitch. Αυτές οι μεθόδους περιελάμβαναν Naive Bayes (NB), Random Forest (RF), Support Vector Machine (SVM, με γραμμικούς πυρήνες), και Logistic Regression.

Αυτή η προσέγγιση υπερέβη τις προηγούμενες βασικές γραμμές του Twitch για την ανάλυση στάσεων κατά 63,8%, και επέτρεψε στους ερευνητές να αναπτύξουν στη συνέχεια το πλαισιο LOOVE (Learning Out Of Vocabulary Emotions), το οποίο είναι σε θέση να αναγνωρίζει νεολογισμούς και να ‘πλουτίζει’ τα υπάρχοντα μοντέλα με αυτές τις νέες ορισμούς.

Αρχιτεκτονική του πλαισίου LOOVE (Learning Out Of Vocabulary Emotions) που αναπτύχθηκε από τους ερευνητές.

Αρχιτεκτονική του πλαισίου LOOVE (Learning Out Of Vocabulary Emotions) που αναπτύχθηκε από τους ερευνητές.

Το LOOVE διευκολύνει την αυτο-εκπαίδευση των word embeddings, και επίσης προβλέπει περιοδική επανα-εκπαίδευση και fine-tuning, απομακρύνοντας την ανάγκη για δεδομένα με ετικέτες, τα οποία θα ήταν λογιστικά ακατόρθωτα, με βάση την κλίμακα της εργασίας και την ταχεία εξέλιξη των emotes.

Στη διάρκεια του έργου, οι ερευνητές εκπαίδευσαν ένα ‘ψευδο-λεξικό’ emotes σε ένα μη ετικετεμένο dataset του Twitch, παράγοντας 444.714 εμβυθίσεις λέξεων, emotes, εικονιδίων και emoticon.

Επιπλέον, αυτοί επέκτειναν ένα VADER λεξικό με ένα λεξικό εικονιδίων/emoticon, και除了 το προαναφερθέν dataset EC, επίσης εκμεταλλεύτηκαν τρία άλλα δημόσια διαθέσιμα datasets για τερναρική ταξινόμηση στάσεων, από το Twitter, Rotten Tomatoes και ένα δείγμα dataset YELP.

Δεδομένης της μεγάλης ποικιλίας μεθοδολογιών και δεδομένων που χρησιμοποιήθηκαν στη μελέτη, τα αποτελέσματα είναι ποικίλα, αλλά οι ερευνητές ισχυρίζονται ότι η καλύτερη τους βασική γραμμή υπερέβη την πλησιέστερη προηγούμενη μετρική κατά 7,36 ποσοστιαίες μονάδες.

Οι ερευνητές θεωρούν ότι η συνεχής αξία του έργου είναι η ανάπτυξη του LOOVE, με βάση τις word-to-vector (W2V) εμβυθίσεις που εκπαιδεύτηκαν σε πάνω από 313 εκατομμύρια μηνύματα chat του Twitch με τη βοήθεια του K-Nearest Neighbor (KNN).

Οι συγγραφείς καταλήγουν:

‘Μια οδηγική ιδιότητα πίσω από το πλαισιο είναι ένα ψευδο-λεξικό emotes που μπορεί να χρησιμοποιηθεί για να εξαγάγει στάση για άγνωστα emotes. Χρησιμοποιώντας αυτό το ψευδο-λεξικό emotes, δημιουργήσαμε einen πίνακα στάσεων για 22.507 emotes. Αυτό είναι η πρώτη περίπτωση κατανόησης emotes σε αυτή την κλίμακα.’

 

* Η μετατροπή μου των εσωτερικών παραπομπών σε υπερσυνδέσμους.

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai