Η γωνία του Anderson

Αναγνώριση Απαγορευμένων Χρηστών των Μέσων Κοινωνικής Δικτύωσης με Μηχανική Μάθηση

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Ερευνητές από το Πανεπιστήμιο Τζονς Χόπκινς έχουν αναπτύξει μια προσέγγιση Μετρικής Βαθιάς για την αναγνώριση χρηστών που μπορεί να έχουν προηγουμένως ανασταλεί οι λογαριασμοί τους ή να χρησιμοποιούν πολλαπλούς λογαριασμούς για να.astroturf ή να χειραγωγούν την καλή πίστη των διαδικτυακών κοινωτήτων, όπως το Reddit και το Twitter.

Η προσέγγιση, που παρουσιάζεται σε ένα νέο έγγραφο με επικεφαλή τον ερευνητή NLP Aleem Khan, δεν απαιτεί ότι τα δεδομένα εισόδου πρέπει να είναι αυτόματα ή χειροκίνητα αναγνωρισμένα, και βελτιώνει τα αποτελέσματα των προηγούμενων προσπαθειών ακόμη και όταν μόνο μικρά δείγματα κειμένου είναι διαθέσιμα, και όταν το κείμενο δεν ήταν παρόν στο σύνολο δεδομένων κατά την εκπαίδευση.

Το σύστημα προσφέρει ένα απλό σχήμα αύξησης δεδομένων, με ενσωματώσεις διαφορετικών μεγεθών που εκπαιδεύονται σε ένα σύνολο δεδομένων υψηλής όγκου που περιέχει πάνω από 300 εκατομμύρια σχόλια που καλύπτουν πάνω από 1 εκατομμύριο διαφορετικούς λογαριασμούς χρηστών.

Η αρχιτεκτονική του μοντέλου αναγνώρισης του Τζονς Χόπκινς, όπου τα βασικά στοιχεία είναι 1) περιεχόμενο κειμένου, 2) χαρακτηριστικό sub-Reddit και 3) ημερομηνία/ώρα δημοσίευσης. Πηγή: https://arxiv.org/pdf/2105.07263.pdf

Η αρχιτεκτονική του μοντέλου αναγνώρισης του Τζονς Χόπκινς, όπου τα βασικά στοιχεία είναι 1) περιεχόμενο κειμένου, 2) χαρακτηριστικό sub-Reddit και 3) ημερομηνία/ώρα δημοσίευσης. Πηγή: https://arxiv.org/pdf/2105.07263.pdf

Το πλαίσιο, που βασίζεται σε δεδομένα χρήσης του Reddit, λαμβάνει υπόψη το περιεχόμενο κειμένου, την τοποθέτηση sub-Reddit και την ώρα δημοσίευσης. Τα τρία στοιχεία συνδυάζονται με διαφορετικές μεθόδους ενσωματώσεων, συμπεριλαμβανομένων μιας διαστατικής σύγκλισης και γραμμικών προβολών, και υποστηρίζονται από einen μηχανισμό προσοχής και ένα στρώμα μέγιστης συσσώρευσης.

Εάν η προσέγγιση επικεντρώνεται στο τομέα του κειμένου, οι ερευνητές υποστηρίζουν ότι η προσέγγισή τους μπορεί να μεταφραστεί στην ανάλυση βίντεο ή εικόνων,既然 η παραγόμενο αλγόριθμος λειτουργεί σε συχνότητες εμφάνισης σε υψηλό επίπεδο, παρά την ποικιλία των μήκων εισόδου για τα δεδομένα εκπαίδευσης.

Αποφυγή ‘Topic-Drift’

Ένα πεδίο που η έρευνα αυτού του είδους μπορεί να πέσει, και το οποίο οι συγγραφείς έχουν ρητά αντιμετωπίσει στη σχεδίαση του συστήματος, είναι να τοποθετήσουν υπερβολική έμφαση στην επανεμφάνιση συγκεκριμένων θεμάτων ή θεμάτων σε ποστ από διαφορετικούς λογαριασμούς.

Εάν ένας χρήστης γράφει действительно επαναλαμβανόμενα ή επαναλαμβανόμενα σε μια συγκεκριμένη σκέψη, το θέμα είναι πιθανό να εξελιχθεί και να “παρασυρθεί” με τον καιρό, υποβαθμίζοντας την αξία του ως κλειδί ταυτότητας. Οι συγγραφείς χαρακτηρίζουν αυτή την πιθανή παγίδα ως “σύνεδροι για τους λάθος λόγους” – μια παγίδα που μελετήθηκε προηγουμένως στο Τζονς Χόπκινς.

Μέθοδος Εκπαίδευσης

Το σύστημα χρησιμοποιεί εκπαίδευση μεικτής ακρίβειας, μια καινοτομία που παρουσιάστηκε το 2018 από την Baidu και την NVIDIA, η οποία μειώνει τις απαιτήσεις μνήμης κατά το ήμισυ χρησιμοποιώντας μισής ακρίβειας πλωτές τιμές: 16-bit πλωτές τιμές αντί 32-bit τιμών. Τα δεδομένα εκπαιδεύτηκαν σε δύο V100 GPUs, με μέσο χρόνο εκπαίδευσης 72 ώρες.

Το σχήμα χρησιμοποιεί απλοποιημένη κωδικοποίηση κειμένου, με συζυγή κωδικοποιητές περιορισμένους σε 2-4 υπο-λέξεις. Εάν ο μέσος όρος για πλαίσια αυτού του είδους είναι μέγιστος πέντε υπο-λέξεις, οι ερευνητές βρήκαν ότι αυτή η οικονομία δεν είχε κανένα αντίκτυπο στην απόδοση κατάταξης, αλλά ότι η αύξηση των υπο-λέξεων σε μέγιστο πέντε στην πραγματικότητα κατέβαλε την ακρίβεια κατάταξης.

Το Σύνολο Δεδομένων

Οι ερευνητές εξήγαγαν ένα σύνολο δεδομένων 300 εκατομμυρίων ποστ του Reddit από το σύνολο δεδομένων Pushshift Reddit Corpus του 2020, που ονομάζεται Σύνολο Δεδομένων Εκατομμυρίου Χρηστών (MUD).

Το σύνολο δεδομένων αποτελείται από όλα τα ποστ από συγγραφείς του Reddit που δημοσίευσαν 100-1000 ποστ μεταξύ Ιουλίου 2015 και Ιουνίου 2016. Η δειγματοληψία με τον καιρό παρέχει επαρκή ιστορικό μήκος για τη μελέτη, και μειώνει την επίδραση των σποραδικών ποστ που δεν είναι εντός του πεδίου της έρευνας.

Στατιστικά στοιχεία για το παραγόμενο σύνολο δεδομένων για το έργο αναγνώρισης του Τζονς Χόπκινς.

Στατιστικά στοιχεία για το παραγόμενο σύνολο δεδομένων για το έργο αναγνώρισης του Τζονς Χόπκινς.

Αποτελέσματα

Η εικόνα παρακάτω δείχνει τη συσσώρευση βελτίωσης των αποτελεσμάτων καθώς η ακρίβεια κατάταξης δοκιμάζεται σε διαστήματα μιας ώρας κατά την εκπαίδευση. Μετά από έξι ώρες, το σύστημα υπερβαίνει τις βασικές επιτεύξεις των σχετικών προηγούμενων πρωτοβουλιών.

Σε μια μελέτη αφαίρεσης, οι ερευνητές βρήκαν ότι η αφαίρεση του χαρακτηριστικού sub-Reddit από τη ροή εργασίας είχε εκπληκτικά μικρή επίδραση στην ακρίβεια κατάταξης, υποδεικνύοντας ότι το σύστημα γενικεύει πολύ αποτελεσματικά, με ισχυρή εργαλειοθήκη χαρακτηριστικών.

Συχνότητα Δημοσίευσης ως Υπογραφή Αναγνώρισης

Αυτό επίσης υποδηλώνει ότι το πλαίσιο είναι高度 μεταφερόμενο σε άλλα συστήματα σχολιασμού ή δημοσίευσης όπου μόνο το περιεχόμενο κειμένου και η ημερομηνία/ώρα δημοσίευσης είναι διαθέσιμα – και ότι η χρονική συχνότητα δημοσίευσης είναι από μόνη της mộtτιμηρή υπογραφή για το πραγματικό περιεχόμενο κειμένου.

Οι ερευνητές σημειώνουν ότι η προσπάθεια να thựcουν την ίδια εκτίμηση εντός του περιεχομένου ενός seul sub-Reddit θέτει μια μεγαλύτερη πρόκληση,既然 το sub-Reddit自身 служει ως proxy θέματος, και ένα πρόσθετο σχήμα θα ήταν απαραίτητο για να καλύψει αυτό το ρόλο.

Η μελέτη ήταν ωστόσο σε θέση να επιτύχει υποσχόμενες αποτελέσματα εντός αυτών των περιορισμών, με την einzige επιφύλαξη ότι το σύστημα λειτουργεί καλύτερα σε υψηλές ποσότητες, και μπορεί να έχει αυξημένη δυσκολία στην αναγνώριση χρηστών όπου η ποσότητα ποστ είναι χαμηλή.

Ανάπτυξη του Έργου

Σε αντίθεση με πολλές πρωτοβουλίες εκπαίδευσης με επίβλεψη, τα χαρακτηριστικά στο σχήμα αναγνώρισης του Χόπκινς είναι διακριτά και αρκετά robust ώστε η απόδοση του συστήματος να βελτιώνεται σημαντικά καθώς η ποσότητα δεδομένων αυξάνεται.

Οι ερευνητές εκφράζουν ενδιαφέρον για την ανάπτυξη του συστήματος υιοθετώντας μια πιο λεπτομερή προσέγγιση για την ανάλυση των χρόνων δημοσίευσης,既然 οι συχνές προγραμματισμένες ώρες των spammers (αυτοματοποιημένων ή άλλων) είναι ευάλωτες στην αναγνώριση από μια τέτοια προσέγγιση, και αυτό θα έκανε δυνατή την πιο αποτελεσματική εξάλειψη του ρομποτικού περιεχομένου από μια μελέτη που στοχεύει κυρίως σε ενοχλητικούς χρήστες, ή να βοηθήσει στην αναγνώριση του αυτοματοποιημένου περιεχομένου.

on times, since the often predictable schedules of rote spammers (automated or otherwise) are susceptible to identification by such an approach, and this would make it possible to either more effectively eliminate robot content from a study primarily aimed at vexatious users, or to aid in identifying automated content.

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]