Η γωνία του Anderson

Αναγνώριση Crowdturfers στο Instagram με τη χρήση Μηχανικής Μάθησης

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Ερευνητές στην Ιταλία και το Ιράν ισχυρίζονται ότι έχουν δημιουργήσει το πρώτο σύστημα μηχανικής μάθησης που μπορεί να αναγνωρίσει τη δραστηριότητα “crowdturfing” (δηλαδή ανθρώπων που thực hiện πληρωμένες υπηρεσίες προφίλ) σε λογαριασμούς επηκόους στο Instagram. Οι crowdturfers είναι πραγματικοί άνθρωποι που παρέχουν υπηρεσίες “δημιουργίας προφίλ” σε πλατφόρμες που πωλούν τέτοιες δραστηριότητες μελών.

Η νέα μέθοδος ισχυρίζεται ότι έχει ποσοστό ακρίβειας γύρω στο 95% και χρησιμοποιεί ημι-εποπτευόμενη μάθηση σε συστήματα Επεξεργασίας Φυσικής Γλώσσας (NLP).

Οι συγγραφείς ισχυρίζονται ότι, σύμφωνα με τις γνώσεις τους, το σύστημά τους αντιπροσωπεύει το πρώτο σύστημα ανίχνευσης crowdturfing (CT) που μπορεί να αναγνωρίσει με αξιοπιστία μη-ρομποτικών λογαριασμών που συμμετέχουν σε ψευδή, πληρωμένη αύξηση προφίλ και ενεργειών.

Για να το επιτύχουν, οι συγγραφείς αγόρασαν 1293 προφίλ crowdturfing από 11 παρόχους CT, για να λάβουν δεδομένα για την εκπαίδευση του ανιχνευτή CT.既然 το Instagram έχει αποτελεσματικά μέτρα κατά των bot, οι ερευνητές σημειώνουν ότι εκείνοι που επιδιώκουν να εκμεταλλευτούν τη μεγάλη βάση χρηστών της πλατφόρμας για εμπορικούς σκοπούς έχουν στραφεί στην πληρωμή πραγματικών επηκόων του Instagram για να “συμμετάσχουν στρατηγικά” με “πελάτες” λογαριασμούς, κυρίως με το σχολιασμό ή μέσω δραστηριοτήτων σχετικών με σχόλια σε αναρτήσεις.

Μετά την εκπαίδευση του μοντέλου, οι συγγραφείς το άφησαν να αναλύσει τα προφίλ ενεργειών 20 “μεγα-επηκόων”, κάθε ένας με πάνω από 1 εκατομμύριο ακολουθούς, και κατέληξαν στο συμπέρασμα ότι “περισσότερο από το 20% της συμμετοχής τους ήταν τεχνητό”.

Το έγγραφο έχει τον τίτλο Είμαστε Όλοι σε Ένα Truman Show; Αναγνώριση Crowdturfing στο Instagram μέσω Αυτο-Εκπαίδευσης, και προέρχεται από πέντε ερευνητές από το Πανεπιστήμιο του Πάντοβα στην Ιταλία και το Πανεπιστήμιο Ιμάν Ρέζα στο Ιράν.

Παράβαση των Όρων Χρήσης του Instagram

Σε αντίθεση με το Twitter, που προτιμάται από ερευνητές του κοινωνικού μέσου λόγω της δέσμευσης του να βοηθήσει την έρευνα, το Instagram δεν παρέχει κανένα API ή ενημερωμένα δεδομένα για να βοηθήσει τους ερευνητές, αλλά απαγορεύει την μηχανική περιήγηση στις Όρους Χρήσης.,因此, η πρώτη εργασία των ερευνητών ήταν να λάβουν μια εξαίρεση από το Institutional Review Board, που δικαιολογείται από προηγούμενες εργασίες που χρησιμοποίησαν μια παρόμοια προσέγγιση για να ερευνήσουν “υπόγειες δραστηριότητες”.

Οι υπηρεσίες crowdturfing αγοράστηκαν για νέους λογαριασμούς Instagram που δημιουργήθηκαν από τους ερευνητές για τους σκοπούς τους, οι οποίοι διαγράφηκαν μετά το πείραμα, αποφεύγοντας την εμπλοκή “legtimitous” χρηστών. Οι λογαριασμοί επηκόων που μελετήθηκαν και οι υπηρεσίες CT δεν ονομάζονται.

Ένα άλλο ηθικό εμπόδιο ήταν ότι οι ερευνητές δεν μπορούσαν να ζητήσουν τη συναίνεση των επηκόων που μελετήθηκαν, λόγω του Εφέ Hawtorne (δηλαδή, μπορεί να άλλαξε τη συμπεριφορά των επηκόων), και αυτή η εξαίρεση χορηγήθηκε επίσης από το IRB.

Τέλος,既然 το Instagram επιτρέπει τη “χειροκίνητη συλλογή” δεδομένων, οι ερευνητές συμβιβάστηκαν με την παραβίαση των Όρων Χρήσης, ρυθμίζοντας τα αυτόματα εργαλεία σκραπινγκ σε “ανθρώπινη ταχύτητα”, που απαιτούσε μια φάση συλλογής δεδομένων πέντε μηνών.

Άνθρωποι προς Πώληση

Οι ερευνητές αγόρασαν 100 “ψευδείς ακολουθούς” προφίλ από κάθε einen από τους 11 (ανώνυμους) παρόχους.

Το έγγραφο αναφέρει*:

‘Όλοι οι παρόχοι που επιλέξαμε διαβεβαιώνουν ότι θα παραδώσουν ακολουθούς που θα αλληλεπιδράσουν με τα στοχευμένα προφίλ, likings και σχολιάζοντας τις αναρτήσεις τους για να αυξήσουν το ποσοστό συμμετοχής τους.

‘Αυτά τα προφίλ CT αναγνωρίζονται ως υψηλής ποιότητας ακολουθοι και συνήθως κοστίζουν περισσότερο από τα “βασικά” ψευδείς προφίλ. Η αξιοπιστία αυτών των παρόχων υποστηρίζεται από φημισμένα [review] πλατφόρμες όπως το TrustPilot.’

Από το έγγραφο, στατιστικά στοιχεία για τους (ανώνυμους) παρόχους CT, κάθε ένας από τους οποίους είναι μια αγορά για 'διεφθαρμένα' πραγματικά προφίλ επηκόων. Αυτό το πίνακα περιλαμβάνει πληροφορίες που αναφέρθηκαν από τους παρόχους και ανακτήθηκαν από τους ερευνητές μέσω της ανάλυσης των 100 προφίλ που αγοράστηκαν από κάθε πηγή. Πηγή: https://arxiv.org/pdf/2206.12904.pdf

Από το έγγραφο, στατιστικά στοιχεία για τους (ανώνυμους) παρόχους CT, κάθε ένας από τους οποίους είναι μια αγορά για ‘διεφθαρμένα’ πραγματικά προφίλ επηκόων. Αυτό το πίνακα περιλαμβάνει πληροφορίες που αναφέρθηκαν από τους παρόχους και ανακτήθηκαν από τους ερευνητές μέσω της ανάλυσης των 100 προφίλ που αγοράστηκαν από κάθε πηγή. Πηγή: https://arxiv.org/pdf/2206.12904.pdf

Ο μέσος όρος κόστους για την αγορά ενός επηκόου στο Instagram, αναφέρει το έγγραφο, δεν είναι τόσο υψηλός, περίπου 3 δολάρια για 100 “υψηλής ποιότητας” ακολουθούς. Οι συγγραφείς σημειώνουν:

‘Οι περισσότεροι παρόχοι παραδίδουν τους ακολουθούς μέσα σε λίγες ώρες. Προσφέρουν προστασία πτώσης, που σημαίνει ότι ο αριθμός των ακολουθών που αγοράζει ο πελάτης θα παραμείνει σταθερός με το χρόνο ή νέοι ακολουθοι θα παραδοθούν για να αντικαταστήσουν τους χαμένους.’

Οι ερευνητές αναφέρουν ότι κάποιοι από τους νέους λογαριασμούς Instagram τους υπέφεραν από απώλεια 15-20% των ακολουθών CT μετά από einen μήνα, αλλά σε ορισμένες περιπτώσεις κέρδισαν περισσότερους από ότι αναμενόταν. Για τον πιο ακριβό παρόχο CT (CT-10, στον πίνακα παραπάνω), μόνο τρεις ακολουθοι χάθηκαν μετά από einen μήνα.

Το έγγραφο σημειώνει ότι η αναλογία ακολουθών/ακολουθουμένων γίνεται πιο “αυθεντική” όσο πληρώνετε περισσότερα στο παρόχο CT, με τον δεύτερο πιο ακριβό παρόχο να προσφέρει μια αναλογία που είναι πολύ κοντά στη βασική γραμμή ενός τυπικού χρήστη.

Ένα χαρακτηριστικό ενός λογαριασμού CT στο Instagram είναι ότι το προφίλ του σπάνια ορίζεται ως “ιδιωτικό” (ένα fatto που επέτρεψε τη συλλογή δεδομένων από τους αγορασμένους ψευδείς ακολουθούς,既然 η większość των αναλύσεων επικεντρώθηκε σε προφίλ και σχετικά σχόλια), αν και αυτό δεν πρέπει να θεωρείται ως ένα αξιόπιστο “σημάδι” σε αυτήν την περίπτωση.

‘Οι άνθρωποι που συμμετέχουν σε αυτές τις πλατφόρμες ενδιαφέρονται για τη δημιουργία ενός ελάχιστου αριθμού αναρτήσεων που τους κάνουν αξιόπιστους, εκτός από λίγες περιπτώσεις (CT-4, CT-10). Τα προφίλ χαμηλής ποιότητας εμφανίζουν μια πολύ υψηλή ανισορροπία σε ακολουθούς και ακολουθουμένους, και ο μέσος όρος αριθμός αναρτήσεων είναι κοντά στο 0, πολύ χαμηλότερα από τα προφίλ CT.’

Δεδομένα

Οι ερευνητές συλλέγουν δεδομένα μέσω μιας εφαρμογής του framework Selenium. Το αποτέλεσμα του συνόλου δεδομένων περιλαμβάνει πληροφορίες προφίλ από 1293 CT και 1307 μη-CT χρήστες.

Αυτό το σχετικά χαμηλό ποσοστό δείγματος έκανε δυνατή τη ρύθμιση του Selenium σε μια πιστευτή “ανθρώπινη ταχύτητα” σε ένα λογικό χρονικό διάστημα. Επιπλέον, οι συγγραφείς σημειώνουν ότι η αναπαραστατική/ερμηνευτική δύναμη των ημι-εποπτευόμενων τεχνικών μάθησης προσφέρει μια καλή προσαρμογή σε μικρότερα συνόλα δεδομένων. Έχοντας πειραματιστεί, για τους σκοπούς της πληρότητας, με ένα πλήρως εποπτευόμενο μοντέλο, οι ερευνητές καταλήγουν στο συμπέρασμα:

‘[Τα] αποτελέσματα στη ημι-εποπτευόμενη λειτουργία δεν διαφέρουν σημαντικά από αυτά στη λειτουργία εποπτευόμενη. Αυτό υποδηλώνει ότι τα προφίλ CT μοιράζονται πολύ παρόμοια [χαρακτηριστικά], και ότι ο αλγόριθμος μπορεί να συγκλίνει [μέσω ενός μικρού αριθμού] επισημασμένων δεδομένων.’

Οι συγγραφείς συνέλεξαν όλα τα διαθέσιμα δεδομένα από τον κώδικα πηγής των “επηρεασμένων” χρηστών, συμπεριλαμβανομένων λεπτομερειών που συνήθως δεν φαίνονται όταν αποδίδονται, όπως το στοιχείο #βίντεο.

Στη συνέχεια, προ-επεξεργάστηκαν τα χαρακτηριστικά των δεδομένων, αφαιρώντας αυτά με μηδενική ή χαμηλή διακύμανση, και τελικά μετέτρεψαν οποιαδήποτε κατηγορική ή μη-αριθμητική δεδομένα σε στενά αριθμητικά ή boolean χαρακτηριστικά.

Χαρακτηριστικά του τελικού συνόλου δεδομένων.

Χαρακτηριστικά του τελικού συνόλου δεδομένων.

Μέθοδος και Ερευνες

Εκτός από το Selenium, οι τεχνολογίες που χρησιμοποιήθηκαν σε αυτά τα πειράματα περιλαμβάνουν: μια έκδοση του SpaCy που έχει υλοποιηθεί με μια pipeline μετασχηματιστή; einen αλγόριθμο self-training της scikit learn; και το framework Instaloader.

Δεν υπάρχει το τυπικό “αποτελέσματα” τμήμα στο νέο έγγραφο,既然 αυτό αντιμετωπίζει ένα αντικείμενο (δηλαδή, αυτόματη ανίχνευση διεφθαρμένων λογαριασμών Instagram) που απομακρύνεται από το κεντρικό σημείο ενδιαφέροντος μέχρι τώρα (δηλαδή, αυτόματη ανίχνευση αυτοματοποιημένων bot δραστηριοτήτων στο Instagram), που σημαίνει ότι δεν υπάρχει καμία προηγούμενη εργασία για να τη συγκρίνουμε.

Οι ερευνητές υιοθέτησαν eine ευρεία γκάμα μεθόδων για τους διαθέσιμους χρήστες, (οι οποίοι νιώθουν άνετα να περιγράψουν ως “ψευδείς” αντί για απλά “μη-CT”,既然 αυτοί οι πραγματικοί λογαριασμοί διεξάγουν μη-οργανικές, πληρωμένες δραστηριότητες), σε μια σειρά από NLP-σχετικές τεχνολογίες.

Μεταξύ των μελετημένων πτυχών ήταν η ανάλυση γλώσσας (η οποία, στον κόσμο του CT, σχεδόν πάντα προεπιλέγει την αγγλική, αν και οι πλατφόρμες CT προσφέρουν γεωτοποθετημένους μη-αγγλικούς ακολουθούς επίσης); η ανάλυση αριθμού σχολίων (όπου οι ψευδείς χρήστες παραμένουν πολύ κοντά στη συχνότητα των πραγματικών χρηστών, για φόβο ανίχνευσης); και η ανάλυση κοινού λόγου:

Σύννεφα λέξεων από ψευδείς και πραγματικούς χρήστες.

Σύννεφα λέξεων από ψευδείς και πραγματικούς χρήστες.

Το έγγραφο σημειώνει ότι η κυριαρχία της λέξης “dokter” (βλέπε εικόνα παραπάνω) σε ψευδείς λογαριασμούς φαίνεται να σχετίζεται με μια συγκεκριμένη εσωτερική εκστρατεία:

‘“Dokter” [εμφανίστηκε] σε 1069 διαφορετικά σχόλια. Με τη διεξαγωγή μιας περαιτέρω έρευνας για τους λογαριασμούς που σπαμάνε [αυτή] τη λέξη, βρήκαμε ένα μικρό μέρος του τι φαίνεται να είναι ένα botnet που έχει ως στόχο να σπαμάρει “Ιατροί του Instagram” λογαριασμούς. Όλοι αυτοί οι γιατροί έχουν ένα σύνδεσμο WhatsApp που, όταν κάνετε κλικ, αρχίζει μια συνομιλία με ένα μήνυμα για ολοκλήρωση.’

Όσο μπορεί να υποστηριχθεί από τους ερευνητές, αυτό το περίεργο артеφакτ μπορεί να είναι ένα κατάλοιπο ενός μεγάλου botnet που βρήκαν κατά τη διάρκεια της αναζήτησης δραστηριοτήτων από πραγματικούς χρήστες του Instagram.

Συνολικά, οι ερευνητές συνέλεξαν 603.007 σχόλια από αναρτήσεις σε 248.388 μοναδικούς χρήστες του Instagram, από τους οποίους, οι συγγραφείς εκτιμούν, 55.719 ήταν crowdturfing λογαριασμοί.

Το έγγραφο σημειώνει με ενδιαφέρον την κυριαρχία θεμάτων με θέμα τη γυναίκα στα συλλεγμένα δεδομένα. Χρησιμοποιώντας GPU-PDMM (μια τεχνική που αναπτύχθηκε για τους υποχρεωτικά σύντομους αναρτήσεις στο Twitter) για να εξαγάγει 12.830 κατάλληλα σχόλια από ένα διαθέσιμο σώμα 121.822 σχολίων, ο αλγόριθμος βρήκε ότι, όταν εξετάζονται περιεχόμενα από 12 άνδρες και 8 γυναίκες, η πλειοψηφία των σχολίων ασχολείται με θέματα που σχετίζονται με γυναίκες.

Τα top 10 θέματα που εξήχθησαν από ψευδείς σχόλια σε ένα από τα πειράματα των ερευνητών.

Τα top 10 θέματα που εξήχθησαν από ψευδείς σχόλια σε ένα από τα πειράματα των ερευνητών.

Οι ερευνητές καταλήγουν στο συμπέρασμα:

‘[Ενώ] το Instagram και η ερευνητική κοινότητα εστίασαν πολύ στην ανίχνευση bot και αυτοματοποιημένων λογαριασμών, πιστεύουμε ότι πρέπει να διεξαχθούν περισσότερες μελέτες για τις δραστηριότητες CT, οι οποίες επηρεάζουν αρνητικά την influencer marketing, την πλατφόρμα του Instagram και τους περισσότερους από τους χρήστες της.’

 

* Οι ερευνητές αναφέρουν το URL του TrustPilot.

Πρώτη δημοσίευση 28ης Ιουνίου 2022.

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai