Andersons Blickwinkel
Identifizierung von Instagram-Crowdturfern mit Machine Learning

Forscher in Italien und im Iran behaupten, das erste Machine-Learning-System entwickelt zu haben, das in der Lage ist, die “Crowdturfing”-Aktivitäten von menschlichen (nicht automatisierten) Influencer-Konten auf der Instagram-Plattform zu erkennen. Crowdturfer sind echte Menschen, die “Profil-Building”-Dienste für Plattformen anbieten, die solche Aktivitäten im Großhandel verkaufen.
Die neue Methode beansprucht eine Genauigkeit von etwa 95% und verwendet semi-überwachtes Lernen in Natural Language Processing (NLP)-Systemen.
Die Autoren behaupten, dass ihr System, soweit sie wissen, das erste Crowdturfing-(CT)-Detektorsystem darstellt, das zuverlässig auf nicht-automatisierte Konten abzielen kann, die an gefälschter, bezahlter Profil-Engagement und -Boosting beteiligt sind.
Um dies zu erreichen, kauften die Autoren 1293 Crowdturfing-Profile von 11 CT-Plattform-Anbietern, um Daten zu sammeln, um ihren CT-Detektor zu trainieren. Da Instagram eine Reihe von effektiven Anti-Bot-Maßnahmen hat, bemerken die Forscher, dass diejenigen, die die Plattform für kommerzielle Zwecke ausnutzen wollen, zu bezahlten Influencern übergegangen sind, um “strategisch” mit “Kunden”-Konten zu interagieren, meist durch Kommentare oder Aktivitäten im Zusammenhang mit Kommentaren auf Beiträgen.
Nachdem sie das Modell trainiert hatten, ließen die Autoren es los, um die Engagement-Profile von 20 “Mega-Influencern” zu analysieren, von denen jeder über 1 Million Follower verfügte, und kamen zu dem Schluss, dass “mehr als 20% ihrer Engagement künstlich waren”.
Die Studie trägt den Titel Sind wir alle in einer Truman-Show? Crowdturfing auf Instagram durch Selbst-Training und stammt von fünf Forschern der Universität Padova in Italien und der Imam-Reza-Universität im Iran.
Verstoß gegen die Instagram-Nutzungsbedingungen
Im Gegensatz zu Twitter, das von Sozialmedien-Forschern aufgrund seiner Bereitschaft, Forschung zu unterstützen, bevorzugt wird, bietet Instagram keine API oder aktualisierte Datenmengen, um Forschern zu helfen, und verbietet maschinengetriebenes Browsen in seinen Nutzungsbedingungen. Daher war die erste Aufgabe der Forscher, eine Ausnahme von ihrem Leitfaden für die Institutional Review Board zu erhalten, die durch vorherige Arbeiten gerechtfertigt wurde, die einen ähnlichen Ansatz zur Untersuchung von “Underground-Aktivitäten” verwendet haben.
Die Crowdturfing-Dienste wurden für frische Instagram-Konten gekauft, die von den Forschern für ihre Zwecke erstellt wurden, und alle wurden nach dem Experiment gelöscht, was die Beteiligung von “legitimen” Benutzern ausschloss. Weder die Influencer-Konten, die untersucht wurden, noch die CT-Plattform-Dienste werden namentlich genannt.
Ein weiteres ethisches Hindernis war, dass die Forscher nicht um die Zustimmung der Influencer bitten konnten, die sie untersuchten, aufgrund des Hawthorne-Effekts (d. h. es könnte das Verhalten der Influencer verändert haben), und diese Ausnahme wurde auch von der IRB gewährt.
Schließlich erlaubt Instagram “manuelle Datenerfassung”, so dass die Forscher ihre Verletzung der Nutzungsbedingungen durch die Einstellung ihrer automatisierten Scraping-Tools auf “menschliche Geschwindigkeit” ausglich, was eine Datenerfassungsphase von fünf Monaten erforderlich machte.
Menschen zum Verkauf
Die Forscher kauften 100 “falsche Follower”-Profile von jeweils 11 (unbenannten) Anbietern.
Die Studie besagt*:
‘Alle Anbieter, die wir ausgewählt haben, garantieren, dass sie Follower liefern, die mit den Zielprofilen interagieren, indem sie ihre Beiträge liken und kommentieren, um ihre Engagement-Rate zu steigern.
‘Diese CT-Profile werden als hochwertige Follower identifiziert und kosten normalerweise mehr als “Base”-falsche Profile. Die Zuverlässigkeit dieser Anbieter wird durch berühmte [Bewertungs]-Plattformen wie TrustPilot unterstützt.’

Aus der Studie, Statistiken zu den (anonymisierten) CT-Plattform-Anbietern, jedes ein Marktplatz für ‘korrupte’ reale Influencer-Konten. Diese Tabelle enthält Informationen, die von den Anbietern gemeldet und von den Forschern durch die Analyse der 100 Profile, die von jedem Quelle gekauft wurden, ermittelt wurden. Quelle: https://arxiv.org/pdf/2206.12904.pdf
Der durchschnittliche Preis für den Kauf eines Instagram-Influencers, so die Studie, ist nicht sehr hoch, etwa 3 Dollar für 100 “hochwertige” Follower. Die Autoren bemerken:
‘Die meisten Anbieter liefern die Follower innerhalb weniger Stunden. Sie bieten einen Schutz vor Verlusten, was bedeutet, dass die Anzahl der Follower, die der Kunde kauft, entweder über die Zeit stabil bleibt oder neue Follower geliefert werden, um die verlorenen zu ersetzen.’
Die Forscher berichten, dass einige ihrer frischen Instagram-Konten nach einem Monat 15-20% der CT-Follower verloren, aber in bestimmten Fällen mehr erhielten, als erwartet. Für den teuersten CT-Anbieter (CT-10, in der Tabelle oben) gingen nur drei Follower nach einem Monat verloren.
Die Studie bemerkt, dass das Verhältnis von Followern zu Followings “authentischer” wird, je mehr man dem CT-Anbieter zahlt, wobei der zweitteuerste Anbieter ein Verhältnis bietet, das sehr nahe an dem Baseline-Wert eines Standardbenutzers liegt.
Ein Merkmal eines CT-Instagram-Kontos ist, dass sein Profil selten auf “privat” gesetzt wird (ein Fakt, der es ermöglichte, Daten von den gekauften falschen Followern zu ziehen, da die meisten Analysen auf Profilen und verwandten Kommentaren basierten), obwohl dies nicht als zuverlässiges “Signal” in dieser Hinsicht angesehen werden sollte.
‘Die Menschen, die sich diesen Plattformen anschließen, sind daran interessiert, eine Mindestanzahl von Beiträgen zu erstellen, die sie vertrauenswürdig machen, mit Ausnahme von wenigen Fällen (CT-4, CT-10). Die Profile mit niedriger Qualität zeigen eine sehr hohe Ungleichheit zwischen Followern und Followings, und die durchschnittliche Anzahl von Beiträgen liegt nahe bei 0, weit unter den CT-Profilen.’
Daten
Die Forscher sammelten Daten durch eine Implementierung des browser-automatisierenden Frameworks Selenium. Die resultierende Datensammlung enthält Profilinformationen von 1293 CT- und 1307 nicht-CT-Nutzern.
Diese offensichtlich geringe Stichprobengröße machte es möglich, Selenium auf eine glaubwürdige menschliche Geschwindigkeit über einen rationalen Zeitraum zu setzen. Zusätzlich bemerken die Autoren, dass die repräsentative/interpretative Kraft von semi-überwachten Lernverfahren kleine Datensätze sehr gut bewältigt. Nachdem sie, zum Zweck der Gründlichkeit, mit einem vollständig überwachten Modell experimentiert hatten, kommen die Forscher zu dem Schluss:
‘[Die] Ergebnisse im semi-überwachten Modus unterscheiden sich nicht wesentlich von denen im überwachten Modus. Dies deutet darauf hin, dass CT-Profile sehr ähnliche [Merkmale] teilen und dass der Algorithmus durch eine kleine Menge markierter Daten konvergieren kann.’
Die Autoren sammelten alle verfügbaren Daten aus dem Quellcode der “kompromittierten” Benutzerprofile, einschließlich Details, die normalerweise verborgen sind, wenn sie gerendert werden, wie z. B. das #videos-Element.
Sie verarbeiteten die Datenmerkmale dann, indem sie diejenigen mit Null- oder niedriger Varianz entfernten, und konvertierten schließlich alle kategorialen oder nicht-numerischen Daten in strikt numerische oder boolesche Merkmale.

Merkmale der endgültigen Datensammlung.
Methode und Explorationen
Neben Selenium umfassen die Technologien, die in den Experimenten verwendet wurden: eine Version von SpaCy, die mit einer transformer-basierten Pipeline implementiert wurde; einen scikit-learn Self-Training-Klassifikator; und das Instaloader-Framework.
Es gibt keinen herkömmlichen “Ergebnisse”-Abschnitt in der neuen Studie, da sie sich mit einem Ziel (d. h. automatisierter Inferenz von korrupten Instagram-Konten) befasst, das von dem zentralen Interessenschwerpunkt abweicht (d. h. automatisierter Inferenz von automatisierter Bot-Aktivität auf Instagram), was bedeutet, dass es keine vergleichbaren vorherigen Arbeiten gibt, mit denen man vergleichen kann.
Die Forscher verwendeten eine Vielzahl von Methoden auf den verfügbaren gekauften Benutzern (die sie sich wohl fühlen, als “falsch” zu beschreiben, anstatt nur “nicht-CT”, da diese echten Konten nicht-organische, bezahlte Engagement-Aktivitäten durchführen), über eine Reihe von NLP-bezogenen Technologien.
Unter den untersuchten Aspekten waren Sprachanalyse (die in der CT-Welt fast immer auf Englisch standardmäßig festgelegt ist, obwohl CT-Plattformen auch geo-located nicht-englische Follower anbieten); Kommentarzahlen (wo falsche Benutzer sehr nahe an der Häufigkeit von echten Benutzern bleiben, um nicht entdeckt zu werden); und gemeinsame Wörteranalyse:

Wolken von Wörtern von falschen und echten Benutzern.
Die Studie bemerkt, dass die Häufigkeit des Wortes “dokter” (siehe Bild oben) in falschen Konten mit einer bestimmten internen Kampagne zusammenhängt:
‘“Dokter” [erschien] in 1069 verschiedenen Kommentaren. Durch weitere Untersuchung der Konten, die dieses Wort spammen, fanden wir einen kleinen Teil von dem, was wie ein Botnetz aussieht, dessen Ziel es ist, “Instagram-Ärzte”-Konten zu spammen. Alle diese Ärzte-Profile haben einen WhatsApp-Geschäftslink, der, wenn er angeklickt wird, einen Chat mit einer Nachricht zum Abschließen startet.’
Soweit die Forscher feststellen können, mag dieses seltsame Artefakt ein Überbleibsel eines großen Botnetzes sein, auf das sie beim Suchen nach Aktivitäten von echten Instagram-Benutzern gestoßen sind.
Insgesamt sammelten die Forscher 603.007 Kommentare von Beiträgen über 248.388 eindeutige Instagram-Benutzer, von denen, schätzen die Autoren, 55.719 Crowdturfing-Konten waren.
Die Studie bemerkt mit Interesse die Dominanz von weiblichen Themen in den gesammelten Daten. Nachdem sie GPU-PDMM (eine Technik, die für die obligatorisch kurzen Beiträge auf Twitter entwickelt wurde) verwendet hatten, um 12.830 geeignete Kommentare aus einem verfügbaren Korpus von 121.822 Kommentaren zu extrahieren, fand der Algorithmus, dass in der Betrachtung von Inhalten von 12 Männern und 8 Frauen die Mehrheit der Kommentare mit weiblichen Themen zu tun hat.

Die Top-10-Themen, die aus falschen Kommentaren in einem der Experimente der Forscher extrahiert wurden.
Die Forscher kommen zu dem Schluss:
‘[Während] Instagram und die Forschungsgemeinschaft sich sehr auf die Erkennung von Bots und automatisierten Konten konzentriert haben, glauben wir, dass mehr Studien zu CT-Aktivitäten durchgeführt werden sollten, die sich negativ auf Influencer-Marketing, die Instagram-Plattform und die meisten ihrer Benutzer auswirken.’
* Die zitierte TrustPilot-URL der Forscher wurde weggelassen.
Erstveröffentlicht am 28. Juni 2022.












