Andersons hoek

Het identificeren van Instagram Crowdturfers met Machine Learning

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Onderzoekers in Italië en Iran claimen de eerste machine learning-systeem te hebben ontwikkeld die ‘crowdturfing’-activiteiten van menselijke (in plaats van geautomatiseerde) influencer-accounts op het Instagram-platform kan herkennen. Crowdturfers zijn echte mensen die ‘profielopbouw’-diensten uitvoeren voor platforms die dergelijke activiteiten op grote schaal verkopen.

De nieuwe methode claimt een nauwkeurigheidscore van ongeveer 95% en maakt gebruik van semi-ge-superviseerd leren in Natural Language Processing (NLP)-systemen.

De auteurs claimen dat, voor zover zij weten, hun systeem het eerste crowdturfing (CT)-detectiesysteem is dat betrouwbaar kan focussen op non-bot-accounts die betrokken zijn bij nep, betaalde profielengagement en -boosting.

Om dit te bereiken, kochten de auteurs 1293 crowdturfing-profielen van 11 CT-platformaanbieders om gegevens te verzamelen voor het trainen van hun CT-detector. Aangezien Instagram een aantal effectieve anti-botmaatregelen heeft, merken de onderzoekers op dat degene die het platform willen exploiteren voor commerciële doeleinden, zijn overgestapt op het betalen van echte invloedrijke Instagrammers om ‘strategisch’ te ‘engageren’ met ‘klant’-accounts, meestal door comments te delen of door activiteiten gerelateerd aan comments op berichten.

Nadat het model was getraind, lieten de auteurs het los om de engagement-profielen van 20 ‘mega-influencers’ te analyseren, elk met meer dan 1 miljoen volgers, en concludeerden dat ‘meer dan 20% van hun engagement kunstmatig was’.

Het artikel heet Zijn we allemaal in een Truman Show? Crowdturfing op Instagram herkennen door middel van zelftrainen en komt van vijf onderzoekers van de Universiteit van Padova in Italië en de Imam Reza Universiteit in Iran.

Het schenden van de Instagram-gebruiksvoorwaarden

In tegenstelling tot Twitter, dat door onderzoekers wordt gebruikt vanwege zijn toewijding aan het ondersteunen van onderzoek, biedt Instagram niet alleen geen API of geactualiseerde datapakketten om onderzoekers te helpen, maar verbiedt het ook machine-gestuurde browsen in zijn gebruiksvoorwaarden. Daarom was de eerste taak van de onderzoekers om een ontheffing te krijgen van hun Institutionele Review Board, gerechtvaardigd door eerder werk dat een soortgelijke aanpak gebruikte om ‘ondergrondse activiteiten’ te onderzoeken.

De crowdturfing-diensten werden gekocht voor verse Instagram-accounts die door de onderzoekers waren gemaakt voor hun doeleinden, allemaal werden verwijderd na het experiment, waardoor de betrokkenheid van ‘legitieme’ gebruikers werd uitgesloten. De influencer-accounts die werden onderzocht en de CT-platformdiensten worden niet genoemd.

Een andere ethische hindernis was dat de onderzoekers geen toestemming konden vragen van de influencers die werden onderzocht, vanwege de Hawthorne-effect (d.w.z. het zou het gedrag van de influencers hebben veranderd), en deze ontheffing werd ook door de IRB verleend.

Ten slotte, aangezien Instagram ‘handmatige verzameling’ van gegevens toestaat, vonden de onderzoekers een compromis door hun geautomatiseerde webscraping-tools in te stellen op ‘menselijke snelheid’, wat een gegevensverzamelingsfase van vijf maanden noodzakelijk maakte.

Mensen te koop

De onderzoekers kochten 100 ‘nep-volgers’-profielen van elk van de 11 (anonieme) aanbieders.

Het artikel vermeldt*:

‘Alle aanbieders die wij hebben geselecteerd, garanderen dat ze volgers leveren die interactie hebben met de doelprofielen door hun berichten te liken en te commentaren om hun engagementpercentage te verhogen.

‘Deze CT-profielen worden geïdentificeerd als hoge kwaliteit volgers en kosten meestal meer dan “basis”-nep-profielen. De betrouwbaarheid van deze aanbieders wordt ondersteund door bekende [review]platforms zoals TrustPilot.’

Uit het artikel, statistieken over de (anonieme) CT-platformaanbieders, elk een marktplaats voor 'gecorrumpeerde' echte influencer-accounts. Deze tabel toont informatie die door de aanbieders is gerapporteerd en door de onderzoekers is verkregen door de analyse van de 100 profielen die van elke bron zijn gekocht. Bron: https://arxiv.org/pdf/2206.12904.pdf

Uit het artikel, statistieken over de (anonieme) CT-platformaanbieders, elk een marktplaats voor ‘gecorrumpeerde’ echte influencer-accounts. Bron: https://arxiv.org/pdf/2206.12904.pdf

De gemiddelde kosten van het kopen van een Instagram-influencer, merken de auteurs op, zijn niet zo hoog, ongeveer $3 voor 100 ‘hoge kwaliteit’ volgers. De auteurs merken op:

‘De meeste aanbieders leveren de volgers binnen een paar uur. Ze bieden een bescherming tegen verlies, wat betekent dat het aantal volgers dat de klant koopt, stabiel blijft in de loop van de tijd of dat nieuwe volgers worden geleverd om de verloren volgers aan te vullen.’

De onderzoekers melden dat sommige van hun verse Instagram-accounts een verlies van 15-20% van CT-volgers na een maand leden, maar dat in bepaalde gevallen ze meer verwachtten. Voor de duurste CT-aanbieder (CT-10, in de bovenstaande tabel) gingen slechts drie volgers verloren na een maand.

Het artikel merkt op dat de verhouding tussen gevolgd en volgers meer ‘authentiek’ wordt naarmate u meer betaalt aan de CT-aanbieder, met de op een na duurste aanbieder die een verhouding biedt die zeer dicht bij de baseline van een standaardgebruiker ligt.

Een kenmerk van een CT-Instagram-account is dat het profiel zelden op ‘privé’ wordt ingesteld (een feit dat het mogelijk maakte om gegevens te verzamelen van de gekochte nep-volgers, aangezien de meeste analyses waren gericht op profielen en gerelateerde comments), hoewel dit niet moet worden gezien als een betrouwbaar ‘signaal’ in dit opzicht.

‘Mensen die zich aansluiten bij deze platforms zijn geïnteresseerd in het genereren van een minimumaantal berichten dat hen betrouwbaar maakt, behalve in enkele gevallen (CT-4, CT-10). De lage kwaliteit profielen laten een zeer hoge onbalans zien in volgers en volgers, en het gemiddelde aantal berichten is dicht bij 0, ver onder de CT-profielen.’

Gegevens

De onderzoekers verzamelden gegevens door middel van een implementatie van het browser-automatiseringsframework Selenium. De resulterende dataset bevat profielinformatie van 1293 CT- en 1307 non-CT-gebruikers.

Deze toegestane hoeveelheid monsters maakte het mogelijk om Selenium in te stellen op een menselijke snelheid over een redelijke periode. Bovendien merken de auteurs op dat de representatieve/interpretatieve kracht van semi-ge-superviseerde leertechnieken kleine datasets zeer goed aankan. Na te hebben geëxperimenteerd, voor de doeleinden van grondigheid, met een volledig-gesuperviseerd model, concluderen de onderzoekers:

‘[De] resultaten in de semi-ge-superviseerde modus verschillen niet significant van die in een gesuperviseerde manier. Dit suggereert dat CT-profielen zeer vergelijkbare [kenmerken] delen, en dat het algoritme kan convergeren [met een kleine hoeveelheid] gelabelde gegevens.’

De auteurs verzamelden alle beschikbare gegevens uit de broncode van de ‘gecompromitteerde’ gebruikersprofielpagina’s, inclusief details die normaal gesproken worden verborgen wanneer ze worden weergegeven, zoals het #videos-element.

Zij verwerkten vervolgens de gegevenskenmerken door die met nul of lage variantie te verwijderen en ten slotte alle categorische of niet-numerieke gegevens om te zetten in strikt numerieke of boolean-kenmerken.

Kenmerken van de definitieve dataset.

Kenmerken van de definitieve dataset.

Methode en Verkenningen

Naast Selenium, werden de volgende technologieën gebruikt in de experimenten: een versie van SpaCy geïmplementeerd met een transformer-gebaseerde pijplijn; een scikit learn self-training classifier; en het Instaloader-framework.

Er is geen gebruikelijke ‘resultaten’-sectie in het nieuwe artikel, omdat het gaat over een doel (d.w.z. geautomatiseerde inferentie van corrupte Instagram-accounts) dat afwijkt van het centrale interessegebied tot nu toe (d.w.z. geautomatiseerde inferentie van geautomatiseerde bot-activiteit op Instagram), wat betekent dat er geen vergelijkbaar eerder werk is om het mee te vergelijken.

De onderzoekers pasten een breed scala aan methoden toe op de beschikbare gekochte gebruikers, (die zij comfortabel beschrijven als ‘nep’ in plaats van alleen ‘non-CT’, omdat deze echte accounts niet-organische, betaalde engagement-activiteiten uitvoeren), over een reeks NLP-gerelateerde technologieën.

Onder de bestudeerde facetten waren taalanalyse (die in de CT-wereld bijna altijd standaard Engels is, hoewel CT-platforms ook geo-gelegen niet-Engelstalige volgers aanbieden); commentaartellingen (waarbij nep-gebruikers zeer dicht bij de frequentie van echte gebruikers blijven, uit angst voor detectie); en analyse van veel voorkomende woorden:

Woordwolken van nep- en echte gebruikers.

Woordwolken van nep- en echte gebruikers.

Het artikel merkt op dat de prevalentie van het woord ‘dokter’ (zie bovenstaande afbeelding) in nep-accounts lijkt te worden gerelateerd aan een specifieke interne campagne:

‘“Dokter” [verscheen] in 1069 verschillende comments. Door verder onderzoek naar de accounts die dit woord spammen, vonden we een klein deel van wat lijkt op een botnet dat als doel heeft om “Instagram-dokters”-accounts te spammen. Alle profielen van deze dokters hebben een WhatsApp-zakelijke link die, zodra deze wordt aangeklikt, een chat start met een bericht om te voltooien.’

Zo ver de onderzoekers kunnen afleiden, kan dit vreemde artifact een overblijfsel zijn van een groot botnet dat zij tegenkwamen bij het zoeken naar activiteiten van echte Instagram-gebruikers.

In totaal verzamelden de onderzoekers 603.007 comments van berichten over 248.388 unieke Instagram-gebruikers, waarvan de auteurs schatten dat 55.719 crowdturfing-accounts waren.

Het artikel merkt met interesse op dat de dominantie van vrouwelijke thema’s in de verzamelde gegevens. Na het gebruik van GPU-PDMM (een techniek ontwikkeld voor de verplichte korte berichten op Twitter) om 12.830 geschikte comments te extraheren uit een beschikbare corpus van 121.822 comments, vond het algoritme dat, bij het overwegen van inhoud van 12 mannen en 8 vrouwen, de meeste comments te maken hadden met vrouwelijke onderwerpen.

De top 10 onderwerpen die zijn geëxtraheerd uit nep-comments in een van de experimenten van de onderzoekers.

De top 10 onderwerpen die zijn geëxtraheerd uit nep-comments in een van de experimenten van de onderzoekers.

De onderzoekers concluderen:

‘[Terwijl] Instagram en de onderzoekscommunity zich veel hebben gericht op het detecteren van bots en geautomatiseerde accounts, geloven wij dat meer studies moeten worden uitgevoerd naar CT-activiteiten, die een negatieve invloed hebben op influencer marketing, het Instagram-platform en de meeste van zijn gebruikers.’

 

* Onderzoekers’ geciteerde TrustPilot-URL weggelaten.

Origineel gepubliceerd op 28 juni 2022.

Schrijver over machine learning, domeinspecialist in humane beeldsynthese. Voormalig hoofd van onderzoeksinhoud bij Metaphysic.ai, tot de opheffing ervan in DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai