Andersons vinkel

Identificering af Instagram Crowdturfere med Maskinlæring

mm
Føj Unite.AI til dine foretrukne kilder på Google

Forskere i Italien og Iran hævder at have formuleret det første maskinlæringsystem, der kan genkende ‘crowdturfing’-aktiviteten af menneskelige (i stedet for automatiserede) influencer-konti på Instagram-platformen. Crowdturfere er rigtige mennesker, der udfører ‘profilbygnings’-tjenester til platforme, der sælger sådan aktivitet på en engrosbasis.

Den nye metode hævder en nøjagtighed på omkring 95% og bruger semi-overvåget læring i Natural Language Processing (NLP)-systemer.

Forfatterne hævder, at så vidt de ved, repræsenterer deres system det første crowdturfing (CT)-detektionssystem, der kan pålideligt fokusere på ikke-bot-konti, der er engageret i falsk, betalt profilengagement og boosting.

For at opnå dette købte forfatterne 1293 crowdturfing-profiler fra 11 CT-platformudbydere for at få data til at træne deres CT-detektor. Da Instagram har en række effektive anti-bot-foranstaltninger på plads, bemærker forskerne, at de, der søger at udnytte platformens enorme brugerbase til kommercielle formål, er vendt til at betale rigtige influencere på Instagram for at ‘engagere strategisk’ med ‘kunde’-konti, mest ved at dele kommentarer eller gennem aktivitet relateret til kommentarer på indlæg.

Efter at have trænet modellen, satte forfatterne den fri til at analysere engagement-profilerne for 20 ‘mega-influencere’, hver med over 1 million følgere, og konkluderede, at ‘mere end 20% af deres engagement var kunstigt’.

Den artikel har titlen Er vi alle i en Truman Show? Spotting Instagram Crowdturfing gennem Selvtræning og kommer fra fem forskere på University of Padova i Italien og Imam Reza University i Iran.

Overtrædelse af Instagrams TOS

I modsætning til Twitter, der er foretrukket af sociale medieforskere på grund af dets engagement i at hjælpe forskning, giver Instagram ikke blot ingen API eller opdaterede data-dumps til at hjælpe forskere, men forbyder også maskin-drevet browsing i dets vilkår for tjenesten. Derfor var forskernes første opgave at opnå en undtagelse fra deres vejledende Institutional Review Board, berettiget af tidligere arbejde, der brugte en lignende tilgang til at undersøge ‘undergrund-aktiviteter’.

Crowdturfing-tjenesterne blev købt til friske Instagram-konti, der blev oprettet af forskerne til deres formål, og alle blev slettet efter eksperimentet, og dermed undgik det deltagelse af ‘legitime’ brugere. Ingen af influencer-konti eller CT-platformtjenesterne er navngivet.

En anden etisk hindring var, at forskerne ikke kunne anmode om samtykke fra de influencere, der blev studeret, på grund af Hawthorne-effekten (dvs. det kunne have ændret influencerens adfærd), og denne undtagelse blev også bevilget af IRB.

Til sidst, da Instagram tillader ‘manuel indsamling’ af data, kompromitterede forskerne med deres overtrædelse af TOS ved at sætte deres automatiserede scraping-værktøjer til ‘menneske-lige’ hastighed, hvilket nødvendiggjorde en dataindsamlingssæson på fem måneder.

Mennesker til salg

Forskerne købte 100 ‘falske følgere’-profiler fra hver af 11 (unavngivne) udbydere.

Artiklen siger*:

‘Alle udbyderne, vi valgte, garanterer for at levere følgere, der interagerer med målprofilerne ved at like og kommentere på deres indlæg for at øge deres engagement-rate.

‘Disse CT-profiler identificeres som højkvalitetsfølgere og koster normalt mere end “basis”-falske profiler. Pålideligheden af disse udbydere støttes af berømte [anmeldelses]platforme som TrustPilot.’

Fra artiklen, statistik over de (anonymiserede) CT-platformudbydere, hver en marked for 'korrupte' rigtige influencer-konti. Denne tabel omfatter oplysninger, der er rapporteret af udbyderne og hentet af forskerne gennem analyse af de 100 profiler, der blev købt fra hver kilde. Kilde: https://arxiv.org/pdf/2206.12904.pdf

Fra artiklen, statistik over de (anonymiserede) CT-platformudbydere, hver en marked for ‘korrupte’ rigtige influencer-konti. Denne tabel omfatter oplysninger, der er rapporteret af udbyderne og hentet af forskerne gennem analyse af de 100 profiler, der blev købt fra hver kilde. Kilde: https://arxiv.org/pdf/2206.12904.pdf

Gennemsnitsprisen for at købe en Instagram-influencer, bemærker artiklen, er ikke så høj, på omkring 3 dollar for 100 ‘højkvalitets’-følgere. Forfatterne bemærker:

‘De fleste udbydere leverer følgerne inden for få timer. De tilbyder en drop-beskyttelse, hvilket betyder, at antallet af følgere, kunden køber, enten forbliver stabilt over tid eller nye følgere leveres for at genskabe de tabte.’

Forskerne rapporterer, at nogle af deres friske Instagram-konti led en tab af 15-20% af CT-følgere efter en måned, men at i visse tilfælde fik de mere, end de havde forventet. For den dyreste CT-udbyder (CT-10 i tabellen ovenfor) blev kun tre følgere tabt efter en måned.

Artiklen bemærker, at forholdet mellem følgere og følgerne bliver mere ‘ægte’, jo mere man betaler til CT-udbyderen, med den næstdyreste udbyder, der tilbyder et forhold, der er meget tæt på en standardbrugers baseline.

En karakteristika af et CT-Instagram-konto er, at dens profil sjældent er sat til ‘privat’ (en faktum, der gjorde det muligt at hente data fra de købte falske følgere, da de fleste analyser centeredede sig om profiler og relaterede kommentarer), selvom dette ikke skal ses som en pålidelig ‘signal’ i denne henseende.

‘Mennesker, der deltager i disse platforme, er interesseret i at generere et minimum antal indlæg, der gør dem pålidelige, bortset fra få tilfælde (CT-4, CT-10). De lavkvalitetsprofiler viser en meget høj ubalance i følgere og følgerne, og gennemsnitsantallet af indlæg er tæt på 0, langt under CT-profilerne.’

Data

Forskerne indsamlede data gennem en implementering af browser-automatiseringsframeworket Selenium. Det resulterende dataset omfatter profilinformation fra 1293 CT- og 1307 ikke-CT-brugere.

Denne åbenbart lave samplesæt gjorde det muligt at sætte Selenium til en troværdig menneske-lige hastighed over en rationel periode. Derudover bemærker forfatterne, at den repræsentative/fortolkningskraft af semi-overvåget læringsteknikker kan håndtere små datasets meget godt. Efter at have eksperimenteret, for thoroughnessens skyld, med et fuldt overvåget model, konkluderer forskerne:

‘[Resultaterne] i semi-overvåget tilstand adskiller sig ikke væsentligt fra dem i en overvåget måde. Dette tyder på, at CT-profiler deler meget lignende [karakteristika], og at algoritmen kan konvergere [gennem en lille mængde] markeret data.’

Forfatterne indsamlede alle tilgængelige data fra kildekoden til de ‘kompromitterede’ brugeres profilside, herunder oplysninger, der normalt er skjult, når de vises, som #videos-elementet.

De behandlede derefter datafunktionerne ved at fjerne dem med nul eller lav variation, og omdannede til sidst enhver kategorisk eller ikke-numerisk data til strengt numerisk eller boolesk funktioner.

Karakteristika af det endelige dataset.

Karakteristika af det endelige dataset.

Metode og Undersøgelser

Ud over Selenium omfatter teknologierne, der blev brugt i eksperimenterne: en version af SpaCy implementeret med en transformer-baseret pipeline; en scikit learn self-training klassifikator; og Instaloader-frameworket.

Der er ingen sædvanlig ‘resultater’-sektion i den nye artikel, da den beskæftiger sig med et formål (dvs. automatiseret slutning af korrupte Instagram-konti), der afviger fra det centrale fokus til dato (dvs. automatiseret slutning af automatiseret bot-aktivitet på Instagram), hvilket betyder, at der ikke er noget lignende tidligere arbejde at sammenligne det med.

Forskerne anvendte en bred vifte af metoder på de tilgængelige købte brugere, (som de føler sig komfortable med at beskrive som ‘falske’ snarere end bare ‘ikke-CT’, da disse ægte konti udfører ikke-organisk, betalt engagement-aktivitet), på tværs af en række NLP-relaterede teknologier.

Bl.a. blev sproganalyse (som i CT-verdenen næsten altid standardiserer til engelsk, selvom CT-platforme også tilbyder geolokaliserede ikke-engelske følgere); kommentarantal (hvor falske brugere holder sig meget tæt på hyppigheden af rigtige brugere, af frygt for opdagelse); og almindelige ordanalyse:

Word clouds fra falske og rigtige brugere.

Word clouds fra falske og rigtige brugere.

Artiklen bemærker, at forekomsten af ordet ‘dokter’ (se billedet ovenfor) i falske konti synes at være relateret til en specifik intern kampagne:

‘“Dokter” [optrådte] i 1069 forskellige kommentarer. Ved at undersøge konti, der spammer [dette] ord, fandt vi en lille del af, hvad der synes at være en botnet, hvis formål er at spamme “Instagram-læger”-konti. Alle disse lægers profiler har en WhatsApp-forretningslink, der, når den klikkes, starter en chat med en besked om at fuldføre.’

Så vidt forskerne kan slutte, kan dette underlige artifact være et levn af en stor botnet, som de stødte på, mens de søgte efter aktiviteter fra rigtige Instagram-brugere.

I alt indsamlede forskerne 603.007 kommentarer fra indlæg på tværs af 248.388 unikke Instagram-brugere, af hvilke forfatterne estimerer, at 55.719 var crowdturfing-konti.

Artiklen bemærker med interesse dominansen af kvindetemaer i den indsamlede data. Efter at have brugt GPU-PDMM (en teknik udviklet til de obligatorisk korte indlæg på Twitter) til at trække 12.830 passende kommentarer fra en tilgængelig korpus af 121.822 kommentarer, fandt algoritmen, at i betragtning af indhold fra 12 mænd og 8 kvinder, behandler de fleste kommentarer kvindelige emner.

De 10 bedste emner, der er trukket fra falske kommentarer i et af forskernes eksperimenter.

De 10 bedste emner, der er trukket fra falske kommentarer i et af forskernes eksperimenter.

Forskerne konkluderer:

‘[ Mens] Instagram og forskningssamfundet har fokuseret meget på at opdage bots og automatiserede konti, mener vi, at der skal udføres flere studier om CT-aktiviteter, der negativt påvirker influencer-markedsføring, Instagram-platformen og de fleste af dets brugere.’

 

* Forskernes citerede TrustPilot-URL er udeladt.

Først udgivet den 28. juni 2022.

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai