Andersons vinkel

Identifiera Instagram Crowdturfers med maskinlärning

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Forskare i Italien och Iran hävdar att de har formulerat det första maskinlärningssystemet som kan känna igen “crowdturfing”-aktivitet från mänskliga (inte automatiserade) influenser på Instagram-plattformen. Crowdturfers är riktiga människor som utför “profilbyggnadstjänster” till plattformar som säljer sådan aktivitet på grossistbasis.

Den nya metoden hävdar en noggrannhet på cirka 95% och använder semi-övervakad inlärning i system för naturligt språkbehandling (NLP).

Författarna hävdar att deras system, såvitt de känner till, representerar det första crowdturfing-detektionssystemet som kan tillförlitligt identifiera icke-robotkonton som är engagerade i falsk, betald profilengagemang och förstärkning.

För att åstadkomma detta köpte författarna 1293 crowdturfingprofiler från 11 crowdturfing-plattformsleverantörer för att få data för att träna deras crowdturfing-detektor. Eftersom Instagram har ett antal effektiva anti-robotåtgärder på plats, noterar forskarna att de som försöker utnyttja plattformens enorma användarbas för kommersiella ändamål har vänt sig till att betala riktiga Instagram-influencers för att “engagera strategiskt” med “kund”-konton, mestadels genom att dela kommentarer eller genom aktivitet relaterad till kommentarer på inlägg.

Efter att ha tränat modellen släppte författarna den för att analysera engagemangsprofilerna för 20 “mega-influencers”, var och en med över 1 miljon följare, och drog slutsatsen att mer än 20% av deras engagemang var artificiellt.

Den artikeln heter Är vi alla i en Truman Show? Identifiera Instagram Crowdturfing genom självinlärning och kommer från fem forskare vid universitetet i Padova i Italien och Imam Reza-universitetet i Iran.

Överträdelse av Instagrams användarvillkor

Till skillnad från Twitter, som föredras av sociala medieforskare på grund av sitt åtagande att hjälpa till med forskning, tillhandahåller Instagram inte någon API eller uppdaterad data för att hjälpa forskare, och förbjuder maskinbaserad bläddring i sina användarvillkor. Därför var forskarnas första uppgift att få ett undantag från deras vägledande etikkommitté, motiverat av tidigare arbeten som använde en liknande metod för att undersöka “underjordiska aktiviteter”.

Crowdturfing-tjänsterna köptes för färska Instagram-konton som skapades av forskarna för deras ändamål, alla av vilka raderades efter experimentet, och undvek därmed inblandning av “legitima” användare. Vare sig influenser-kontona som studerades eller crowdturfing-plattformstjänsterna nämns.

En annan etisk utmaning var att forskarna inte kunde begära samtycke från de influensers som studerades, på grund av Hawthorne-effekten (dvs. det kunde ha förändrat influensernas beteende), och detta undantag beviljades också av etikkommitén.

Till slut, eftersom Instagram tillåter “manuell insamling” av data, kompromissade forskarna med sin överträdelse av användarvillkoren genom att ställa in sina automatiserade skrapningsverktyg till “mänsklig hastighet”, vilket gjorde det nödvändigt med en datainsamlingsfas på fem månader.

Människor till salu

Forskarna köpte 100 “falska följare”-profiler från var och en av 11 (obekanta) leverantörer.

Artikeln anger*:

‘Alla leverantörer vi valde säkerställer att leverera följare som interagerar med målprofilerna genom att gilla och kommentera deras inlägg för att öka deras engagemangsgrad.

‘Dessa CT-profiler identifieras som högkvalitativa följare och kostar vanligtvis mer än “bas”-falska profiler. Tillförlitligheten hos dessa leverantörer stöds av kända [recensions]plattformar som TrustPilot.’

Från artikeln, statistik på de (anonymiserade) CT-plattformsleverantörerna, var och en en marknadsplats för 'korrupta' riktiga influenser-konton. Denna tabell visar information som rapporterats av leverantörerna och som hämtats av forskarna genom analys av de 100 profilerna som köptes från varje källa. Källa: https://arxiv.org/pdf/2206.12904.pdf

Från artikeln, statistik på de (anonymiserade) CT-plattformsleverantörerna, var och en en marknadsplats för ‘korrupta’ riktiga influenser-konton.

Den genomsnittliga kostnaden för att köpa en Instagram-influencer, noterar artikeln, är inte så hög, på cirka 3 dollar för 100 “högkvalitativa” följare. Författarna noterar:

‘De flesta leverantörer levererar följarna inom några timmar. De erbjuder en skydd mot förlust, som innebär att antalet följare som kunden köper antingen förblir stabilt över tiden eller att nya följare levereras för att återställa de förlorade.’

Forskarna rapporterar att några av deras färska Instagram-konton led en förlust på 15-20% av CT-följare efter en månad, men att i vissa fall de fick mer än förväntat. För den dyraste CT-leverantören (CT-10, i tabellen ovan) förlorades endast tre följare efter en månad.

Artikeln noterar att förhållandet mellan följare och följda blir mer “äkta” ju mer man betalar till CT-leverantören, med den näst dyraste leverantören som erbjuder ett förhållande som är mycket nära en standardanvändares baslinje.

En egenskap hos ett CT-Instagram-konto är att dess profil sällan ställs in på “privat” (ett faktum som möjliggjorde datainsamling från de köpta falska följarna, eftersom de flesta analyserna fokuserade på profiler och relaterade kommentarer), även om detta inte bör ses som en tillförlitlig “signal” i detta avseende.

‘Personer som går med i dessa plattformar är intresserade av att generera ett minimum antal inlägg som gör dem tillförlitliga, förutom få fall (CT-4, CT-10). De lågkvalitativa profilerna visar en mycket hög obalans i följare och följda, och det genomsnittliga antalet inlägg är nära 0, långt under CT-profilerna.’

Data

Forskarna samlade in data genom en implementering av browser-automatiseringsramverket Selenium. Den resulterande datamängden innehåller profilinformation från 1293 CT- och 1307 icke-CT-användare.

Denna medgivna låga urvalsstorlek gjorde det möjligt att ställa in Selenium till en trovärdig “mänsklig hastighet” under en rimlig tidsperiod. Dessutom noterar författarna att den representativa/interpretativa kraften hos semi-övervakade inlärningstekniker fungerar mycket bra med mindre datamängder. Efter att ha experimenterat, för noggrannhetens skull, med ett fullt övervakat modell, drar forskarna slutsatsen:

‘[Resultaten] i semi-övervakat läge skiljer sig inte signifikant från dem i ett övervakat sätt. Detta tyder på att CT-profiler delar mycket liknande [egenskaper], och att algoritmen kan konvergera [genom en liten mängd] märkt data.’

Författarna samlade in all tillgänglig data från källkoden för de “komprometterade” användarprofilssidorna, inklusive detaljer som vanligtvis döljs när de renderas, som #videos-elementet.

Sedan förbehandlade de datagenereringarna genom att ta bort de som hade noll eller låg varians, och slutligen omvandlade all kategorisk eller icke-numerisk data till strikt numerisk eller boolesk data.

Egenskaper hos den slutliga datamängden.

Egenskaper hos den slutliga datamängden.

Metod och undersökningar

Förutom Selenium, användes följande tekniker i experimenten: en version av SpaCy implementerad med en transformer-baserad pipeline; en scikit-learn självinlärningsklassificerare; och Instaloader-ramverket.

Det finns inget vanligt “resultat”-avsnitt i den nya artikeln, eftersom den behandlar ett ämne (dvs. automatisk inferens av korrupta Instagram-konton) som avviker från det centrala fokusområdet hittills (dvs. automatisk inferens av automatiserad botaktivitet på Instagram), vilket innebär att det inte finns något liknande tidigare arbete att jämföra med.

Forskarna antog en mängd olika metoder på de tillgängliga inköpta användarna, (som de känner sig bekväma med att beskriva som “falska” snarare än bara “icke-CT”, eftersom dessa äkta konton utför icke-organisk, betald engagemangsaktivitet), över ett brett spektrum av NLP-relaterade tekniker.

Bland de aspekter som studerades fanns språkanalys (som i CT-världen nästan alltid standardiserar till engelska, även om CT-plattformar erbjuder geolokaliserade icke-engelska följare också); kommenteringsräkning (där falska användare håller sig mycket nära den frekvens som riktiga användare har, av rädsla för upptäckt); och vanlig ordanalys:

Moln av ord från falska och riktiga användare.

Moln av ord från falska och riktiga användare.

Artikeln noterar att förekomsten av ordet “dokter” (se bild ovan) i falska konton tycks ha samband med en specifik intern kampanj:

‘“Dokter” [uppenbarade] i 1069 olika kommentarer. Genom att ytterligare undersöka kontona som spammade [detta] ord, fann vi en liten del av vad som tycks vara ett botnät vars mål är att spamma “Instagram-läkare”-konton. Alla dessa läkares profiler har en WhatsApp-företagslänk som, när den klickas, startar en chatt med ett meddelande för att slutföra.’

Så långt forskarna kan utröna, kan denna underliga artefakt vara en rest av ett stort botnät som de stötte på medan de sökte efter aktiviteter från riktiga Instagram-användare.

Totalt samlade forskarna in 603 007 kommentarer från inlägg över 248 388 unika Instagram-användare, varav författarna uppskattar att 55 719 var crowdturfing-konton.

Artikeln noterar med intresse dominansen av kvinnligt tematiska ämnen i den insamlade datan. Efter att ha använt GPU-PDMM (en teknik utvecklad för de obligatoriska korta inläggen på Twitter) för att extrahera 12 830 lämpliga kommentarer från en tillgänglig korpus på 121 822 kommentarer, fann algoritmen att innehållet från 12 män och 8 kvinnor i huvudsak handlade om kvinnorelaterade ämnen.

De tio bästa ämnena som extraherades från falska ämnen i ett av forskarnas experiment.

De tio bästa ämnena som extraherades från falska ämnen i ett av forskarnas experiment.

Forskarna drar slutsatsen:

‘[Medan] Instagram och forskarsamhället fokuserade mycket på att upptäcka botar och automatiserade konton, tror vi att fler studier bör genomföras på CT-aktiviteter, som negativt påverkar influencer-marknadsföring, Instagram-plattformen och de flesta av dess användare.’

 

* Forskarnas citerade TrustPilot-URL har utelämnats.

Publicerad första gången den 28 juni 2022.

Författare på maskinlärande, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai