Andersons vinkel
Identifisering av Instagram Crowdturfere med MaskinlÃĶring

Forskere i Italia og Iran hevder ÃĨ ha utviklet det fÃļrste maskinlÃĶringsystemet som kan gjenkjenne âcrowdturfingâ-aktivitet fra menneskelige (i motsetning til automatiserte) influenser-kontoer pÃĨ Instagram-plattformen. Crowdturfere er ekte mennesker som utfÃļrer âprofilbyggingsâ-tjenester for plattformer som selger slike aktiviteter pÃĨ en grosistbasis.
Den nye metoden hevder en nÃļyaktighetspoeng pÃĨ rundt 95%, og bruker semi-overvÃĨket lÃĶring i naturligsprÃĨklig prosessering (NLP)-systemer.
Forfatterne hevder at, sÃĨ langt de vet, deres system representerer det fÃļrste crowdturfing (CT)-detektor-systemet som kan pÃĨlitelig finne ikke-robot-kontoer som er engasjert i falsk, betalt profilengasjement og boosting.
For ÃĨ oppnÃĨ dette, kjÃļpte forfatterne 1293 crowdturfing-profiler fra 11 CT-plattform-tilbydere for ÃĨ fÃĨ data til ÃĨ trene deres CT-detektor. Ettersom Instagram har en rekke effektive anti-robot-mÃĨl, merker forskerne til, at de som sÃļker ÃĨ utnytte plattformens enorme brukerbase for kommersielle formÃĨl har vendt seg til ÃĨ betale ekte influensere pÃĨ Instagram til ÃĨ âengasjere strategiskâ med âkundeâ-kontoer, hovedsakelig ved ÃĨ dele kommentarer eller gjennom aktivitet relatert til kommentarer pÃĨ innlegg.
Etter ÃĨ ha trent modellen, slapp forfatterne den lÃļs for ÃĨ analysere engasjementsprofilene til 20 âmega-influensereâ, hver med over 1 million fÃļlgere, og konkluderte med at âmer enn 20% av deres engasjement var kunstigâ.
Den artikkelen heter Er vi alle i en Truman Show? Oppdaging av Instagram Crowdturfing gjennom Selv-Trening, og kommer fra fem forskere pÃĨ Universitetet i Padova i Italia og Imam Reza Universitet i Iran.
Bruk av Instagrams TOS
I motsetning til Twitter, som er favoritt blant sosiale medieforskere pÃĨ grunn av sin tilnÃĶrming til ÃĨ hjelpe forskning, tilbyr Instagram ikke bare ingen API eller oppdaterte data-dumper for ÃĨ hjelpe forskere, men forbryter ogsÃĨ maskin-drevet browsing i sine vilkÃĨr for tjenesten. Derfor var forskernes fÃļrste oppgave ÃĨ fÃĨ en unntak fra deres veiledende Institutional Review Board, begrunnet av tidligere arbeid som brukte en lignende tilnÃĶrming til ÃĨ undersÃļke âundergrunnsaktiviteterâ.
Crowdturfing-tjenestene ble kjÃļpt for ferske Instagram-kontoer som ble opprettet av forskerne for deres formÃĨl, alle av disse ble slettet etter eksperimentet, og eliminerte dermed involvering av âlegitimeâ brukere. Ingen av influenser-kontoene som ble studert eller CT-plattform-tjenestene er navngitt.
En annen etisk hindring var at forskerne ikke kunne be om samtykke fra influenserne som ble studert, pÃĨ grunn av Hawthorne-effekten (dvs. det kunne ha endret influenserens atferd), og denne unntakningen ble ogsÃĨ gitt av IRB.
Til slutt, ettersom Instagram tillater âmanuell innhentingâ av data, kompromisset forskerne med deres overtredelse av TOS ved ÃĨ sette deres automatiserte skraping-verktÃļy til âmenneskelig hastighetâ, noe som nÃļdvendiggjorde en data-innsamlingsfasen pÃĨ fem mÃĨneder.
Mennesker til salgs
Forskerne kjÃļpte 100 âfalske fÃļlgerâ-profiler fra hver av 11 (unavnnete) tilbydere.
Artikkelen sier*:
âAlle tilbyderne vi valgte sikrer ÃĨ levere fÃļlgere som interagerer med mÃĨlprofilene ved ÃĨ like og kommentere pÃĨ deres innlegg for ÃĨ Ãļke deres engasjementsrate.
âDisse CT-profilene blir identifisert som hÃļykvalitetsfÃļlgere og koster vanligvis mer enn âbasisâ-falske profiler. PÃĨliteligheten til disse tilbyderne stÃļttes av berÃļmte [anmeldelses]plattformer som TrustPilot.â

Fra artikkelen, statistikk pÃĨ de (anonymiserte) CT-plattform-tilbyderne, hver en markedsplass for âkorrumperteâ virkelige influenser-kontoer. Denne tabellen omfatter informasjon rapportert av tilbyderne og hentet av forskerne gjennom analysen av de 100 profilene kjÃļpt fra hver kilde. Kilde: https://arxiv.org/pdf/2206.12904.pdf
Gjennomsnittsprisen for ÃĨ kjÃļpe en Instagram-influenser, merker artikkelen, er ikke sÃĨ hÃļy, pÃĨ rundt 3 dollar for 100 âhÃļykvalitetsâ-fÃļlgere. Forfatterne merker:
âDe fleste tilbyderne leverer fÃļlgerne innen fÃĨ timer. De tilbyr en drop-beskyttelse, som betyr at antallet fÃļlgere kunden kjÃļper vil enten forbli stabilt over tid eller nye fÃļlgere vil bli levert for ÃĨ fylle opp de tapte.â
Forskerne rapporterer at noen av deres ferske Instagram-kontoer led en tap pÃĨ 15-20% av CT-fÃļlgere etter en mÃĨned, men at i visse tilfeller de fikk mer enn forventet. For den dyreste CT-tilbyderen (CT-10, i tabellen over), ble bare tre fÃļlgere tapt etter en mÃĨned.
Artikkelen merker at forholdet mellom fÃļlgere og fÃļlging blir mer âautentiskâ jo mer du betaler til CT-tilbyderen, med den nest dyreste tilbyderen som tilbyr et forhold som er svÃĶrt nÃĶrt en standardbrukers baseline.
En karakteristika ved en CT-Instagram-konto er at profilen sjelden blir satt til âprivatâ (en faktum som muliggjorde datainnsamling fra de kjÃļpte falske fÃļlgerne, siden de fleste analyser sentrerte seg rundt profiler og relaterte kommentarer), selv om dette ikke bÃļr sees som en pÃĨlitelig âsignalâ i denne sammenhengen.
âPersoner som gÃĨr med pÃĨ disse plattformene er interessert i ÃĨ generere et minimum antall innlegg som gjÃļr dem pÃĨlitelige, bortsett fra noen fÃĨ tilfeller (CT-4, CT-10). De lavkvalitets-profilene viser en svÃĶrt hÃļy ubalanse i fÃļlgere og fÃļlging, og gjennomsnittsantallet av innlegg er nÃĶr 0, langt under CT-profilene.â
Data
Forskerne samlet inn data gjennom en implementering av browser-automatiserings-rammeverket Selenium. Den resulterende datasett inkluderer profilinformasjon fra 1293 CT- og 1307 ikke-CT-brukere.
Denne ÃĨpenbart lave prÃļvekvantiteten gjorde det mulig ÃĨ sette Selenium til en troverdig menneskelig hastighet over en rasjonell periode. I tillegg merker forfatterne at den representative/fortolkningsfulle kraften til semi-overvÃĨkede lÃĶringsteknikker aksepterer smÃĨ datasett svÃĶrt godt. Etter ÃĨ ha eksperimentert, for grundighetens skyld, med en fullt overvÃĨket modell, konkluderer forskerne:
â[Resultatene] i semi-overvÃĨket modus skiller seg ikke vesentlig fra dem i en overvÃĨket mÃĨte. Dette antyder at CT-profiler deler svÃĶrt like [karakteristika], og at algoritmen kan konvergere [gjennom en liten mengde] merket data.â
Forfatterne samlet inn all tilgjengelig data fra kildekoden til de âkompromitterteâ brukernes profil-sider, inkludert detaljer som vanligvis skjules nÃĨr de rendres, som #videos-elementet.
De behandlet deretter data-egenskapene ved ÃĨ fjerne de med null eller lav varians, og konverterte til slutt alle kategoriske eller ikke-numeriske data til strengt numeriske eller booleske egenskaper.

Egenskaper til den endelige datasett.
Metode og UndersÃļkelser
Foruten Selenium, teknologier som ble brukt over eksperimentene inkluderer: en versjon av SpaCy implementert med en transformer-basert pipeline; en scikit learn self-training klassifikator; og Instaloader-rammeverket.
Det finnes ingen vanlig âresultaterâ-del i den nye artikkelen, siden den handler om et objekt (dvs. automatisert inferens av korrupte Instagram-kontoer) som avviker fra det sentrale fokusomrÃĨdet til nÃĨ (dvs. automatisert inferens av automatiserte bot-aktiviteter pÃĨ Instagram), noe som betyr at det ikke finnes noen like-for-like tidligere arbeid ÃĨ sammenligne det med.
Forskerne tok i bruk en rekke metoder pÃĨ de tilgjengelige kjÃļpte brukerne, (som de fÃļler seg komfortable med ÃĨ beskrive som âfalskeâ i stedet for bare âikke-CTâ, siden disse ekte kontoene utfÃļrer ikke-organisk, betalt engasjementsaktivitet), over en rekke NLP-relaterte teknologier.
Blant de aspektene som ble studert, var sprÃĨkanalyse (som i CT-verdenen nesten alltid standardiserer til engelsk, selv om CT-plattformer ogsÃĨ tilbyr geolokaliserte ikke-engelske fÃļlgere); kommentar-tellinger (hvor falske brukere holder seg svÃĶrt nÃĶr frekvensen til ekte brukere, av frykt for ÃĨ bli oppdaget); og vanlige ord-analyse:

Ord-skyer fra falske og ekte brukere.
Artikkelen merker at forekomsten av ordet âdokterâ (se bilde over) i falske kontoer synes ÃĨ ha sammenheng med en spesifikk intern kampanje:
ââDokterâ [opptrÃĨdte] i 1069 distinkte kommentarer. Ved ÃĨ undersÃļke videre kontoene som spammet [dette] ordet, fant vi en liten del av hva som synes ÃĨ vÃĶre en botnet hvis mÃĨl er ÃĨ spamme âInstagram-legerâ-kontoer. Alle disse legenes profiler har en WhatsApp-forretningslenke som, nÃĨr den klikkes, starter en chat med en melding om ÃĨ fullfÃļre.â
SÃĨ langt forskerne kan slutte, kan dette merkelige artefaktet vÃĶre et levn av en stor botnet som de stÃļtte pÃĨ mens de sÃļkte etter aktiviteter fra ekte Instagram-brukere.
I alt samlet forskerne inn 603 007 kommentarer fra innlegg over 248 388 unike Instagram-brukere, hvorav, estimerer forfatterne, 55 719 var crowdturfing-kontoer.
Artikkelen merker med interesse dominansen av kvinnelige temaer i den samlede datamengden. Etter ÃĨ ha brukt GPU-PDMM (en teknikk utviklet for obligatorisk korte innlegg pÃĨ Twitter) for ÃĨ trekke ut 12 830 passende kommentarer fra en tilgjengelig korpus pÃĨ 121 822 kommentarer, fant algoritmen at i ÃĨ vurdere innhold fra 12 menn og 8 kvinner, var de fleste kommentarene relatert til kvinnelige temaer.

De 10 Ãļverste emnene trukket ut fra falske kommentarer i ett av forskernes eksperimenter.
Forskerne konkluderer:
â[ Mens] Instagram og forskningssamfunnet har fokusert mye pÃĨ ÃĨ oppdage bots og automatiserte kontoer, mener vi at det bÃļr gjennomfÃļres flere studier om CT-aktiviteter, som negativt pÃĨvirker influenser-markedsfÃļring, Instagram-plattformen og de fleste av dens brukere.â
Â
* Forskerne siterte TrustPilot-URL er utelatt.
FÃļrst publisert 28. juni 2022.












