Andersonin kulma

Instagramin Crowdturffareiden tunnistaminen koneoppimisen avulla

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Tutkijat Italiassa ja Iranissa väittävät kehittäneensä ensimmäisen koneoppimisjärjestelmän, joka pystyy tunnistamaan “crowdturfing”-toiminnan (ihmisten, ei automaattisten tietokoneohjelmien) Instagram-vaikuttajatilien käytössä. Crowdturffarit ovat todellisia ihmisiä, jotka tarjoavat “profiilien rakentamispalveluita” alustoille, jotka myyvät tällaista toimintaa joukkoina.

Uusi menetelmä väittää saavuttavansa 95 prosentin tarkkuuden ja käyttää puolivalvottua oppimista luonnollisen kielen prosessoinnissa (NLP).

Tutkijat väittävät, että heidän tietojensa mukaan heidän järjestelmänsä edustaa ensimmäistä crowdturfing (CT) -tunnistusjärjestelmää, joka pystyy luotettavasti kohdistumaan ei-robotti-tiliin, jotka osallistuvat väärennetyyn, maksulliseen profiilin parantamiseen ja lisäämiseen.

Tämän saavuttamiseksi tutkijat ostivat 1293 crowdturfing-profiilia 11 CT-palveluntarjoajalta saadakseen dataa heidän CT-tunnistusjärjestelmänsä kouluttamiseen. Koska Instagramilla on useita tehokkaita anti-robotti-toimia käytössä, tutkijat toteavat, että ne, jotka pyrkivät hyödyntämään alustan valtavan käyttäjäkunnan kaupallisiin tarkoituksiin, ovat kääntyneet maksamaan aidosti vaikuttaville Instagram-käyttäjille “strategisen” vuorovaikutuksen “asiakas”-tilien kanssa, pääasiassa jakamalla kommentteja tai toiminnan suhteen kommentteihin viesteissä.

Kun malli oli koulutettu, tutkijat antoivat sen analyysin 20 “mega-vaikuttajan” vuorovaikutusprofiileja, joilla kullakin yli miljoona seuraajaa, ja tulivat siihen tulokseen, että “yli 20 % heidän vuorovaikutuksestaan oli keinotekoista”.

Tutkimus on nimeltään Olemme kaikki Truman Show’ssa? Paikantamalla Instagramin crowdturfing itseopiskelun kautta, ja se on peräisin viideltä tutkijalta Italian Padovan yliopistosta ja Iranin Imam Reza -yliopistosta.

Rikkomalla Instagramin TOS

Toisin kuin Twitter, jota sosiaalisen median tutkijat suosivat sen sitoutumisen vuoksi auttamaan tutkimusta, Instagram ei tarjoa API:ta tai päivitettyjä data-dumppia tutkijoiden avuksi, vaan kieltää konepohjaisen selaamisen käyttöehdoissaan. Siksi tutkijoiden ensimmäinen tehtävä oli hankkia poikkeus heidän ohjaavasta Institutional Review Boardista, jota perusteltiin aiemmilla tutkimuksilla, jotka käyttivät samanlaista lähestymistapaa tutkimaan “maanalaisia” toimintoja.

Crowdturfing-palvelut ostettiin tuoreille Instagram-tilille, jotka tutkijat loivat tätä tarkoitusta varten, ja kaikki nämä tilit poistettiin kokeen jälkeen, jolloin “legitiimien” käyttäjien osallistuminen estettiin. Vaikuttajatilien tutkimiseen käytettyjä CT-palveluita ei mainita.

Toinen eettinen este oli, että tutkijat eivät voineet pyytää suostumusta vaikuttajilta, jotka tutkittiin, Hawthorne-ilmiön vuoksi (ts. se olisi voinut muuttaa vaikuttajien käyttäytymistä), ja tämä poikkeus myönnettiin myös IRB:ltä.

Lopulta, koska Instagram sallii “manuaalisen” datan keräämisen, tutkijat löysivät kompromissin heidän TOS-rikkomuksensa kanssa asettamalla heidän automaattiset skraapausvälineensä “ihmisen nopeuteen”, mikä edellytti viiden kuukauden mittaisen datan keräämisen vaihetta.

Ihmisiä myytävänä

Tutkijat ostivat 100 “väärennetyen seuraajien” profiileja 11 (nimettömästä) tarjoajalta.

Tutkimus toteaa*:

‘Kaikki valitsemamme tarjoajat taataan toimittaa seuraajia, jotka vuorovaikuttavat kohdeprofiileihin tykkäämällä ja kommentoimalla heidän viestejään, jotta heidän vuorovaikutuksensa paranee.

‘Nämä CT-profiilit tunnetaan korkealaatuisina seuraajina ja niiden hinta on yleensä korkeampi kuin “perus” väärennetyillä profiileilla. Näiden tarjoajien luotettavuus tukeutuu kuuluisiin [arvostelijoiden] alustoille, kuten TrustPilottiin.’

Tutkimuksesta, tilastot (anonyymistetty) CT-palveluntarjoajista, joista jokainen on markkinapaikka 'korruptoiduille' todellisille vaikuttajatileille. Tämä taulukko esittää tietoja, jotka tarjoajat ilmoittivat ja jotka tutkijat analysoivat 100 profiilista, jotka ostettiin kustakin lähteestä. Lähde: https://arxiv.org/pdf/2206.12904.pdf

Tutkimuksesta, tilastot (anonyymistetty) CT-palveluntarjoajista, joista jokainen on markkinapaikka ‘korruptoiduille’ todellisille vaikuttajatileille. Tämä taulukko esittää tietoja, jotka tarjoajat ilmoittivat ja jotka tutkijat analysoivat 100 profiilista, jotka ostettiin kustakin lähteestä. Lähde: https://arxiv.org/pdf/2206.12904.pdf

Tutkimus toteaa, että keskimääräinen hinta Instagram-vaikuttajan ostamisesta ei ole kovin korkea, noin 3 dollaria 100 “korkealaatuisen” seuraajan osalta. Tutkijat toteavat:

‘Useimmat tarjoajat toimittavat seuraajat muutamassa tunnissa. He tarjoavat suojan seuraajien menetykseltä, mikä tarkoittaa, että asiakkaan ostama seuraajamäärä säilyy vakaana ajan myötä tai uusia seuraajia toimittetaan korvaamaan menetettyjä.’

Tutkijat raportoivat, että jotkut heidän tuoreista Instagram-tilistään menettivät 15-20 % CT-seuraajia kuukauden jälkeen, mutta joissain tapauksissa he saivat enemmän kuin odotettiin. Kalleimmalle CT-tarjoajalle (CT-10 taulukossa yllä) menetti vain kolme seuraajaa kuukauden jälkeen.

Tutkimus toteaa, että seurattavien ja seuraamisen suhde muuttuu “aidommaksi” mitä enemmän maksetaan CT-tarjoajalle, ja toiseksi kallein tarjoaja tarjoaa suhteen, joka on hyvin lähellä standardikäyttäjän perusarvoa.

Yksi CT-Instagram-tilin ominaispiirre on, että sen profiili on harvoin asetettu “yksityiseksi” (asia, joka mahdollisti datan keräämisen ostetuista väärennetyistä seuraajista, koska useimmat analyysit keskittyivät profiileihin ja niihin liittyviin kommentteihin), vaikka tämä ei pitäisi nähdä luotettavana “signaalina” tässä suhteessa.

‘Ihmiset, jotka liittyvät näihin alustoihin, ovat kiinnostuneita luomaan vähintään jonkin verran viestejä, jotka tekevät heistä luotettavia, paitsi joitakin tapauksia (CT-4, CT-10). Matalan laatuiset profiilit näyttävät olevan hyvin epätasapainossa seuraajien ja seuraamisen suhteen, ja keskimääräinen viestien määrä on lähellä 0, kaukana CT-profiileista.’

Data

Tutkijat keräsivät dataa Selenium- selainautomaatiokehyksen avulla. Tuloksena oleva tietokanta sisältää profiilitiedot 1293 CT- ja 1307 ei-CT-käyttäjältä.

Tämä varsinainen pieni otoskoko mahdollisti Seleniumin asettamisen uskottavaan “ihmisen nopeuteen” kohtuullisen ajanjakson aikana. Tutkijat toteavat myös, että semi-supervised -oppimismenetelmien edustava/ tulkinta voima soveltuu hyvin pienempiin tietokantoihin. Kokeiltuaan, perusteellisuuden vuoksi, täysin valvottua mallia, tutkijat toteavat:

‘[Tulokset] semi-supervised -tilassa eivät poikkea merkittävästi täysin valvotusta tavasta. Tämä osoittaa, että CT-profiilit jakavat hyvin samanlaisia [ominaisuuksia], ja että algoritmi voi yhdistyä [pienen määrän] merkittyjen datan kautta.’

Tutkijat keräsivät kaiken saatavissa olevan datan “korruptoiduista” käyttäjien profiilisivujen lähdekoodista, mukaan lukien yksityiskohdat, jotka ovat yleensä peitettynä renderöidessä, kuten #videos -elementti.

He sitten esikäsitelivät data-ominaisuuksia poistamalla ne, joilla oli nolla tai matala varianssi, ja lopulta muuttivat kaikki kategoriset tai ei-numeriset tiedot tiukasti numeerisiksi tai boole-ominaisuuksiksi.

Lopullisen tietokannan ominaisuudet.

Lopullisen tietokannan ominaisuudet.

Menetelmä ja tutkimukset

Lisäksi Seleniumia, teknologioita, joita käytettiin kokeissa, olivat: SpaCy:n versio, joka on toteutettu transformer-pohjaisella putkella; scikit-learnin itseopiskeluluokitus; ja Instaloader-kehyksen avulla.

Uudessa tutkimuksessa ei ole perinteistä “tulokset” -osaa, koska se käsittelee tavoitetta (ts. automaattista korruptoituneiden Instagram-tilien tunnistamista), joka poikkeaa aiemman keskeisen kiinnostuksen kohteesta (ts. automaattisen bot-toiminnan tunnistamisesta Instagramissa), mikä tarkoittaa, että ei ole suoraan verrattavissa aiempaan tutkimukseen.

Tutkijat sovelsivat laajaa joukkoa menetelmiä saatavilla oleviin ostettuihin käyttäjiin (joita he kokevat mukavaksi kuvailla “väärennetyiksi” eikä vain “ei-CT”, koska nämä aito tilisi osallistuvat epäorgaaniseen, maksulliseen vuorovaikutukseen), joukon NLP:hen liittyvien teknologioiden yli.

Tutkituista ominaisuuksista olivat kielianalyysi (joka CT-maailmassa lähes aina oletusarvoisesti englantia, vaikka CT-alustat tarjoavat myös ei-englanninkielisiä seuraajia); kommenttien määrä (jossa väärennetyt käyttäjät pysyvät hyvin lähellä aidon käyttäjien määrää, pelätessä havaitsemista); ja yleisten sanojen analyysi:

Sanapilviä väärennetyistä ja aidoista käyttäjistä.

Sanapilviä väärennetyistä ja aidoista käyttäjistä.

Tutkimus toteaa, että “dokter”-sanan (ks. yllä oleva kuva) esiintyminen väärennetyissä tileissä näyttää liittyvän tiettyyn sisäiseen kampanjaan:

‘“Dokter” [näkyi] 1069 eri kommentissa. Tutkimalla lähemmin tilejä, jotka spamilivät [tämän] sanan, löysimme pienen osan siitä, mitä näyttää olevan botnetin, jonka tavoitteena on spammata “Instagram-lääkärien” tilejä. Kaikki nämä lääkärien profiilit ovat WhatsApp-liiketoimintayhteydellä, joka aloittaa chatin viestillä, jossa pyydetään täydentämään.’

Tutkijoiden mukaan tämä outo artefakti saattaa olla jäännös suuresta botnetistä, jonka he törmäsivät etsiessään toimintaa aidoista Instagram-käyttäjistä.

Kaiken kaikkiaan tutkijat keräsivät 603 007 kommenttia viesteistä 248 388 yksilölliseltä Instagram-käyttäjältä, joista arvioitiin, että 55 719 oli crowdturfing-tiliä.

Tutkimus toteaa mielenkiintoisella tavalla naisaiheisten aiheiden hallitsevan kerättyä dataa. Käyttäen GPU-PDMM (tekniikkaa, jota kehitettiin Twitterin lyhyiden viestien pakottamiseksi) 12 830 sopivan kommentin poistamiseksi saatavilla olevasta 121 822 kommentin korpuksista, algoritmi totesi, että tarkasteltaessa 12 miestä ja 8 naista, useimmat kommentit käsittelevät naisiin liittyviä aiheita.

Top 10 -aiheita, jotka on poimittu väärennetyistä kommentteista yhdessä tutkijoiden kokeista.

Top 10 -aiheita, jotka on poimittu väärennetyistä kommentteista yhdessä tutkijoiden kokeista.

Tutkijat toteavat:

‘[Vaikka] Instagram ja tutkimusyhteisö on keskittynyt paljon botien ja automaattisten tietokoneohjelmien havaitsemiseen, uskomme, että tulisi suorittaa enemmän tutkimuksia CT-toiminnasta, joka vaikuttaa negatiivisesti vaikuttajamarkkinointiin, Instagram-alustaan ja useimpiin sen käyttäjiin.’

* Tutkijoiden siteerattu TrustPilot-URL on jätetty pois.

Julkaistu ensimmäisen kerran 28. kesäkuuta 2022.

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai