Andersonův úhel
Identifikace Instagram Crowdturferů pomocí strojového učení

Výzkumníci v Itálii a Íránu tvrdí, že vytvořili první systém strojového učení, který je schopen rozpoznat “crowdturfing” činnosti lidských (nikoli automatizovaných) influencer účtů na platformě Instagram. Crowdturfové jsou skutečné osoby, které poskytují “služby budování profilů” platformám, které prodávají takovou činnost ve velkoobchodním měřítku.
Nová metoda prohlašuje přesnost kolem 95 % a používá semi-supervised learning v systémech Natural Language Processing (NLP).
Autorů prohlašují, že podle jejich znalostí jejich systém představuje první detektor crowdturfingu (CT), který může spolehlivě identifikovat ne-bot účty, které se účastní falešné, placené interakce a zvýšení popularity.
Pro dosažení tohoto cíle autoři zakoupili 1293 crowdturfing profilů od 11 poskytovatelů CT platforem, aby získali data pro výcvik svého detektoru CT. Jelikož Instagram má efektivní opatření proti botům, autoři poznamenávají, že ti, kteří chtějí využít obrovskou uživatelskou základnu platformy pro komerční účely, se obrátili na platbu skutečným influencerům, aby “strategicky” interagovali s “klientskými” účty, většinou sdílením komentářů nebo aktivit souvisejících s komentáři k příspěvkům.
Po výcviku modelu autoři jej použili k analýze profilů 20 “mega-influencerů”, každý s více než 1 milionem sledujících, a dospěli k závěru, že “více než 20 % jejich interakce bylo umělých”.
Článek článku se jmenuje Jsi jsme všichni v Truman Show? Identifikace Instagram Crowdturferů pomocí samoškolení a pochází od pěti výzkumníků z Univerzity v Padově v Itálii a Íránské univerzity Imam Reza.
Porušení podmínek Instagramu
Na rozdíl od Twitteru, který je oblíbený mezi výzkumníky sociálních médií kvůli své ochotě pomáhat výzkumu, Instagram neposkytuje žádný API nebo aktualizované datové dump, aby pomohl výzkumníkům, a zakazuje strojově řízené procházení v svých podmínkách. Proto první úkolem výzkumníků bylo získat výjimku ze své institucionální rady, odůvodněnou předchozími pracemi, které použily podobný přístup k vyšetřování “podzemních aktivit”.
Crowdturfing služby byly zakoupeny pro čerstvé Instagram účty vytvořené výzkumníky pro jejich účely, všechny byly smazány po experimentu, což vyloučilo zapojení “legitimních” uživatelů. Ani influencer účty studované ani CT platformy služby nejsou jmenovány.
Jinou etickou překážkou bylo, že výzkumníci nemohli požádat o souhlas influencerů, kteří byli studováni, kvůli Hawthornovu efektu (tj. mohlo by to změnit chování influencerů), a tato výjimka byla také udělena IRB.
Nakonec, jelikož Instagram umožňuje “ruční sběr” dat, výzkumníci kompromitovali s porušením podmínek Instagramu nastavením svých automatizovaných nástrojů pro sběr dat na “lidskou rychlost”, což vyžadovalo fázi sběru dat po dobu pěti měsíců.
Lidé na prodej
Výzkumníci zakoupili 100 “falešných sledujících” profilů od každého z 11 (neznámých) poskytovatelů.
Článek uvádí*:
‘Všichni poskytovatelé, které jsme vybrali, zajišťují dodání sledujících, kteří interagují s cílovými profily tím, že jim líbí a komentují jejich příspěvky, aby zvýšili jejich míru interakce.
‘Tyto CT profily jsou identifikovány jako vysoké kvality sledující a obvykle stojí více než “základní” falešné profily. Důvěryhodnost těchto poskytovatelů je podporována známými [recenzními] platformami, jako je TrustPilot.’

Z článku, statistika o (anonymizovaných) CT platformách, každá z nich je tržištěm pro ‘zkorumpované’ reálné účty influencerů. Tato tabulka uvádí informace hlášené poskytovateli a získané výzkumníky prostřednictvím analýzy 100 profilů zakoupených z každého zdroje. Zdroj: https://arxiv.org/pdf/2206.12904.pdf
Průměrná cena za nákup jednoho Instagram influencera, uvádí článek, není příliš vysoká, přibližně 3 dolary za 100 “vysokokvalitních” sledujících. Autoři poznamenávají:
‘Většina poskytovatelů dodává sledující během několika hodin. Nabízejí ochranu proti poklesu, což znamená, že počet sledujících, které zákazník zakoupí, buď zůstane stabilní v čase, nebo budou dodány nové sledující, aby nahradily ty ztracené.’
Výzkumníci uvádějí, že některé z jejich čerstvých Instagram účtů ztratily 15-20 % CT sledujících po jednom měsíci, ale v některých případech získaly více, než se očekávalo. U nejdražšího CT poskytovatele (CT-10, v tabulce výše) byly ztraceny pouze tři sledující po jednom měsíci.
Článek uvádí, že poměr sledujících a sledovaných se stává “autentičtějším”, čím více zaplatíte CT poskytovateli, přičemž druhý nejdražší poskytovatel nabízí poměr, který je velmi blízký standardnímu uživateli.
Jedna charakteristika CT Instagram účtu je, že jeho profil je zřídka nastaven na “soukromý” (což umožnilo výzkumníkům získat data z purchased falešných sledujících, protože většina analýz se soustředila na profily a související komentáře), i když to by nemělo být považováno za spolehlivý “signál” v tomto ohledu.
‘Lidé, kteří se připojují k těmto platformám, jsou intéressováni generovat minimální množství příspěvků, které je činí důvěryhodnými, s výjimkou několika případů (CT-4, CT-10). Nízkokvalitní profily ukazují velmi vysokou nerovnováhu v počtu sledujících a sledovaných, a průměrný počet příspěvků je blízko 0, daleko pod CT profily.’
Data
Výzkumníci shromáždili data prostřednictvím implementace frameworku Selenium. Výsledná datová sada zahrnuje informace o profilech 1293 CT a 1307 non-CT uživatelů.
Tato relativně nízká velikost vzorku umožnila nastavit Selenium na “lidskou rychlost” po rozumnou dobu. Kromě toho autoři poznamenávají, že reprezentativní/interpretativní síla semi-supervised learning technik velmi dobře zvládá menší datové sady. Po experimentování s plně dohledem modelem výzkumníci dospěli k závěru:
‘[Výsledky] v semi-supervised režimu se podstatně neliší od těch v režimu s dohledem. To naznačuje, že CT profily sdílejí velmi podobné [charakteristiky], a že algoritmus může konvergovat [pomocí malé části] označených dat.’
Autoři shromáždili všechna dostupná data ze zdrojového kódu “kompromitovaných” uživatelů profilových stránek, včetně detailů, které jsou obvykle skryté, když jsou vykresleny, jako je například #videos element.
Pak předzpracovali datové funkce odstraněním těch s nulovou nebo nízkou variací a nakonec převedli jakékoli kategorické nebo nečíselné údaje na striktně číselné nebo boolean funkce.

Charakteristiky konečné datové sady.
Metoda a průzkumy
Kromě Selenium byly použity technologie jako SpaCy s transformačním pipeline; self-training klasifikátor z knihovny scikit-learn; a framework Instaloader.
Neexistuje obvyklá sekce “výsledky” v novém článku, protože se zabývá tématem (tj. automatickým odhadem korumpovaných Instagram účtů), které se odchyluje od centrálního zaměření dosavadního výzkumu (tj. automatického odhadu automatizovaných bot aktivit na Instagramu), což znamená, že neexistuje žádné srovnatelné předchozí práce, se kterou by se mohlo srovnávat.
Výzkumníci použili širokou škálu metod na dostupných zakoupených uživatelích, (které považují za “falešné” spíše než jen “non-CT”, protože tyto skutečné účty provádějí neorganické, placené aktivity), napříč různými NLP souvisejícími technologiemi.
Mezi zkoumanými aspekty byly analýza jazyka (která v CT světě téměř vždy defaultuje na angličtinu, i když CT platformy nabízejí geo-located neanglické sledující); počty komentářů (kde falešní uživatelé se drží velmi blízko k frekvenci skutečných uživatelů, aby se vyhnuli detekci); a analýza běžných slov:

Word cloudy z falešných a skutečných uživatelů.
Článek uvádí, že prevalence slova “dokter” (viz obrázek výše) v falešných účtech parece být spojená s konkrétní interní kampaní:
‘“Dokter” [se objevil] v 1069 různých komentářích. Další šetření účtů, které spamují [toto] slovo, jsme našli malou část toho, co se zdá být botnetem, jehož cílem je spamovat “Instagram doktory” účty. Všechny tyto doktorské profily mají WhatsApp obchodní odkaz, který, když je kliknut, spustí chat s zprávou, aby dokončili.’
Jak daleko výzkumníci mohou usuzovat, tato podivná artefakt může být zbytkem velkého botnetu, na který narazili, zatímco hledali aktivity skutečných Instagram uživatelů.
Celkem výzkumníci shromáždili 603 007 komentářů z příspěvků napříč 248 388 jedinečnými Instagram uživateli, z nichž, podle odhadů autorů, 55 719 byly crowdturfing účty.
Článek zajímavě poznamenává dominanci ženských témat v shromážděných datech. Použitím GPU-PDMM (techniky vyvinuté pro povinně krátké příspěvky na Twitteru) k extrahování 12 830 vhodných komentářů z dostupného korpusu 121 822 komentářů, algoritmus nalezl, že při zvažování obsahu od 12 mužů a 8 žen, většina komentářů se zabývá ženskými tématy.

Top 10 témat extrahovaných z falešných komentářů v jednom z experimentů výzkumníků.
Výzkumníci uzavírají:
‘[Zatímco] Instagram a výzkumná komunita se soustředila na detekci botů a automatizovaných účtů, věříme, že by měly být provedeny další studie o CT aktivitách, které negativně ovlivňují influencer marketing, Instagram platformu a většinu jejích uživatelů.’
* Odkaz na TrustPilot výzkumníků je vynechán.
První zveřejnění 28. června 2022.












