Andersonův úhel
Reidentifikace zákaznických komentářů na sociálních médiích pomocí strojového učení

Výzkumníci z Univerzity Johnse Hopkinse vyvinuli hluboký metrický přístup k identifikaci online komentátorů, kteří mohli mít dříve pozastavené účty, nebo kteří používají několik účtů k astroturfingu nebo jinému manipulování dobré víry online komunit, jako je Reddit a Twitter.
Přístup, který je uveden v nové studii vedené výzkumníkem NLP Aleemem Khanem, nevyžaduje, aby vstupní data byla automaticky nebo ručně anotována, a zlepšuje výsledky předchozích pokusů, i když jsou k dispozici pouze malé vzorky textu, a když text nebyl přítomen v datové sadě během trénování.
Systém nabízí jednoduchý schema augmentace dat, s embeddy různých velikostí trénovaných na vysoké objemové datové sadě obsahující více než 300 milionů komentářů pokrývajících milion různých uživatelských účtů.

Architektura modelu reidentifikace Johnse Hopkinse, kde jsou základní komponenty 1) textový obsah, 2) funkce sub-Redditu a 3) čas publikace. Source: https://arxiv.org/pdf/2105.07263.pdf
Rámec, založený na datech z Redditu, bere v úvahu textový obsah, umístění sub-Redditu a čas publikace. Tyto tři faktory jsou kombinovány s různými metodami embedování, včetně jednorozměrných konvolucí a lineárních projekcí, a jsou podporovány mechanismem pozornosti a vrstvou max pooling.
Ačkoli se systém soustředí na textový domén, výzkumníci tvrdí, že jeho přístup lze přenést na analýzu videa nebo obrázků, protože odvozený algoritmus funguje na frekvenčních výskytech na vysoké úrovni, navzdory různým délkám vstupních datových bodů.
Vyhnout se ‘Topic-Drift’
Jedna past, do které se výzkum tohoto typu může dostat, a kterou autoři výslovně řeší v návrhu systému, je kladení nadměrného důrazu na opětovný výskyt určitých témat nebo motivů napříč příspěvky z různých účtů.
Ačkoli uživatel může skutečně psát opakovaně nebo iterativně v určité linii myšlení, téma se pravděpodobně vyvine a “driftuje” s časem, snižuje tak jeho použitelnost jako klíče k identitě. Autoři charakterizují tuto potenciální past jako “být správný z nesprávných důvodů” – past, kterou již dříve studovali na Univerzitě Johnse Hopkinse.
Metodika trénování
Systém používá trénování s mixovanými přesnostmi, inovaci představenou v roce 2018 firmami Baidu a NVIDIA (NVDA ), která snižuje požadavky na paměť o polovinu pomocí polopřesných plovoucích čísel: 16bitových plovoucích čísel místo 32bitových hodnot. Data byla trénována na dvou GPU V100, s průměrnou dobou trénování 72 hodin.
Schéma používá zjednodušené kódování textu, s konvolučními kódéry omezenými na 2-4 subwords. Ačkoli je průměrná délka pro rámce tohoto typu maximálně pět subwords, výzkumníci zjistili, že tato ekonomie nejenže neměla žádný dopad na výkon rankingu, ale že zvýšení subwords na maximum pět vlastně zhoršilo přesnost rankingu.
Datová sada
Výzkumníci odvodili datovou sadu 300 milionů příspěvků z Redditu z datové sady Pushshift Reddit Corpus z roku 2020, nazvanou Million User Dataset (MUD).
Datová sada se skládá ze všech příspěvků od autorů Redditu, kteří publikovali 100-1000 příspěvků mezi červencem 2015 a červnem 2016. Vzorkování v čase tímto způsobem poskytuje dostatečnou délku historie pro studii a snižuje dopad sporadických spamových příspěvků, které nejsou v rámci cílů výzkumu.

Statistika odvozené datové sady pro projekt reidentifikace Johnse Hopkinse.
Výsledky
Níže uvedená obrazovka ukazuje kumulativní zlepšení výsledků, když je testována přesnost rankingu v intervalu jedné hodiny během trénování. Po šesti hodinách systém překonává výkony předchozích iniciativ.

Ve studii ablace výzkumníci zjistili, že odstranění funkce sub-Redditu z pracovního postupu mělo překvapivě malý dopad na přesnost rankingu, což naznačuje, že systém generalizuje velmi efektivně, s robustním nástrojem funkcí.
Frekvence příspěvků jako signatura reidentifikace
To také naznačuje, že rámec je vysoce přenositelný do jiných systémů komentářů nebo publikování, kde je k dispozici pouze textový obsah a datum/čas publikace – a že četnost příspěvků je sama o sobě cenným doplňkovým ukazatelem skutečného textového obsahu.
Výzkumníci poznamenávají, že pokus o provedení stejné odhady v rámci obsahu jednoho sub-Redditu představuje větší výzvu, protože sub-Reddit sám slouží jako proxy tématu, a další schéma by pravděpodobně bylo zapotřebí k vyplnění této role.
Studie dosáhla přesto slibných výsledků v rámci těchto omezení, s jediným varováním, že systém funguje lépe při vysokých objemech a může mít zvýšenou obtížnost při reidentifikaci uživatelů, kde je objem příspěvků nízký.
Rozvoj práce
Na rozdíl od mnoha iniciativ supervizovaného učení jsou funkce ve schématu reidentifikace Johnse Hopkinse diskrétní a robustní enough, že výkon systému se významně zlepšuje, jak se zvyšuje objem dat.
Výzkumníci projevují zájem o rozvoj systému přijetím více granulárního přístupu k analýze času publikace, protože často předvídatelné plány rotačních spammerů (automatizovaných nebo jinak) jsou náchylné k identifikaci tímto přístupem, a to by umožnilo buď lépe eliminovat robotický obsah ze studie zaměřené primárně na obtížné uživatele, nebo pomoci při identifikaci automatizovaného obsahu.












