Unghiul lui Anderson
Reidentificarea comentatorilor de social media interziși cu ajutorul învățării automate

Cercetătorii de la Universitatea Johns Hopkins au dezvoltat o abordare Deep Metric pentru identificarea comentatorilor online care ar putea avea conturi suspendate anterior sau care ar putea utiliza multiple conturi pentru a manipula bunăvoința comunităților online, cum ar fi Reddit și Twitter.
Abordarea, prezentată într-un articol nou condus de cercetătorul NLP Aleem Khan, nu necesită ca datele de intrare să fie annotate automat sau manual și îmbunătățește rezultatele încercărilor anterioare, chiar și atunci când sunt disponibile doar mostre mici de text și când textul nu a fost prezent în setul de date la momentul antrenării.
Sistemul oferă un schema simplă de augmentare a datelor, cu încorporări de diferite dimensiuni antrenate pe un set de date de mare volum care conține peste 300 de milioane de comentarii care acoperă un milion de conturi de utilizator diferite.

Arhitectura modelului de reidentificare al Universității Johns Hopkins, unde componentele esențiale sunt 1) conținutul text, 2) funcția sub-Reddit și 3) data și ora publicării. Sursă: https://arxiv.org/pdf/2105.07263.pdf
Cadru, bazat pe datele de utilizare a Reddit, ia în considerare conținutul text, plasarea sub-Reddit și data publicării. Cei trei factori sunt combinați cu metode de încorporare diverse, incluzând convoluții unidimensionale și proiecții liniare, și sunt asistate de un mecanism de atenție și de un strat de pooling maxim.
Deși sistemul se concentrează pe domeniul text, cercetătorii susțin că abordarea sa poate fi translată în analiza videourilor sau a imaginilor, deoarece algoritmul derivat funcționează pe frecvențe de apariție la un nivel ridicat, în ciuda unei varietăți de lungimi de intrare pentru punctele de date de antrenare.
Evitarea “Derapării de Temă”
O capcană în care cercetările de acest fel pot cădea și pe care autorii au abordat-o în mod expres în proiectarea sistemului este de a pune accent excesiv pe recurența anumitor teme sau motive în postările de pe conturi diferite.
Deși un utilizator poate, într-adevăr, să scrie în mod repetitiv sau iterativ într-un anumit lanț de gândire, tema este probabil să evolueze și să “derapeze” în timp, diminuându-și valoarea ca cheie de identitate. Autorii caracterizează această capcană potențială ca “a fi corect pentru motive greșite” – o capcană studiată anterior la Universitatea Johns Hopkins.
Metodologia de Antrenare
Sistemul utilizează antrenarea cu precizie mixtă, o inovație prezentată în 2018 de Baidu și NVIDIA (NVDA ), care reduce cerințele de memorie la jumătate prin utilizarea valorilor cu virgulă mobilă de 16 biți în loc de 32 de biți. Datele au fost antrenate pe două GPU V100, timpul mediu de antrenare fiind de 72 de ore.
Schema utilizează o codificare simplificată a textului, cu codificatori convoluționali limitați la 2-4 subcuvinte. Deși lungimea medie pentru cadre de acest fel este de maximum cinci subcuvinte, cercetătorii au descoperit că această economie nu a avut niciun impact asupra performanței de clasificare și că creșterea numărului de subcuvinte la maximum cinci a înrăutățit acuratețea clasificării.
Setul de Date
Cercetătorii au derivat un set de date de 300 de milioane de postări de pe Reddit din setul de date Pushshift Reddit Corpus din 2020, numit Setul de Date al Milionului de Utilizatori (MUD).
Setul de date cuprinde toate postările de pe Reddit ale autorilor care au publicat între 100 și 1000 de postări între iulie 2015 și iunie 2016. Eșantionarea în timp în acest mod oferă o lungime istorică adecvată pentru studiu și reduce impactul postărilor de spam ocazionale care nu sunt în sfera de interes a obiectivelor cercetării.

Statistici despre setul de date derivat pentru proiectul de reidentificare al Universității Johns Hopkins.
Rezultate
Imaginea de mai jos arată îmbunătățirea cumulativă a rezultatelor pe măsură ce acuratețea clasificării este testată la intervale de o oră în timpul antrenării. După șase ore, sistemul depășește realizările de bază ale inițiativelor anterioare conexe.

Într-un studiu de ablație, cercetătorii au descoperit că eliminarea funcției sub-Reddit din fluxul de lucru a avut un impact surprinzător de mic asupra acurateței clasificării, sugerând că sistemul generalizează foarte bine, cu unelte de caracteristici robuste.
Frecvența Postărilor ca Semnătură de Reidentificare
Acest lucru indică, de asemenea, faptul că cadrul este foarte transferabil la alte sisteme de comentarii sau publicare unde sunt disponibile doar conținutul text și data/ora publicării – și, în esență, că frecvența temporală a postărilor este în sine un indicator valoros de identitate.
Cercetătorii observă că încercarea de a efectua aceeași estimare în cadrul conținutului unei singure sub-Reddit prezintă o provocare mai mare, deoarece sub-Reddit-ul însuși servește ca proxy de temă, și ar fi necesară o schemă suplimentară pentru a îndeplini acest rol.
Studiul a reușit, cu toate acestea, să obțină rezultate promițătoare în cadrul acestor constrângeri, cu singura rezervă că sistemul funcționează mai bine la volume mari și poate avea dificultăți crescute în reidentificarea utilizatorilor atunci când volumul de postări este scăzut.
Dezvoltarea Lucrării
În contrast cu multe inițiative de învățare supravegheată, caracteristicile din schema de reidentificare a Universității Johns Hopkins sunt discrete și suficient de robuste, astfel încât performanța sistemului se îmbunătățește semnificativ pe măsură ce volumul de date crește.
Cercetătorii exprimă interesul de a dezvolta sistemul prin adoptarea unei abordări mai granulare a analizei timpilor de publicare, deoarece programările deseori previzibile ale spammerilor (automate sau nu) sunt susceptibile de a fi identificate prin această abordare, și ar face posibilă eliminarea mai eficientă a conținutului robotic dintr-un studiu axat în primul rând pe utilizatorii vexațioși, sau ar ajuta la identificarea conținutului automat.
pe timpuri, deoarece programările deseori previzibile ale spammerilor (automate sau nu) sunt susceptibile de a fi identificate prin această abordare, și ar face posibilă eliminarea mai eficientă a conținutului robotic dintr-un studiu axat în primul rând pe utilizatorii vexațioși, sau ar ajuta la identificarea conținutului automat.












