Unghiul lui Anderson

Detectarea recenziilor online malicioase “profesionale” cu Machine Learning

mm
Adaugă Unite.AI la sursele tale preferate pe Google

O nouă colaborare de cercetare între China și SUA oferă o modalitate de detectare a recenziilor malicioase de comerț electronic, proiectate pentru a submina concurenții sau pentru a facilita șantajul, prin exploatarea comportamentului specific al acestor recenzori.

Sistemul, intitulat model de detectare a utilizatorilor malicioși (MMD), utilizează Învățarea Metrică, o tehnică comun utilizată în viziunea computerizată și sistemele de recomandare, împreună cu o Rețea Neuronală Recurentă (RNN), pentru a identifica și a eticheta outputul acestor recenzori, pe care articolul îi numește Utilizatori Malicioși Profesionali (PMU).

Minunat! 1 stea

Majoritatea recenziilor online de comerț electronic oferă două forme de feedback de la utilizator: o evaluare cu stele (sau o evaluare din 10) și o recenzie bazată pe text, și, în mod normal, acestea vor corespunde logic (de exemplu, o recenzie proastă va fi însoțită de o evaluare scăzută).

PMU, însă, subvertă în mod normal această logică, fie prin lăsarea unei recenzii proaste cu o evaluare ridicată, fie a unei evaluări slabe însoțite de o recenzie bună.

Acest lucru permite recenziei utilizatorului să cauzeze prejudicii de reputație fără a declanșa filtrele relativ simple implementate de site-urile de comerț electronic pentru a identifica și a aborda outputul recenziilor negative malicioase. Dacă un filtru bazat pe Procesarea Limbajului Natural (NLP) identifică invective în textul recenziei, acest “steag” este efectiv anulat de evaluarea cu stele (sau zecimală) ridicată pe care PMU a asignat-o, făcând conținutul malicios “neutru” din punct de vedere statistic.

Un exemplu de cum o recenzie malicioasă poate fi amestecată, statistic, cu recenzii autentice, din punctul de vedere al unui sistem de filtrare colaborativ care încearcă să identifice un astfel de comportament. Sursă: https://arxiv.org/pdf/2205.09673.pdf

Un exemplu de cum o recenzie malicioasă poate fi amestecată, statistic, cu recenzii autentice, din punctul de vedere al unui sistem de filtrare colaborativ care încearcă să identifice un astfel de comportament. Sursă: https://arxiv.org/pdf/2205.09673.pdf

Noul articol notează că intenția unui PMU este adesea de a extorca bani de la retailerii online în schimbul modificării recenziilor negative și/sau a promisiunii de a nu posta alte recenzii negative. În unele cazuri, actorii sunt ad hoc indivizi care caută reduceri, deși, de obicei, PMU este angajat în mod casual de către concurenții victimei.

Masquerarea recenziilor negative

Generația actuală de detectoare automate pentru astfel de recenzii utilizează Filtrarea Colaborativă sau un model bazat pe conținut și caută “outliers” clare și neambigue – recenzii care sunt uniform negative în ambele metode de feedback și care se abat semnificativ de la tendința generală a sentimentului de recenzie și a evaluării.

Altă semnătură clasică pe care aceste filtre se bazează este o frecvență ridicată de postare, în timp ce un PMU va posta strategic și numai ocazional (deoarece fiecare recenzie poate reprezenta fie o comandă individuală, fie o etapă într-o strategie mai lungă proiectată pentru a ofusca metrica “frecvență”).

Prin urmare, cercetătorii noului articol au integrat polaritatea ciudată a recenziilor malicioase profesionale într-un sistem dedicat, rezultând într-un algoritm care este aproape la fel de bun ca și abilitatea unui recenzor uman de a “mirosi un șarpe” la disparitatea dintre evaluare și conținutul textului recenziei.

Arhitectura conceptuală pentru MMD, compusă din două module centrale: Profilarea Utilizatorilor Malicioși (MUP) și Învățarea Metrică cu Atenție (MLC, în gri).

Arhitectura conceptuală pentru MMD, compusă din două module centrale: Profilarea Utilizatorilor Malicioși (MUP) și Învățarea Metrică cu Atenție (MLC, în gri).

Comparație cu abordările anterioare

Deoarece MMD este, după cum afirmă autorii, primul sistem care încearcă să identifice PMU pe baza stilului lor de postare schizofrenic, nu există lucrări anterioare directe cu care să se compare. Prin urmare, cercetătorii au comparat sistemul lor cu o serie de algoritmi de componente pe care filtrele automate tradiționale se bazează frecvent, inclusiv Clustering K-means++; detectarea statistică a outlier-ilor (SOD); Hysad; Semi-sad; CNN-sad; și Sistemul de Recomandare de Detectare a Utilizatorilor Slanderoși (SDRS).

Testat împotriva seturilor de date etichetate de la Amazon și Yelp, MMD poate identifica detractorii online profesioniști cu cel mai ridicat nivel de acuratețe, afirmă autorii. Bold reprezintă MMD, în timp ce asteriscul (*) indică cea mai bună performanță. În acest caz, MMD a fost depășit în doar două sarcini, de o tehnologie independentă (MUP) care este deja încorporată în acesta, dar care nu este echipată în mod implicit pentru sarcina respectivă.

Testat împotriva seturilor de date etichetate de la Amazon [securities_stock_price_tag symbol="amzn" exchange="nasdaq"] și Yelp, MMD poate identifica detractorii online profesioniști cu cel mai ridicat nivel de acuratețe, afirmă autorii. Bold reprezintă MMD, în timp ce asteriscul (*) indică cea mai bună performanță. În acest caz, MMD a fost depășit în doar două sarcini, de o tehnologie independentă (MUP) care este deja încorporată în acesta, dar care nu este echipată în mod implicit pentru sarcina respectivă.

În acest caz, MMD a fost comparat cu seturile de date neetichetate de la Taobao și Jindong, făcându-l efectiv o sarcină de învățare nesupervizată. Din nou, MMD este depășit doar de una dintre tehnologiile sale constitutive, adaptate puternic pentru sarcina respectivă în scopul testării.

În acest caz, MMD a fost comparat cu seturile de date neetichetate de la Taobao și Jindong, făcându-l efectiv o sarcină de învățare nesupervizată. Din nou, MMD este depășit doar de una dintre tehnologiile sale constitutive, adaptate puternic pentru sarcina respectivă în scopul testării.

Cercetătorii observă:

‘Pe toate cele patru seturi de date, modelul nostru propus MMD (MLC+MUP) depășește toate liniile de bază în ceea ce privește scorul F. Notați că MMD este o combinație a MLC și MUP, ceea ce asigură superioritatea sa față de modelele supravegheate și nesupravegheate în general.’

Articolul sugerează, de asemenea, că MMD ar putea servi ca o metodă utilă de preprocesare pentru sistemele automate de filtrare tradiționale și oferă rezultate experimentale pe o serie de seturi de date, inclusiv Filtrarea Colaborativă Bazată pe Utilizatori (UBCF), Filtrarea Colaborativă Bazată pe Articole (IBCF), Factorizarea Matricelor (MF-eALS), Clasificarea Personalizată Bayesiană (MF-BPR) și Filtrarea Colaborativă Neuronală (NCF).

În ceea ce privește Raportul de Lovitură (HR) și Câștigul Cumulativ Discountat Normalizat (NDCG) în rezultatele acestor îmbunătățiri testate, autorii afirmă:

‘Dintre toate cele patru seturi de date, MMD îmbunătățește semnificativ modelele de recomandare în ceea ce privește HR și NDCG. În special, MMD poate îmbunătăți performanța HR cu 28,7% în medie și NDCG cu 17,3% în medie.

‘Prin ștergerea utilizatorilor malicioși profesioniști, MMD poate îmbunătăți calitatea seturilor de date. Fără aceste recenzii false ale utilizatorilor malicioși, setul de date devine mai [intuitiv].’

Articolul este intitulat Detectarea Utilizatorilor Malicioși Profesionali cu Învățarea Metrică în Sistemele de Recomandare și provine de la cercetători de la Departamentul de Știință a Calculatoarelor și Tehnologiei de la Universitatea Jilin; Laboratorul Cheie pentru Procesarea Inteligentă a Informațiilor de la Academia Chineză de Știință din Beijing; și Școala de Afaceri de la Rutgers din New Jersey.

Date și Abordare

Detectarea PMU este o provocare multimodală, deoarece două parametri neechivalenți (o evaluare numerică cu stele/zecimale și o recenzie bazată pe text) trebuie luați în considerare. Autorii noului articol afirmă că nicio lucrare anterioară nu a abordat această provocare.

MMD utilizează o Rețea Neuronală Recurentă cu Atenție Duală Ierarhică (HDAN) pentru a asimila conținutul recenziei într-un scor de sentiment.

Proiectarea unei recenzii într-un scor de sentiment cu HDAN, care contribuie la încorporarea cuvintelor și a propozițiilor pentru a obține un scor de sentiment.

Proiectarea unei recenzii într-un scor de sentiment cu HDAN, care contribuie la încorporarea cuvintelor și a propozițiilor pentru a obține un scor de sentiment.

HDAN utilizează mecanisme de atenție pentru a atribui greutăți fiecărui cuvânt și fiecărei propoziții. În imaginea de mai sus, autorii afirmă că cuvântul mai slab ar trebui să primească în mod clar o greutate mai mare decât cuvintele concurente din recenzie.

Pentru proiect, HDAN a luat evaluările pentru produse din patru seturi de date ca adevărul de bază. Seturile de date au fost Amazon.com; Yelp pentru RecSys (2013); și două seturi de date “reale” (și nu experimentale), de la Taobao și Jindong.

MMD utilizează Învățarea Metrică, care încearcă să estimeze o distanță precisă între entități pentru a caracteriza ansamblul de relații din date.

MMD începe cu o încodare cu un singur bit pentru a selecta utilizatorul și articolul, prin intermediul unui Model de Factori Latenți (LFM), care obține un scor de evaluare de bază. Între timp, HDAN proiectează conținutul recenziei în scorul de sentiment ca date auxiliare.

Rezultatele sunt apoi procesate într-un model de Profilare a Utilizatorilor Malicioși (MUP), care produce vectorul de decalaj de sentiment – disparitatea dintre evaluare și scorul de sentiment estimat al conținutului textului recenziei. În acest fel, pentru prima dată, PMU pot fi categorisiți și etichetați.

Învățarea Metrică cu Atenție pentru clustering.

Învățarea Metrică cu Atenție pentru clustering.


Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai