Angle d’Anderson

Détection de faux avis en ligne malveillants avec l’apprentissage automatique

mm
Ajouter Unite.AI à vos sources préférées sur Google

Une nouvelle collaboration de recherche entre la Chine et les États-Unis propose un moyen de détecter les faux avis de commerce électronique conçus pour miner la réputation des concurrents ou faciliter le chantage, en exploitant le comportement caractéristique de ces auteurs de faux avis.

Le système, intitulé modèle de détection d’utilisateurs malveillants (MMD), utilise l’apprentissage métrique, une technique communément utilisée dans la vision par ordinateur et les systèmes de recommandation, ainsi qu’un réseau neuronal récurrent (RNN), pour identifier et étiqueter les sorties de ces auteurs de faux avis, que l’article nomme utilisateurs malveillants professionnels (PMU).

Très bien! 1 étoile

La plupart des avis en ligne de commerce électronique fournissent deux formes de rétroaction de l’utilisateur: une note (ou une note sur 10) et un avis basé sur du texte, et dans un cas typique, ceux-ci correspondent logiquement (c’est-à-dire qu’un mauvais avis sera accompagné d’une note basse).

Les PMU, cependant, subvertissent généralement cette logique, en laissant un mauvais avis basé sur du texte avec une note élevée, ou une mauvaise note accompagnée d’un bon avis.

Cela permet à l’avis de l’utilisateur de causer des dommages à la réputation sans déclencher les filtres relativement simples déployés par les sites de commerce électronique pour identifier et traiter les sorties des auteurs de faux avis malveillants. Si un filtre basé sur le traitement automatique des langues naturelles (NLP) identifie des invectives dans le texte d’un avis, ce « drapeau » est effectivement annulé par la note étoilée (ou décimale) élevée que le PMU a également attribuée, ce qui rend effectivement le contenu malveillant « neutre » du point de vue statistique.

Un exemple de la façon dont un avis malveillant peut être mélangé, statistiquement, avec des avis réels, du point de vue d'un système de filtrage collaboratif qui tente d'identifier un tel comportement. Source: https://arxiv.org/pdf/2205.09673.pdf

Un exemple de la façon dont un avis malveillant peut être mélangé, statistiquement, avec des avis réels, du point de vue d’un système de filtrage collaboratif qui tente d’identifier un tel comportement. Source: https://arxiv.org/pdf/2205.09673.pdf

La nouvelle étude note que l’intention d’un PMU est souvent d’extorquer de l’argent aux détaillants en ligne en échange de la modification d’avis négatifs, et/ou d’une promesse de ne pas publier d’autres avis négatifs. Dans certains cas, les acteurs sont ad hoc des individus recherchant des remises, bien que fréquemment le PMU soit employé de manière occasionnelle par les concurrents de la victime.

Masquage des avis négatifs

La génération actuelle de détecteurs automatisés pour ces avis utilise le filtrage collaboratif ou un modèle basé sur le contenu, et recherche des « outliers » clairs et non ambigus – des avis qui sont uniformément négatifs dans les deux méthodes de rétroaction, et qui divergent notablement de la tendance générale du sentiment et de la note.

L’autre signature classique que ces filtres utilisent est une fréquence de publication élevée, alors qu’un PMU publie de manière stratégique et occasionnelle (puisqu’une seule critique peut représenter soit une commission individuelle, soit une étape dans une stratégie plus longue conçue pour obscurcir la « fréquence » métrique).

Par conséquent, les chercheurs de la nouvelle étude ont intégré la polarité étrange des avis malveillants professionnels dans un système dédié, aboutissant à un algorithme qui est presque à la hauteur de la capacité d’un réviseur humain à « sentir un rat » dans la disparité entre la note et le contenu textuel de l’avis.

L'architecture conceptuelle pour MMD, composée de deux modules centraux: Profilage d'utilisateur malveillant (MUP) et Apprentissage métrique d'attention (MLC, en gris).

L’architecture conceptuelle pour MMD, composée de deux modules centraux: Profilage d’utilisateur malveillant (MUP) et Apprentissage métrique d’attention (MLC, en gris).

Comparaison avec les approches antérieures

Puisque MMD est, selon les auteurs, le premier système à tenter d’identifier les PMU en fonction de leur style de publication schizophrénique, il n’y a pas d’œuvres antérieures directes pour les comparer. Par conséquent, les chercheurs ont opposé leur système à un certain nombre d’algorithmes de composants sur lesquels les filtres automatisés traditionnels dépendent fréquemment, y compris le regroupement K-means++; la détection d’anomalies statistiques (SOD); Hysad; Semi-sad; CNN-sad; et Système de recommandation de détection d’utilisateurs calomnieux (SDRS).

Testé contre des ensembles de données étiquetés d'Amazon et Yelp, MMD est capable d'identifier les détracteurs en ligne professionnels avec le plus haut taux de précision, selon les auteurs. Le gras représente MMD, tandis que l'astérisque (*) indique la meilleure performance. Dans ce cas, MMD n'a été battu que dans deux tâches, par une technologie autonome (MUP) qui est déjà intégrée à celle-ci, mais qui n'est pas outillée par défaut pour la tâche en question.

Testé contre des ensembles de données étiquetés d’Amazon [securities_stock_price_tag symbol="amzn" exchange="nasdaq"] et Yelp, MMD est capable d’identifier les détracteurs en ligne professionnels avec le plus haut taux de précision, selon les auteurs. Le gras représente MMD, tandis que l’astérisque (*) indique la meilleure performance. Dans ce cas, MMD n’a été battu que dans deux tâches, par une technologie autonome (MUP) qui est déjà intégrée à celle-ci, mais qui n’est pas outillée par défaut pour la tâche en question.

Dans ce cas, MMD a été opposé à des ensembles de données non étiquetés de Taobao et Jindong, ce qui en fait effectivement une tâche d'apprentissage non supervisée. À nouveau, MMD n'est amélioré que par l'une de ses propres technologies constituantes, fortement adaptée à la tâche pour les besoins de la tests.

Dans ce cas, MMD a été opposé à des ensembles de données non étiquetés de Taobao et Jindong, ce qui en fait effectivement une tâche d’apprentissage non supervisée. À nouveau, MMD n’est amélioré que par l’une de ses propres technologies constituantes, fortement adaptée à la tâche pour les besoins de la tests.

Les chercheurs observent:

‘[Sur] tous les quatre ensembles de données, notre modèle proposé MMD (MLC+MUP) surpasse tous les modèles de base en termes de score F. Notez que MMD est une combinaison de MLC et MUP, ce qui assure sa supériorité sur les modèles supervisés et non supervisés en général.’

L’article suggère également que MMD pourrait servir de méthode de prétraitement utile pour les systèmes de filtres automatisés traditionnels, et fournit des résultats expérimentaux sur un certain nombre d’ensembles de données, y compris le filtrage collaboratif basé sur les utilisateurs (UBCF), le filtrage collaboratif basé sur les éléments (IBCF), la factorisation de matrice (MF-eALS), le classement personnalisé bayésien (MF-BPR), et le filtrage collaboratif neuronal (NCF).

En termes de taux de réussite (HR) et gain cumulatif normalisé (NDCG) dans les résultats de ces augmentations testées, les auteurs déclarent:

‘Parmi tous les quatre ensembles de données, MMD améliore considérablement les modèles de recommandation en termes de HR et NDCG. Plus précisément, MMD peut améliorer la performance de HR de 28,7 % en moyenne et NDCG de 17,3 % en moyenne.

‘En supprimant les utilisateurs malveillants professionnels, MMD peut améliorer la qualité des ensembles de données. Sans ces utilisateurs malveillants professionnels, les données deviennent plus [intuitives].’

L’article est intitulé Détection d’utilisateurs malveillants professionnels avec l’apprentissage métrique dans les systèmes de recommandation, et provient de chercheurs du Département d’informatique et de technologie de l’Université de Jilin; du Laboratoire clé du traitement intelligent de l’information de l’Académie des sciences de Chine à Pékin; et de l’École de commerce de Rutgers dans le New Jersey.

Données et approche

La détection des PMU est un défi multimodal, puisque deux paramètres non équivalents (une note numérique ou décimale et un avis basé sur du texte) doivent être pris en compte. Les auteurs de la nouvelle étude affirment que aucun travail antérieur n’a abordé ce défi.

MMD emploie un réseau neuronal récurrent à double attention hiérarchique (HDAN) pour assimiler le contenu de l’avis dans un score de sentiment.

Projection d'un avis dans un score de sentiment avec HDAN, qui contribue à l'intégration de mots et à l'intégration de phrases pour obtenir un score de sentiment.

Projection d’un avis dans un score de sentiment avec HDAN, qui contribue à l’intégration de mots et à l’intégration de phrases pour obtenir un score de sentiment.

HDAN utilise des mécanismes d’attention pour attribuer des poids à chaque mot, et à chaque phrase. Dans l’image ci-dessus, les auteurs déclarent que le mot moins performant devrait clairement être attribué un poids plus important que les mots concurrents dans l’avis.

Pour le projet, HDAN a pris les notes pour les produits à travers quatre ensembles de données comme vérité terrain. Les ensembles de données étaient Amazon.com; Yelp pour RecSys (2013); et deux ensembles de données « réels » (plutôt que des ensembles de données expérimentaux), provenant de Taobao et Jindong.

MMD utilise l’apprentissage métrique, qui tente d’estimer une distance précise entre les entités afin de caractériser l’ensemble des relations dans les données.

MMD commence avec un codage à chaud pour sélectionner l’utilisateur et l’élément, via un modèle de facteur latent (LFM), qui obtient un score de note de base. Pendant ce temps, HDAN projette le contenu de l’avis dans le score de sentiment comme données annexes.

Les résultats sont ensuite traités dans un modèle de profilage d’utilisateur malveillant (MUP), qui produit le vecteur d’écart de sentiment – la disparité entre la note et le score de sentiment estimé du contenu textuel de l’avis. De cette façon, pour la première fois, les PMU peuvent être catégorisés et étiquetés.

Apprentissage métrique d'attention pour le regroupement.

Apprentissage métrique d’attention pour le regroupement.

L’apprentissage métrique pour le regroupement (MLC) utilise ces étiquettes de sortie pour établir une métrique par rapport à laquelle la probabilité qu’un avis d’utilisateur soit malveillant est calculée.

Tests humains

En plus des résultats quantitatifs détaillés ci-dessus, les chercheurs ont mené une étude utilisateur qui a chargé 20 étudiants d’identifier les avis malveillants, sur la base uniquement du contenu et de la note. Les participants ont été invités à noter les avis 0 (pour les « réviseurs normaux ») ou 1 (pour un utilisateur malveillant professionnel).

Sur un total de 50/50 entre les avis normaux et malveillants, les étudiants ont étiqueté 24 vrais positifs et 24 vrais négatifs en moyenne. En comparaison, MMD a pu étiqueter 23 vrais positifs et 24 vrais négatifs en moyenne, fonctionnant presque au niveau de discernement humain, et surpassant les références pour la tâche.

Étudiants vs. MMD. L'astérisque (*) indique les meilleurs résultats, et le gras indique les résultats de MMD.

Étudiants vs. MMD. L’astérisque (*) indique les meilleurs résultats, et le gras indique les résultats de MMD.

Les auteurs concluent:

‘En essence, MMD est une solution générique, qui peut non seulement détecter les utilisateurs malveillants professionnels explorés dans cet article, mais également servir de fondement général pour la détection d’utilisateurs malveillants. Avec plus de données, telles que des images, des vidéos ou des sons, l’idée de MMD peut être instructive pour détecter l’écart de sentiment entre leur titre et leur contenu, ce qui a un avenir radieux pour contrer différentes stratégies de masquage dans différentes applications.’

 

Publié pour la première fois le 20 mai 2022.

Écrivain en apprentissage automatique, spécialiste de domaine en synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Portfolio site : martinanderson.ai
Contact : martin@martinanderson.ai