Modèles et plateformes d’IA

Anomalies commerciales : prévention de la fraude avec la détection d’anomalies

mm
Ajouter Unite.AI à vos sources préférées sur Google

Détection d’anomalies avec MIDAS

La détection d’anomalies est devenue l’un des outils de machine learning les plus utiles des cinq dernières années. Elle peut être utilisée pour la fraude, le contrôle de la qualité, etc. Est-il possible d’isoler les fraudeurs sur les sites de commentaires en ligne ? Les transactions financières frauduleuses peuvent-elles être détectées au moment où elles se produisent ? Les données de capteurs en temps réel peuvent-elles informer sur les défaillances du réseau électrique avant qu’elles ne se produisent ?

La détection d’anomalies fournit des réponses à ces questions. L’identification des anomalies dans les données est une tâche essentielle pour la compréhension des données. En exposant de grands ensembles de données à des outils de machine learning et à des méthodes statistiques, les modèles normaux dans les données peuvent être appris. Lorsque des événements incohérents se produisent, les algorithmes de détection d’anomalies peuvent isoler les comportements anormaux et signaler les événements qui ne correspondent pas aux modèles appris. Une telle fonctionnalité est cruciale dans de nombreux cas d’utilisation commerciaux. La détection d’anomalies permet des applications dans un grand nombre de secteurs, de la sécurité à la finance et à la surveillance IoT.

Les graphes à grande échelle sont aujourd’hui omniprésents et constituent une représentation courante des structures de données. Ils alimentent à la fois les applications en ligne et hors ligne. Quelques exemples en ligne sont les grands réseaux sociaux, les moteurs de recommandation de produits et les graphes de transactions financières. Hors ligne, les réseaux routiers, les plateformes IoT et les capteurs de tension dans les réseaux électriques sont toutes des sources de grandes quantités de données sous forme de graphes. Le fait d’avoir des données représentées sous forme de graphes présente à la fois des avantages et des défis pour les propriétaires de ces ensembles de données. D’une part, cela permet de représenter les points de données et leurs relations dans un espace multidimensionnel. D’autre part, des algorithmes évolutifs pour l’analyse et l’interprétation des données sont nécessaires. Cela a conduit à une augmentation de la recherche sur des méthodes telles que la détection d’anomalies sur les données de graphes.

Examinons de plus près un algorithme d’état de l’art développé pour la détection d’anomalies dans les données de graphes dynamiques.

MIDAS

Microcluster-Based Detector of Anomalies in Edge Streams (MIDAS) est un algorithme qui traite la détection d’anomalies sur les données de graphes dynamiques. Il a été développé par des chercheurs de l’Université nationale de Singapour qui affirment que leur méthode surpasse les approches de l’état de l’art. Leur méthode atténue le principal défaut des implémentations précédentes de détection d’anomalies :

Voici la nouvelle référence pour la détection d’anomalies développée par Siddarth Bhatia et son équipe à l’Université de Singapour

Présentation de MIDAS : une nouvelle référence pour la détection d'anomalies dans les graphes

Présentation de MIDAS : une nouvelle référence pour la détection d’anomalies dans les graphes. Image source : Blog

Représentation des données sous forme de graphique statique

Les graphiques statiques ne contiennent que des informations de connectivité et ignorent les informations temporelles. Ils sont également appelés instantanés de graphes et ne peuvent être utilisés que pour détecter des entités de graphes inhabituelles (par exemple, des nœuds, des arêtes ou des sous-graphes suspects). Cependant, pour de nombreuses applications pratiques, l’aspect temporel est également important : il est pertinent de savoir quand la structure du graphique a changé. Pour illustrer, dans un graphique statique représentant un flux de trafic réseau, une arête n’indique qu’il existe une connexion entre une adresse IP source et une adresse IP de destination. Mais la description temporelle de l’arête est manquante et donc le moment où les deux adresses se sont connectées est inconnu. Puisque les graphiques statiques ne peuvent pas modéliser ces informations temporelles, les méthodes de détection d’anomalies basées sur de tels graphes ne fournissent qu’un support limité pour les applications du monde réel.

En revanche, MIDAS gère les données stockées dans un graphique dynamique. Chacun des éléments du graphique a un horodatage associé, représentant le moment où cet élément a été ajouté au graphique. En poursuivant l’exemple ci-dessus, un graphique de trafic réseau dynamique informerait également sur quand une connexion entre deux adresses IP s’est produite. L’horodatage change chaque fois qu’une arête ou un nœud existant est mis à jour, ou lorsqu’une nouvelle arête est ajoutée au graphique. Ainsi, les graphiques dynamiques sont une structure qui évolue dans le temps et qui convient mieux à de nombreuses applications du monde réel, qui sont dynamiques par nature. Ils permettent d’utiliser à la fois les informations de connectivité et les informations temporelles pour la détection d’éléments de graphes suspects. Sur la base de cette capacité, MIDAS peut détecter les anomalies en temps réel et offre ainsi un support pour de nombreux cas d’utilisation commerciaux.

MIDAS est optimisé pour fonctionner sur des données de graphes dynamiques. Comme nous l’avons vu ci-dessus, les graphiques dynamiques permettent de représenter des données qui varient dans le temps. Cependant, cela signifie également que la structure du graphique lui-même change dans le temps. Cela introduit certains défis pour les algorithmes de détection d’anomalies qui visent à utiliser ces données dans des applications en temps réel. Un exemple est la scalabilité de la méthode par rapport aux caractéristiques du graphique qui changent. Étant donné les grands volumes de données correspondant à certaines applications, les algorithmes doivent être linéairement évolutifs par rapport à la taille du graphique. MIDAS s’exécute en ligne et traite chaque arête en temps constant et en mémoire constante. Les auteurs rapportent également que l’algorithme s’exécute « 162-633 fois plus vite que les approches de l’état de l’art ». Cela rend l’algorithme adapté aux applications en temps réel, où le traitement de flux de données de grande volume est nécessaire.

Quels cas d’utilisation commerciaux ont besoin de MIDAS ?

Pour avoir un aperçu de la détection d’anomalies utilisée dans le monde des affaires d’aujourd’hui, nous avons interviewé le fournisseur de crypto-monnaies canadien NDAX. NDAX utilise la détection d’anomalies dans trois domaines de son entreprise. Les opérations commerciales générales, le département marketing et l’équipe de conformité. La détection d’anomalies aide à identifier les bogues, ce qui leur permet d’améliorer les performances du site Web et le processus d’intégration des clients. Cela leur permet également de fournir des conseils aux équipes de développement de logiciels et d’exploitation pour résoudre ces problèmes. Le trafic du site Web est un autre domaine qui peut tirer parti de la puissance de la détection d’anomalies. Comprendre les valeurs aberrantes du trafic du site Web fournit une meilleure compréhension à l’équipe marketing, ce qui leur permet d’identifier si une campagne marketing fonctionne ou non. Cela donne ainsi une image plus claire de l’endroit où il faut concentrer leurs efforts. Notre dernier exemple est la façon dont l’anomalie d’inscription du client aide l’équipe de conformité à identifier les fraudes potentielles et à réduire les risques pour les clients.

Dans notre discussion avec le directeur de la conformité de NDAX, Julia Baranovskaya, elle met en évidence l’importance de la détection d’anomalies qui a été soulignée pendant la pandémie actuelle. Il y a eu une augmentation de 300 % des fraudes détectées au cours des derniers mois. Les temps désespérés combinés à un trafic en ligne élevé invitent à des arnaques de toutes sortes qui ciblent les chômeurs et les personnes âgées. Avec la détection d’anomalies, nous sommes maintenant en mesure de convertir ces valeurs aberrantes en indicateurs de fraude ou de tendances. Le graphique suivant montre comment la fraude a fluctué au cours de la première moitié de cette année.

NDAX a constaté une augmentation de la fraude au deuxième trimestre, en particulier des arnaques impliquant les personnes âgées et les offres d’emploi fictives.

Et votre entreprise ?

Les algorithmes de détection d’anomalies peuvent aider les entreprises à identifier et à réagir aux points de données inhabituels dans de multiples scénarios. Un système de sécurité bancaire peut employer la détection d’anomalies pour l’identification des transactions frauduleuses. De même, les propriétaires d’usines de fabrication s’appuient sur la détection d’anomalies pour faire face aux équipements défectueux et mettre en œuvre des mesures de maintenance prédictive. Dans les réseaux de capteurs IoT, la détection d’anomalies est utilisée dans le cadre des solutions de surveillance des conditions et pour la prévention du déploiement de logiciels malveillants indésirables. Le point clé est clair : les entreprises qui ont accès à de grandes quantités de données peuvent employer MIDAS (et d’autres algorithmes de détection d’anomalies) pour identifier des modèles inhabituels en temps réel.

Comment vos données sont-elles structurées et comment pourrions-nous vous aider à configurer une solution de détection d’anomalies moderne ? Contactez-nous et faites-le-nous savoir. L’équipe de sciences des données de Blue Orange Digital est heureuse de faire fonctionner la détection d’anomalies pour votre bénéfice également !

Source d’image principale : Canva

Josh Miramant est le PDG et fondateur de Blue Orange Digital, une agence de data science et d'apprentissage automatique de premier rang avec des bureaux à New York et à Washington DC. Miramant est un conférencier populaire, un futuriste et un conseiller stratégique en affaires et technologie pour les entreprises et les startups. Il aide les organisations à optimiser et à automatiser leurs entreprises, à mettre en œuvre des techniques d'analyse basées sur les données et à comprendre les implications de nouvelles technologies telles que l'intelligence artificielle, les big data et l'Internet des objets.