AI-modellen en platforms

Bedrijfsafwijkingen: fraude voorkomen met afwijkingdetectie

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Afwijkingdetectie met MIDAS

Afwijkingdetectie is een van de meest nuttige machine learning-tools van de afgelopen vijf jaar geworden. Het kan worden gebruikt voor fraude tot kwaliteitscontrole. Is het mogelijk om fraudeurs op online review-websites te isoleren? Kunnen frauduleuze financiële transacties worden gedetecteerd terwijl ze plaatsvinden? Kunnen live sensordata ons informeren over stroomnetstoringen voordat ze gebeuren?

Afwijkingdetectie biedt antwoorden op vragen zoals deze. Het identificeren van afwijkingen in data is een vitale taak voor het begrijpen van data. Door grote datasets bloot te stellen aan machine learning-tools en statistische methoden, kunnen normale patronen in data worden geleerd. Wanneer inconsistentie optreedt, kunnen afwijkingdetectiealgoritmen abnormaal gedrag isoleren en vlaggen voor gebeurtenissen die niet overeenkomen met de geleerde patronen. Een dergelijke functionaliteit is cruciaal in veel bedrijfsgevallen. Afwijkingdetectie maakt toepassingen mogelijk in een groot aantal sectoren, van beveiliging tot financiën en IoT-bewaking.

Web-schaalgrafieken zijn tegenwoordig overal aanwezig en zijn een gebruikelijke weergave van grote datastructuren. Ze ondersteunen zowel online als offline toepassingen. Enkele online voorbeelden zijn grote sociale netwerken, productaanbevelingssystemen en financiële transactiegrafieken. Offline zijn wegennetwerken, IoT-platforms en spanningssensoren in elektriciteitsnetwerken allemaal bronnen van grote hoeveelheden grafiekachtige data. Het hebben van data weergegeven als grafieken brengt zowel voordelen als uitdagingen met zich mee voor de eigenaren van deze datasets. Enerzijds maakt het het mogelijk om gegevenspunten en hun relaties in een multidimensionale ruimte weer te geven. Anderzijds zijn schaalbare algoritmen voor gegevensanalyse en interpretatie nodig. Dit heeft geleid tot een verhoogde onderzoeksfocus op methoden zoals afwijkingdetectie in grafiekdata.

Laten we een nadere blik werpen op een state-of-the-art-algoritme dat is ontwikkeld voor afwijkingdetectie in dynamische grafiekdata.

MIDAS

Microcluster-Based Detector of Anomalies in Edge Streams (MIDAS) is een algoritme dat afwijkingdetectie op dynamische grafiekdata aanpakt. Het is ontwikkeld door onderzoekers aan de National University of Singapore, die claimen dat hun methode state-of-the-art-benaderingen overtreft. Hun methode verlicht de meest voorkomende tekortkoming van eerdere afwijkingdetectie-implementaties:

Onderstaand vindt u de nieuwe baseline voor afwijkingdetectie die is ontwikkeld door Siddarth Bhatia en zijn team aan de Universiteit van Singapore

Introducing MIDAS: A New Baseline for Anomaly Detection in Graphs

Introducing MIDAS: A New Baseline for Anomaly Detection in Graphs. Image Source: Blog

De data weergegeven als een statische grafiek

Statische grafieken bevatten alleen connectiviteitsinformatie en negeren tijdsinformatie. Ze worden ook wel grafieksnapshots genoemd en kunnen alleen worden gebruikt voor het opsporen van ongebruikelijke grafiekentiteiten (bijv. verdachte knooppunten, randen of subgrafieken). Echter, voor veel praktische toepassingen is het tijdsaspect eveneens belangrijk: het is relevant om te weten wanneer de grafiekstructuur is gewijzigd. Om dit te verduidelijken, in een statische grafiek die netwerkverkeer weergeeft, informeert een rand alleen dat er een verbinding is tussen een bron-IP-adres en een bestemming-IP-adres. Maar de tijdsbeschrijving van de rand ontbreekt en dus is de tijd waarop de twee adressen verbonden werden onbekend. Aangezien statische grafieken dergelijke tijdsinformatie niet kunnen modelleren, bieden afwijkingdetectiemethoden die op dergelijke grafieken zijn gebaseerd alleen beperkte ondersteuning voor werkelijke toepassingen.

Anderzijds behandelt MIDAS data die zijn opgeslagen in een dynamische grafiek. Elk van de elementen in de grafiek heeft een bijbehorende tijdstempel, die de tijd weergeeft waarop dat element aan de grafiek is toegevoegd. Als we doorgaan met het voorbeeld hierboven, zou een dynamische netwerkverkeersgrafiek ook informeren over wanneer een verbinding tussen twee IP-adressen plaatsvond. De tijdstempel verandert telkens wanneer een bestaande rand of knooppunt wordt bijgewerkt, of wanneer nieuwe randen aan de grafiek worden toegevoegd. Als zodanig zijn dynamische grafieken een tijds-evoluerende structuur die beter past bij veel werkelijke toepassingen, die van nature dynamisch zijn. Ze maken het mogelijk om zowel connectiviteits- als tijdsinformatie te gebruiken voor de detectie van verdachte grafiekentiteiten. Op basis van die mogelijkheid kan MIDAS afwijkingen in real-time detecteren en biedt het dus ondersteuning voor veel bedrijfsgevallen.

MIDAS is geoptimaliseerd om te werken op dynamische grafiekdata. Zoals we hierboven hebben gezien, maken dynamische grafieken het mogelijk om tijdsvariabele data weer te geven. Echter, dit betekent ook dat de grafiekstructuur zelf ook verandert over tijd. Dit introduceert bepaalde uitdagingen voor de afwijkingdetectie-algoritmen die deze data in real-time-toepassingen willen gebruiken. Een voorbeeld is de schaalbaarheid van de methode met betrekking tot veranderende grafiekeigenschappen. Gezien de grote hoeveelheden data die overeenkomen met sommige toepassingen, moeten algoritmen lineair schaalbaar zijn tot de grootte van de grafiek. MIDAS werkt in een online modus en verwerkt elke rand in constante tijd en constante geheugen. De auteurs melden ook dat het algoritme “162-633 keer sneller is dan state-of-the-art-benaderingen”. Dit maakt het algoritme geschikt voor real-time-toepassingen, waar het verwerken van grote hoeveelheden datastromen noodzakelijk is.

Welke bedrijfsgevallen hebben MIDAS nodig?

Om een klein inzicht te krijgen in afwijkingdetectie die in de hedendaagse zakenwereld wordt gebruikt, hebben we een interview gehad met de in Canada gevestigde cryptocurrency-aanbieder NDAX. NDAX gebruikt afwijkingdetectie binnen drie gebieden van hun bedrijf. Algemene bedrijfsactiviteiten, de marketingafdeling en het compliance-team. Afwijkingdetectie helpt bij het identificeren van bugs, waardoor ze de websiteprestaties en het clientonboardingsproces kunnen verbeteren. Het stelt hen ook in staat om richtlijnen te geven aan de softwareontwikkelings- en backoffice-operatieteams over hoe deze problemen kunnen worden opgelost. Websiteverkeer is een ander gebied dat de kracht van afwijkingdetectie kan benutten. Het begrijpen van de outliers in websiteverkeer geeft inzicht en een beter begrip van de marketingteam, waardoor ze kunnen identificeren of een marketingcampagne werkt of niet. Dit geeft een duidelijker beeld van welk gebied het meest belangrijk is om hun inspanningen op te richten. Ons laatste voorbeeld is hoe clientaanmeldingsafwijkingen het compliance-team helpen om potentiële fraude te identificeren en cliënt-risico’s te verminderen.

In ons gesprek met NDAX Chief Compliance Officer, Julia Baranovskaya, wordt de belangrijkheid van afwijkingdetectie benadrukt tijdens de huidige pandemie. Er is een toename van 300% in gedetecteerde fraude in de afgelopen paar maanden. Desperate tijden in combinatie met hoge online verkeer nodigen scams van alle soorten uit die de werklozen en ouderen als doelwit hebben. Met afwijkingdetectie zijn we nu in staat om deze outliers om te zetten in indicatoren van fraude of trends. De volgende grafiek toont hoe fraude is geëvolueerd in de eerste helft van dit jaar.

NDAX vond een toename in fraude in Q2, met name scams die de ouderen en nep-baanplaatsingen betroffen.

Wat met uw bedrijf?

Afwijkingdetectie-algoritmen kunnen bedrijven helpen om ongebruikelijke datapunten in meerdere scenario’s te identificeren en te reageren. Een bankbeveiligingssysteem kan afwijkingdetectie gebruiken voor het identificeren van frauduleuze transacties. Evenzo vertrouwen fabriekseigenaren op afwijkingdetectie voor het omgaan met defecte apparatuur en het implementeren van preventieve onderhoudsmaatregelen. In IoT-sensornetwerken, wordt afwijkingdetectie gebruikt als onderdeel van conditiebewakingsoplossingen en voor de voorkoming van ongewenste malware-implementatie. Het belangrijkste punt is duidelijk: bedrijven die toegang hebben tot grote hoeveelheden data, kunnen MIDAS (en andere afwijkingdetectie-algoritmen) gebruiken om ongebruikelijke patronen in real-time te identificeren.

Hoe is uw data gestructureerd en hoe kunnen we u helpen om een moderne afwijkingdetectie-oplossing in te stellen? Stuur ons een bericht en laat ons weten. Het Blue Orange Digital data science-team is blij om afwijkingdetectie te laten werken voor uw voordeel!

Hoofdafbeeldingbron: Canva

Josh Miramant is de CEO en oprichter van Blue Orange Digital, een top-ranked data science en machine learning agency met kantoren in New York City en Washington DC. Miramant is een populaire spreker, futurist en strategisch zaken- en technologieadviseur voor ondernemingen en startups. Hij helpt organisaties hun bedrijven te optimaliseren en te automatiseren, gegevensgedreven analytische technieken te implementeren en de implicaties van nieuwe technologieën zoals kunstmatige intelligentie, big data en het Internet of Things te begrijpen.