Thought leaders
Fuzzy Matching – Definitie, Proces en Technieken

Een onderzoek van Accenture toonde aan dat 75% van de consumenten liever bij retailers koopt die hun naam en aankoopgedrag kennen, en 52% van hen is meer geneigd om van merk te veranderen als ze geen gepersonaliseerde ervaringen bieden. Met miljoenen datapunten die elke dag door merken worden vastgelegd, is het identificeren van unieke klanten en het opbouwen van hun profielen een van de grootste uitdagingen waarmee de meeste bedrijven te maken krijgen.
Wanneer een onderneming meerdere tools gebruikt om gegevens te verzamelen, is het heel gewoon om een klantennaam verkeerd te spellen of een e-mailadres met een onjuist patroon te accepteren. Bovendien is het, wanneer verschillende dataprogramma’s verschillende informatie over dezelfde klant hebben, onmogelijk om inzicht te krijgen in het gedrag en de voorkeuren van uw klant.
Vervolgens zullen we leren wat fuzzy matching is, hoe het wordt geïmplementeerd, de veelvoorkomende technieken die worden gebruikt en de uitdagingen waarmee wordt geworsteld. Laten we beginnen.
Wat is fuzzy matching?
Fuzzy matching is een techniek voor gegevensmatching die twee of meer records vergelijkt en de waarschijnlijkheid berekent dat ze tot hetzelfde entiteit behoren. In plaats van records breed in te delen in overeenkomsten en niet-overeenkomsten, produceert fuzzy matching een nummer (meestal tussen 0-100%) dat aangeeft hoe waarschijnlijk het is dat deze records tot dezelfde klant, product, werknemer, enz. behoren.
Een efficiënte fuzzy matching-algoritme zorgt voor een reeks gegevensonzekerheden, zoals omkeringen van voornaam/achternaam, afkortingen, verkorte namen, fonetische en opzettelijke spelfouten, afkortingen, toegevoegde/verwijderde leestekens, enz.
Fuzzy matching-proces
Het fuzzy matching-proces wordt als volgt uitgevoerd:
- Profielrecords voor basisstandaardiseringsfouten. Deze fouten worden vastgesteld zodat een uniform en gestandaardiseerd overzicht over records wordt bereikt.
- Selecteer en wijs attributen toe op basis waarvan fuzzy matching zal plaatsvinden. Aangezien deze attributen mogelijk anders worden genoemd, moeten ze worden toegewezen over bronnen.
- Kies een fuzzy matching-techniek voor elk attribuut. Bijvoorbeeld kunnen namen worden gematcht op basis van toetsenbordafstand of naamvarianten, terwijl telefoonnummers kunnen worden gematcht op basis van numerieke gelijkenisparameters.
- Selecteer een gewicht voor elk attribuut, zodat attributen met hogere gewichten (of hogere prioriteit) meer invloed hebben op het algehele overeenkomstniveau in vergelijking met velden met lagere gewichten.
- Definieer het drempelniveau – records met een fuzzy matching-score hoger dan het niveau worden beschouwd als een overeenkomst en degenen die onder het niveau vallen zijn geen overeenkomst.
- Voer fuzzy matching-algoritmes uit en analyseer de overeenkomstresultaten.
- Wis valse positieven en negatieven die kunnen optreden.
- Voeg samen, verwijder dubbele records of verwijder de dubbele records.
Fuzzy matching-parameters
Uit het bovenstaande proces kunt u zien dat een fuzzy matching-algoritme een aantal parameters heeft die de basis vormen van deze techniek. Deze omvatten de attribuutgewichten, fuzzy matching-techniek en de score-drempelwaarde.
Om optimale resultaten te behalen, moet u fuzzy matching-technieken uitvoeren met verschillende parameters en de waarden vinden die het beste bij uw gegevens passen. Veel leveranciers bieden dergelijke mogelijkheden in hun fuzzy matching-oplossing, waarbij deze parameters automatisch worden aangepast, maar afhankelijk van uw behoeften aangepast kunnen worden.
Wat zijn fuzzy matching-technieken?
Er zijn veel fuzzy matching-technieken die vandaag worden gebruikt en die verschillen op basis van het exacte algoritme of de formule die wordt gebruikt om velden te vergelijken en te matchen. Afhankelijk van de aard van uw gegevens, kunt u de techniek kiezen die het beste bij uw behoeften past. Hieronder volgt een lijst met veelvoorkomende fuzzy matching-technieken:
- Karakterspecifieke gelijkenis parameters die het beste zijn om tekenreeksen te matchen. Deze omvatten:
- Wijzigingsafstand: Berekent de afstand tussen twee tekenreeksen, berekend teken voor teken.
- Affine gap-afstand: Berekent de afstand tussen twee tekenreeksen door ook de gap of spaties tussen tekenreeksen te beschouwen.
- Smith-Waterman-afstand: Berekent de afstand tussen twee tekenreeksen door ook de aanwezigheid of afwezigheid van voorvoegsels en achtervoegsels te beschouwen.
- Jaro-afstand: Het beste om te matchen op voornaam en achternaam.
- Tokenspecifieke gelijkenis parameters die het beste zijn om complete woorden in tekenreeksen te matchen. Deze omvatten:
- Atomaire tekenreeksen: Deelt lange tekenreeksen in in woorden die worden gescheiden door leestekens en vergelijkt op afzonderlijke woorden.
- WHIRL: Vergelijkbaar met atomaire tekenreeksen, maar WHIRL wijst ook gewichten toe aan elk woord.
- Fonetische gelijkenisparameters die het beste zijn om woorden te vergelijken die fonetisch gelijk klinken maar een totaal andere tekencompositie hebben. Deze omvatten:
- Soundex: Het beste om achternamen te vergelijken die verschillen in spelling maar fonetisch gelijk klinken.
- NYSIIS: Vergelijkbaar met Soundex, maar NYSIIS behoudt ook details over de positie van klinkers.
- Metaphone: Vergelijkt fonetisch gelijk klinkende woorden die bestaan in de Engelse taal, andere woorden die bekend zijn bij Amerikanen en voornamen en achternamen die algemeen worden gebruikt in de VS.
- Numerieke gelijkenisparameters die nummers vergelijken, hoe ver ze van elkaar af staan, de verdeling van numerieke gegevens, enz.
Uitdagingen van fuzzy matching
Het fuzzy matching-proces – ondanks de geweldige voordelen die het biedt – kan moeilijk te implementeren zijn. Hieronder volgen enkele veelvoorkomende uitdagingen waarmee bedrijven te maken krijgen:
1. Hogere tarief van valse positieven en negatieven
Veel fuzzy matching-oplossingen hebben een hoger tarief van valse positieven en negatieven. Dit gebeurt wanneer het algoritme incorrect classificeert als overeenkomsten en niet-overeenkomsten of vice versa. Configurabele overeenkomstdefinities en fuzzy parameters kunnen helpen om onjuiste koppelingen zo veel mogelijk te verminderen.
2. Computatiecomplexiteit
Tijdens het matchen wordt elke record vergeleken met elke andere record in dezelfde dataset. En als u te maken heeft met meerdere datasets, neemt het aantal vergelijkingen nog verder toe. Het is opgemerkt dat de vergelijkingen kwadratisch toenemen naarmate de databasesize toeneemt. Om deze reden moet u een systeem gebruiken dat in staat is om resource-intensieve berekeningen aan te kunnen.
3. Valideren van tests
De gematchte records worden samengevoegd om een complete 360-graadweergave van entiteiten te vertegenwoordigen. Elke fout die tijdens dit proces optreedt, kan een risico voor uw bedrijfsoperaties toevoegen. Daarom moet een gedetailleerde validatietest worden uitgevoerd om ervoor te zorgen dat het afgestemde algoritme consistent resultaten produceert met een hoge nauwkeurigheidsgraad.
Afronden
Bedrijven denken vaak dat fuzzy matching-oplossingen complexe, resource-intensieve en geldverslindende projecten zijn die te lang duren. De waarheid is dat investeren in de juiste oplossing die snelle en nauwkeurige resultaten produceert, de sleutel is. Organisaties moeten een aantal factoren overwegen bij het kiezen van een fuzzy matching-tool, zoals de tijd en het geld dat ze bereid zijn te investeren, het ontwerp van de schaalbaarheid dat ze voor ogen hebben en de aard van hun datasets. Dit zal hen helpen om een oplossing te selecteren die hen in staat stelt om het meeste uit hun gegevens te halen.












