Tankeledare
Fuzzy Matching – Definition, Process och Tekniker

En undersökning från Accenture visade att 75% av konsumenterna föredrar att handla från detaljister som känner till deras namn och köpbeteende, och 52% av dem är mer benägna att byta varumärke om de inte erbjuder personliga upplevelser. Med miljontals datapunkter som fångas av varumärken nästan varje dag är identifiering av unika kunder och skapande av deras profiler en av de största utmaningarna som de flesta företag står inför.
När ett företag använder flera verktyg för att samla in data är det mycket vanligt att stavfel i en kunds namn eller acceptera en e-postadress med ett felaktigt mönster. Dessutom, när olika dataapplikationer har varierande information om samma kund, är det omöjligt att få insikt i kundbeteende och preferenser.
Nästa steg är att lära oss vad fuzzy matching är, hur det implementeras, de vanliga teknikerna som används och de utmaningar som möts. Låt oss komma igång.
Vad är fuzzy matching?
Fuzzy matching är en datamatchningsteknik som jämför två eller flera poster och beräknar sannolikheten för att de tillhör samma enhet. Istället för att bredt kategorisera poster som match och icke-match, ger fuzzy matching ut ett nummer (vanligtvis mellan 0-100%) som identifierar hur sannolikt det är att dessa poster tillhör samma kund, produkt, anställd osv.
En effektiv fuzzy matching-algoritm hanterar en rad dataambiguiteter, såsom första/sista namnsomkastningar, akronymer, förkortade namn, fonetiska och avsiktliga stavfel, förkortningar, tillagda/borttagna punktioner osv.
Fuzzy matching-process
Fuzzy matching-processen utförs på följande sätt:
- Profilsidor för grundläggande standardiseringsfel. Dessa fel korrigeras så att en enhetlig och standardiserad vy uppnås över poster.
- Välj och mappa attribut baserat på vilka fuzzy matching ska ske. Eftersom dessa attribut kan ha olika titlar, måste de mappas över källor.
- Välj en fuzzy matching-teknik för varje attribut. Till exempel kan namn matchas baserat på tangentavstånd eller namnvarianter, medan telefonnummer kan matchas baserat på numerisk likhetsmätning.
- Välj en vikt för varje attribut, så att attribut med högre vikt (eller högre prioritet) kommer att ha större inverkan på den övergripande matchningsnivån jämfört med fält med lägre vikt.
- Definiera tröskelnivån – poster med fuzzy matching-poäng högre än nivån anses vara en match och de som inte når upp anses vara en icke-match.
- Kör fuzzy matching-algoritmer och analysera matchningsresultaten.
- Åsidosätt eventuella falska positiva och negativa som kan uppstå.
- Slå samman, dubblett, eller enkelt eliminera dubblettposter.
Fuzzy matching-parametrar
Från den process som definierats ovan kan du se att en fuzzy matching-algoritm har ett antal parametrar som utgör grunden för denna teknik. Dessa inkluderar attributvikt, fuzzy matching-teknik och poängtröskelnivå.
För att få optimala resultat måste du köra fuzzy matching-tekniker med varierande parametrar och hitta de värden som passar din data bäst. Många leverantörer paketerar sådana funktioner i sina fuzzy matching-lösningar, där dessa parametrar är förinställda men kan anpassas beroende på dina behov.
Vad är fuzzy matching-tekniker?
Det finns många fuzzy matching-tekniker som används idag som skiljer sig åt beroende på den exakta algoritmen eller formeln som används för att jämföra och matcha fält. Beroende på datans natur kan du välja den teknik som är lämplig för dina behov. Här är en lista över vanliga fuzzy matching-tekniker:
- Teckenbaserad likhetsmätning som är bäst för att matcha strängar. Dessa inkluderar:
- Redigeringavstånd: Beräknar avståndet mellan två strängar, beräknat tecken för tecken.
- Affine gap-avstånd: Beräknar avståndet mellan två strängar genom att också ta hänsyn till gap eller mellanrum mellan strängar.
- Smith-Waterman-avstånd: Beräknar avståndet mellan två strängar genom att också ta hänsyn till förekomsten eller frånvaron av prefix och suffix.
- Jaro-avstånd: Bäst för att matcha för- och efternamn.
- Tokenbaserad likhetsmätning som är bäst för att matcha fullständiga ord i strängar. Dessa inkluderar:
- Atomsträngar: Delar upp långa strängar i ord avgränsade av punktion och jämför på enskilda ord.
- WHIRL: Liknar atomsträngar men WHIRL tilldelar också vikt till varje ord.
- Fonetisk likhetsmätning som är bäst för att jämföra ord som låter lika men har helt olika teckenkomposition. Dessa inkluderar:
- Soundex: Bäst för att jämföra efternamn som skiljer sig i stavning men låter lika.
- NYSIIS: Liknar Soundex, men NYSIIS behåller också information om vokalposition.
- Metaphone: Jämför liknande ljudande ord som finns i det engelska språket, andra ord som är bekanta för amerikaner och för- och efternamn som vanligtvis används i USA.
- Nummerbaserad likhetsmätning som jämför nummer, hur långt de är ifrån varandra, fördelningen av numeriska data osv.
Utmaningar med fuzzy matching
Fuzzy matching-processen – trots de fantastiska fördelarna den erbjuder – kan vara ganska svår att implementera. Här är några vanliga utmaningar som företag möter:
1. Högre frekvens av falska positiva och negativa
Många fuzzy matching-lösningar har en högre frekvens av falska positiva och negativa. Detta sker när algoritmen felaktigt klassificerar matchningar och icke-matchningar eller vice versa. Konfigurerbara matchningsdefinitioner och fuzzy-parametrar kan hjälpa till att minska felaktiga länkar så mycket som möjligt.
2. Beräkningskomplexitet
Under matchningsprocessen jämförs varje post med varje annan post i samma dataset. Och om du hanterar flera dataset, ökar antalet jämförelser ännu mer. Det har noterats att jämförelserna ökar kvadratiskt när databasens storlek ökar. Av denna anledning måste du använda ett system som kan hantera beräkningsintensiva beräkningar.
3. Validering av testning
De matchade posterna slås samman för att representera en fullständig 360-graders vy av enheter. Eventuella fel som uppstår under denna process kan lägga till risk för dina affärsverksamheter. Detta är varför detaljerad valideringstestning måste utföras för att säkerställa att den justerade algoritmen konsekvent producerar resultat med hög noggrannhet.
Sammanfattning
Företag tror ofta att fuzzy matching-lösningar är komplexa, resurskrävande och pengakrävande projekt som pågår för länge. Sanningen är att investeringar i rätt lösning som producerar snabba och precisa resultat är nyckeln. Organisationer måste överväga ett antal faktorer när de väljer en fuzzy matching-verktyg, såsom den tid och pengar de är villiga att investera, den skalbarhetsdesign de har i åtanke och datamängdernas natur. Detta kommer att hjälpa dem att välja en lösning som möjliggör att de får ut det mesta av sina data. Organisationer behöver överväga ett antal faktorer när de väljer ett fuzzy matching-verktyg, såsom den tid och pengar de är villiga att investera, den skalbarhetsdesign de har i åtanke och datamängdernas natur. Detta kommer att hjälpa dem att välja en lösning som möjliggör att de får ut det mesta av sina data.












