Tankeledere
Fuzzy Matching – Definisjon, Prosess og Teknikker

En Accenture-undersøkelse viste at 75% av forbrukerne foretrekker å kjøpe fra detaljister som kjenner deres navn og kjøpsatferd, og 52% av dem er mer sannsynlig å bytte merke hvis de ikke tilbyr personlige erfaringer. Med millioner av datapunkter som blir fanget av merker nesten hver dag, er å identifisere unike kunder og bygge deres profiler en av de største utfordringene som de fleste selskaper møter.
Når et foretak bruker flere verktøy for å fange data, er det svært vanlig å stavfelet en kundes navn eller akseptere en e-postadresse med feil mønster. I tillegg, når ulike dataapplikasjoner har forskjellig informasjon om samme kunde, blir det umulig å få innsikt i kundens atferd og preferanser.
Neste, skal vi lære hva fuzzy matching er, hvordan det implementeres, vanlige teknikkene som brukes, og utfordringene som møtes. La oss komme i gang.
Hva er fuzzy matching?
Fuzzy matching er en data-sammenligningsteknikk som sammenligner to eller flere poster og beregner sannsynligheten for at de tilhører samme enhet. I stedet for å kategorisere poster som match og ikke-match, utsteder fuzzy matching et tall (vanligvis mellom 0-100%) som identifiserer hvor sannsynlig det er at disse postene tilhører samme kunde, produkt, ansatt osv.
En effektiv fuzzy matching-algoritme tar hånd om en rekke data-usikkerheter, som for eksempel fornavn/slektsnavn-omvendelser, forkortelser, forkortede navn, fonetiske og bevisste stavfeil, forkortelser, lagt til/fjernet punktering osv.
Fuzzy matching-prosess
Fuzzy matching-prosessen utføres på følgende måte:
- Profilposter for grunnleggende standardiseringsfeil. Disse feilene fikses så en ensartet og standardisert visning oppnås over poster.
- Velg og kartlegg attributter basert på hvilke fuzzy matching skal utføres. Ettersom disse attributtene kan ha forskjellige navn, må de kartlegges over kilder.
- Velg en fuzzy matching-teknikk for hver attributt. For eksempel kan navn sammenlignes basert på tastaturavstand eller navnvarianter, mens telefonnumre kan sammenlignes basert på numerisk likhetsmetrikker.
- Velg en vekt for hver attributt, så attributter med høyere vekter (eller høyere prioritet) vil ha mer innvirkning på den totale match-sikkerhetsnivået sammenlignet med felt med lavere vekter.
- Definer terskelnivået – poster med fuzzy matching-poeng over terskelnivået regnes som en match, og de som ikke når opp til terskelnivået regnes som ikke-match.
- Kjør fuzzy matching-algoritmer og analyser match-resultatene.
- Overstyr eventuelle feilpositive og -negative som kan oppstå.
- Sammenslå, fjern duplikater eller eliminer duplikatposter.
Fuzzy matching-parametere
Fra prosessen definert ovenfor, kan du se at en fuzzy matching-algoritme har en rekke parametere som utgjør grunnlaget for denne teknikken. Disse inkluderer attributtvektene, fuzzy matching-teknikken og poengterskelnivået.
For å få optimale resultater, må du utføre fuzzy matching-teknikker med varierende parametere og finne verdiene som passer best for dine data. Mange leverandører pakker slike funksjoner inn i sine fuzzy matching-løsninger, hvor disse parameterne er automatisk justert, men kan tilpasses avhengig av dine behov.
Hva er fuzzy matching-teknikker?
Det finnes mange fuzzy matching-teknikker som brukes i dag, som varierer basert på den eksakte algoritmen eller formelen som brukes til å sammenligne og matche felt. Avhengig av datans natur, kan du velge teknikken som er best egnet for dine behov. Her er en liste over vanlige fuzzy matching-teknikker:
- Tegnbasert likhet metrikker som er best til å matche strenger. Disse inkluderer:
- Redigeringavstand: Beregner avstanden mellom to strenger, beregnet tegn for tegn.
- Affine gap-avstand: Beregner avstanden mellom to strenger ved også å vurdere gap eller mellomrom mellom strenger.
- Smith-Waterman-avstand: Beregner avstanden mellom to strenger ved også å vurdere tilstedeværelsen eller fraværet av prefikser og suffikser.
- Jaro-avstand: Best til å matche på fornavn og etternavn.
- Tokbasert likhet metrikker som er best til å matche hele ord i strenger. Disse inkluderer:
- Atomiske strenger: Deler lange strenger inn i ord avgrenset av punktering og sammenligner på enkeltord.
- WHIRL: Lignende atomiske strenger, men WHIRL tildeeler også vekter til hvert ord.
- Fonetisk likhet metrikker som er best til å sammenligne ord som lyder likt, men har helt forskjellig tegnsammensetning. Disse inkluderer:
- Soundex: Best til å sammenligne etternavn som er forskjellige i stavning, men lyder likt.
- NYSIIS: Lignende Soundex, men NYSIIS beholder også detaljer om vokalposisjon.
- Metaphone: Sammenligner likt lydende ord som finnes i det engelske språket, andre ord som er kjente for amerikanere, og fornavn og etternavn som vanligvis brukes i USA.
- Numerisk likhet metrikker som sammenligner tall, hvor langt de er fra hverandre, fordelt numerisk data osv.
Utfordringer med fuzzy matching
Fuzzy matching-prosessen – til tross for de fantastiske fordelene den tilbyr – kan være ganske vanskelig å implementere. Her er noen vanlige utfordringer som bedrifter møter:
1. Høyere rate av feilpositive og -negative
Mange fuzzy matching-løsninger har en høyere rate av feilpositive og -negative. Dette skjer når algoritmen feilaktig klassifiserer matcher og ikke-matcher eller omvendt. Konfigurerbare match-definisjoner og fuzzy-parametere kan hjelpe med å redusere feilaktige koblinger så mye som mulig.
2. Regnekompleksitet
Under sammenligningsprosessen sammenlignes hver post med hver annen post i samme datasett. Og hvis du håndterer multiple datasett, øker antallet sammenligninger. Det er observert at sammenligningene vokser kvadratisk når databasestørrelsen øker. Av denne grunn må du bruke et system som er i stand til å håndtere ressurskrevende beregninger.
3. Valideringstesting
De matchede postene slås sammen for å representere en fullstendig 360-graders visning av enheter. Eventuelle feil som oppstår under denne prosessen kan legge til risiko for bedriftens drift. Derfor må detaljert valideringstesting utføres for å sikre at den justerte algoritmen konsekvent produserer resultater med høy nøyaktighetsgrad.
Oppsummering
Bedrifter tenker ofte på fuzzy matching-løsninger som komplekse, ressurskrevende og pengedyrke prosjekter som varer for lenge. Sannheten er at å investere i riktig løsning som produserer raskt og nøyaktige resultater er nøkkel. Organisasjoner må vurdere en rekke faktorer mens de velger en fuzzy matching-verktøy, som tiden og pengene de er villige til å investere, skaleringsdesignet de har tenkt, og datatypen de har. Dette vil hjelpe dem å velge en løsning som gjør det mulig for dem å få mest mulig ut av sine data. Organisasjoner må vurdere en rekke faktorer mens de velger en fuzzy matching-verktøy, som tiden og pengene de er villige til å investere, skaleringsdesignet de har tenkt, og datatypen de har. Dette vil hjelpe dem å velge en løsning som gjør det mulig for dem å få mest mulig ut av sine data.












