Tankeledere

Fuzzy Matching – Definition, Proces og Teknikker

mm
Føj Unite.AI til dine foretrukne kilder på Google

En Accenture-undersøgelse viste, at 75% af forbrugerne foretrækker at købe fra detailhandlere, der kender deres navn og købsadfærd, og 52% af dem er mere tilbøjelige til at skifte mærke, hvis de ikke tilbyder personlige oplevelser. Med millioner af datapunkter, der indsamles af mærker næsten hver dag, er identifikation af unikke kunder og opbygning af deres profiler en af de største udfordringer, som de fleste virksomheder står overfor.

Når en virksomhed bruger multiple værktøjer til at indsamle data, er det meget almindeligt at stavfejl i en kundes navn eller acceptere en e-mail-adresse med en forkert mønster. Desuden, når forskellige dataapplikationer har varierende information om den samme kunde, bliver det umuligt at få indsigt i kundens adfærd og præferencer.

Herefter vil vi lære, hvad fuzzy matching er, hvordan det implementeres, de almindelige teknikker, der bruges, og udfordringerne, der står overfor. Lad os komme i gang.

Hvad er fuzzy matching?

Fuzzy matching er en data-matching-teknik, der sammenligner to eller flere poster og beregner sandsynligheden for, at de tilhører den samme enhed. I stedet for at kategorisere bredt poster som match og non-match, udskriver fuzzy matching et tal (normalt mellem 0-100%), der identificerer, hvor sandsynligt det er, at disse poster tilhører den samme kunde, produkt, medarbejder osv.

En effektiv fuzzy matching-algoritme tager sig af en række data-ambiguiteter, såsom fornavn/surname-omvendlinger, akronymer, forkortede navne, fonetiske og bevidste stavfejl, forkortelser, tilføjede/fjernede tegn osv.

Fuzzy matching-proces

Fuzzy matching-processen udføres som følger:

  1. Profiler poster for grundlæggende standardiseringsfejl. Disse fejl rettes, så en ensartet og standardiseret visning opnås på tværs af poster.
  2. Vælg og tilknyt attributter baseret på, hvilke fuzzy matching skal udføres. Da disse attributter kan have forskellige titler, skal de tilknyttes på tværs af kilder.
  3. Vælg en fuzzy matching-teknik for hver attribut. For eksempel kan navne matches baseret på tastaturafstand eller navnevarianter, mens telefonnumre kan matches baseret på numerisk lignende metrikker.
  4. Vælg en vægt for hver attribut, så attributter med højere vægt (eller højere prioritet) vil have mere indflydelse på den samlede match-sikkerhedsniveau i forhold til felter med lavere vægt.
  5. Definer threshold-niveauet – poster med fuzzy matching-score over niveauet anses for at være en match, og de, der falder under, anses for at være en non-match.
  6. Kør fuzzy matching-algoritmer og analyser match-resultaterne.
  7. Overstyr eventuelle falske positiver og negativer, der kan opstå.
  8. Sammenslå, fjern duplikater eller eliminer duplikatposter.

Fuzzy matching-parametre

Fra processen defineret ovenfor kan du se, at en fuzzy matching-algoritme har en række parametre, der danner grundlaget for denne teknik. Disse inkluderer attributvægte, fuzzy matching-teknik og score-threshold-niveau.

For at opnå optimale resultater skal du udføre fuzzy matching-teknikker med varierende parametre og finde de værdier, der passer bedst til dine data. Mange leverandører pakker sådanne funktioner ind i deres fuzzy matching-løsning, hvor disse parametre er auto-justeret, men kan tilpasses afhængigt af dine behov.

Hvad er fuzzy matching-teknikker?

Der er mange fuzzy matching-teknikker, der bruges i dag, som afhænger af den eksakte algoritme eller formel, der bruges til at sammenligne og matche felter. Afhængigt af datatypen kan du vælge den teknik, der er mest egnet til dine behov. Her er en liste over almindelige fuzzy matching-teknikker:

  1. Tegn-baseret lignelse metrikker, der er bedst til at matche streng. Disse inkluderer:
    1. Redigér afstand: Beregner afstanden mellem to streng, beregnet tegn for tegn.
    2. Affine gap-afstand: Beregner afstanden mellem to streng ved også at overveje mellemrum eller afstand mellem streng.
    3. Smith-Waterman-afstand: Beregner afstanden mellem to streng ved også at overveje tilstedeværelsen eller fraværet af præfikser og suffikser.
    4. Jaro-afstand: Bedst til at matche på fornavne og efternavne.
  2. Token-baseret lignelse metrikker, der er bedst til at matche komplette ord i streng. Disse inkluderer:
    1. Atomiske streng: Deler lange streng op i ord adskilt af tegn og sammenligner på enkeltvis.
    2. WHIRL: Ligner atomiske streng, men WHIRL tildeler også vægt til hvert ord.
  3. Fonetisk lignelse metrikker, der er bedst til at sammenligne ord, der lyder ens, men har en helt forskellig tegnsammensætning. Disse inkluderer:
    1. Soundex: Bedst til at sammenligne efternavne, der er forskellige i stavning, men lyder ens.
    2. NYSIIS: Ligner Soundex, men NYSIIS beholder også oplysninger om vokalposition.
    3. Metaphone: Sammenligner ord, der lyder ens, der findes i det engelske sprog, andre ord, der er kendte for amerikanere, og fornavne og efternavne, der normalt bruges i USA.
  4. Nummerisk lignelse metrikker, der sammenligner tal, hvor langt de er fra hinanden, fordelingen af numeriske data osv.

Udfordringer ved fuzzy matching

Fuzzy matching-processen – på trods af de fantastiske fordele, den tilbyder – kan være ret svær at implementere. Her er nogle almindelige udfordringer, som virksomheder står overfor:

1.     Højere rate af falske positiver og negativer

Mange fuzzy matching-løsninger har en højere rate af falske positiver og negativer. Dette sker, når algoritmen forkert klassificerer matches og non-matches eller omvendt. Konfigurerbare match-definitioner og fuzzy-parametre kan hjælpe med at reducere forkerte links så meget som muligt.

2.     Computational kompleksitet

Under matchingsprocessen sammenlignes hver post med hver anden post i samme datasæt. Og hvis du har med flere datasæt at gøre, øges antallet af sammenligninger. Det er bemærket, at sammenligningerne vokser kvadratisk, når datasætstørrelsen øges. Derfor skal du bruge et system, der er i stand til at håndtere ressourcekrævende beregninger.

3.     Validering af testing

De matchede poster samles sammen for at repræsentere en komplet 360-graders syn på enheder. Enhver fejl, der opstår under denne proces, kan tilføje risiko til dine forretningsoperationer. Derfor skal detaljeret valideringstestning udføres for at sikre, at den justerede algoritme konsekvent producerer resultater med høj nøjagtighed.

Afslutning

Virksomheder tror ofte, at fuzzy matching-løsninger er komplekse, ressourcekrævende og penge-slugende projekter, der varer for længe. Sandheden er, at investering i den rette løsning, der producerer hurtige og nøjagtige resultater, er nøglen. Organisationer skal overveje en række faktorer, mens de vælger en fuzzy matching-værktøj, såsom den tid og penge, de er villige til at investere, den skaleringsdesign, de har i tankerne, og datatypen. Dette vil hjælpe dem med at vælge en løsning, der giver dem det bedste udbytte af deres data. Virksomheder skal overveje en række faktorer, mens de vælger en fuzzy matching-værktøj, såsom den tid og penge, de er villige til at investere, den skaleringsdesign, de har i tankerne, og datatypen. Dette vil hjælpe dem med at vælge en løsning, der giver dem det bedste udbytte af deres data.

Jeg er en Product Marketing Analyst hos Data Ladder med en baggrund i IT. Jeg skriver med passion om virkelige datahygiejne-problemer, som mange organisationer står overfor i dag. Jeg kommunikerer løsninger, tips og praksis, der kan hjælpe virksomheder med at opnå indre datakvalitet i deres forretningsintelligensprocesser. Jeg stræber efter at skabe indhold, der er rettet mod et bredt udvalg af målgrupper, lige fra teknisk personale til slutbruger, samt markedsføre det på tværs af forskellige digitale platforme.