Myslitelé
Fuzzy Matching – Definice, Proces a Techniky

Průzkum společnosti Accenture ukázal, že 75 % spotřebitelů preferuje nákup u prodejců, kteří znají jejich jméno a nákupní chování, a 52 % z nich je více pravděpodobně změnit značku, pokud nenabízejí personalizované zkušenosti. S miliony datových bodů, které jsou zachyceny značkami téměř každý den, je identifikace jedinečných zákazníků a vytváření jejich profilů jednou z největších výzev, kterým čelí většina společností.
Když podnik používá několik nástrojů pro zachycení dat, je velmi běžné, že se jméno zákazníka špatně napíše nebo že se přijme e-mailová adresa se špatným vzorem. Kromě toho, když mají různé datové aplikace různé informace o stejném zákazníkovi, je nemožné získat přehled o chování a preferencích zákazníků.
Nyní se dozvíme, co je fuzzy matching, jak se implementuje, jaké jsou běžné techniky a jaké jsou výzvy. Pojďme začít.
Co je fuzzy matching?
Fuzzy matching je technika datové shody, která porovnává dvě nebo více záznamů a vypočítává pravděpodobnost, že patří ke stejné entitě. Namísto široké kategorizace záznamů jako shody a neshody, fuzzy matching výstupem je číslo (obvykle mezi 0-100%), které identifikuje, jak pravděpodobné je, že tyto záznamy patří ke stejnému zákazníkovi, produktu, zaměstnanci atd.
Efektivní algoritmus fuzzy matching se stará o řadu datových nesrovnalostí, jako jsou první/poslední jméno obrácené, zkratky, zkrácená jména, fonetické a úmyslné chyby, zkratky, přidány/odebrány interpunkce atd.
Proces fuzzy matching
Proces fuzzy matching se provádí následovně:
- Vytvořit profily záznamů pro základní standardizační chyby. Tyto chyby se opraví, aby se dosáhlo jednotného a standardizovaného pohledu na záznamy.
- Vybrat a mapovat atributy na základě kterých se bude provádět fuzzy matching. Tyto atributy mohou být označeny jinak, a proto je nutné je mapovat napříč zdroji.
- Vybrat techniku fuzzy matching pro každý atribut. Například jména lze porovnávat na základě klávesové vzdálenosti nebo variant jmen, zatímco telefonní čísla lze porovnávat na základě numerické podobnosti.
- Vybrat váhu pro každý atribut, aby atributy s vyššími váhami (nebo vyšší prioritou) měly větší dopad na celkovou úroveň důvěryhodnosti shody ve srovnání s poli, která mají nižší váhy.
- Definovat prahovou úroveň – záznamy s fuzzy matching skóre vyšším než tato úroveň jsou považovány za shodu a ty, které nedosahují této úrovně, jsou považovány za neshodu.
- Spuštění algoritmu fuzzy matching a analýza výsledků shody.
- Přepsat jakékoliv falešné pozitivy a negativy, které se mohou objevit.
- Sloučit, odstranit duplikáty nebo jednoduše odstranit duplikátní záznamy.
Parametry fuzzy matching
Z procesu definovaného výše je zřejmé, že algoritmus fuzzy matching má řadu parametrů, které tvoří základ této techniky. Tyto parametry zahrnují váhy atributů, techniku fuzzy matching a prahovou úroveň skóre.
Pro získání optimálních výsledků je nutné provést fuzzy matching techniky s různými parametry a najít hodnoty, které nejlépe vyhovují vašim datům. Mnoho dodavatelů nabízí takové schopnosti ve svých řešeních fuzzy matching, kde jsou tyto parametry automaticky nastaveny, ale lze je upravit podle vašich potřeb.
Jaké jsou techniky fuzzy matching?
Existuje mnoho technik fuzzy matching, které se liší podle exact algoritmu nebo vzorce používaného pro porovnávání a shodu polí. V závislosti na povaze vašich dat můžete zvolit techniku, která nejlépe vyhovuje vašim požadavkům. Zde je seznam běžných technik fuzzy matching:
- Charakterové podobnosti metriky, které jsou nejlepší pro porovnávání řetězců. Tyto metriky zahrnují:
- EDIT DISTANCE: Vypočítává vzdálenost mezi dvěma řetězci, počítanou znak po znaku.
- Affine gap distance: Vypočítává vzdálenost mezi dvěma řetězci, přičemž zohledňuje také mezery nebo prostory mezi řetězci.
- Smith-Waterman distance: Vypočítává vzdálenost mezi dvěma řetězci, přičemž zohledňuje také přítomnost nebo absenci prefixů a suffixů.
- Jaro distance: Nejlepší pro porovnávání na prvním a posledním jménu.
- Tokenové podobnosti metriky, které jsou nejlepší pro porovnávání kompletních slov v řetězcích. Tyto metriky zahrnují:
- Atomické řetězce: Rozděluje dlouhé řetězce na slova oddělená interpunkcí a porovnává je na jednotlivých slovech.
- WHIRL: Podobné atomickým řetězcům, ale WHIRL také přiřazuje váhy každému slovu.
- Fonetické podobnosti metriky, které jsou nejlepší pro porovnávání slov, která zní podobně, ale mají zcela odlišnou slovní skladbu. Tyto metriky zahrnují:
- Soundex: Nejlepší pro porovnávání příjmení, která se liší v pravopisu, ale zní podobně.
- NYSIIS: Podobné Soundexu, ale NYSIIS také uchovává informace o poloze samohlásek.
- Metaphone: Porovnává slova, která zní podobně, existující v anglickém jazyce, dalších slovech známých Američanům a prvním a rodinným jménům běžně používaným ve Spojených státech.
- Číselné podobnosti metriky, které porovnávají čísla, jak daleko jsou od sebe, distribuci číselných dat atd.
Výzvy fuzzy matching
Proces fuzzy matching – navzdory úžasným výhodám, které nabízí – může být docela obtížné implementovat. Zde jsou některé běžné výzvy, kterým čelí podniky:
1. Vyšší míra falešných pozitiv a negativ
Mnoho řešení fuzzy matching má vyšší míru falešných pozitiv a negativ. To se stává, když algoritmus nesprávně klasifikuje shody a neshody nebo naopak. Konfigurovatelné definice shody a fuzzy parametry mohou pomoci snížit nesprávné odkazy co nejvíce.
2. Computační složitost
Během procesu shody je každý záznam porovnán s každým jiným záznamem ve stejné datové sadě. A pokud pracujete s několika datovými sadami, počet porovnání se zvyšuje. Bylo zjištěno, že porovnání rostou kvadraticky, jak roste velikost databáze. Z tohoto důvodu je nutné použít systém, který je schopen zpracovat výpočetně náročné výpočty.
3. Validační testování
Shodné záznamy jsou sloučeny dohromady, aby představovaly kompletní 360° pohled na entity. Jakékoli chyby, ke kterým dojde během tohoto procesu, mohou přidat riziko do vašich obchodních operací. Z tohoto důvodu je nutné provést podrobné validační testování, aby se zajistilo, že nalazený algoritmus konzistentně produkuje výsledky s vysokou mírou přesnosti.
Závěrem
Podniky často považují řešení fuzzy matching za komplexní, výpočetně náročné a finančně náročné projekty, které trvají příliš dlouho. Pravda je, že investice do správného řešení, které produkuje rychlé a přesné výsledky, je klíčem. Organizace potřebují zohlednit řadu faktorů, když si vybírají nástroj fuzzy matching, jako je čas a peníze, které jsou ochotny investovat, návrh škálovatelnosti, který mají na mysli, a povahu svých dat. To jim pomůže vybrat řešení, které jim umožní získat maximum z jejich dat.












