Ajatusjohtajat
Fuzzy Matching – Määritelmä, Prosessi ja Tekniikat

Accenturen tutkimus osoitti, että 75 % kuluttajista suosittelee ostamaan myyjiltä, jotka tuntevat heidän nimensä ja ostokäyttäytymisensä, ja 52 % heistä on todennäköisemmin vaihtamaan brändiä, jos he eivät tarjoa räätälöityjä kokemuksia. Kun yritykset keräävät miljoonia tietopisteitä lähes jokaisena päivänä, yksilöivien asiakkaiden tunnistaminen ja heidän profiilien luominen on yksi suurimmista haasteista, joita useimmat yritykset kohtaavat.
Kun yritys käyttää useita työkaluja tietojen keräämiseen, on hyvin yleistä kirjoittaa väärin asiakkaan nimi tai hyväksyä sähköpostiosoite, jossa on virheellinen muoto. Lisäksi, kun erilaiset tietosovellukset sisältävät erilaista tietoa samasta asiakkaasta, on mahdotonta saada tietoa asiakkaan käyttäytymisestä ja mieltymyksistä.
Seuraavaksi opimme, mitä fuzzy matching on, miten se toteutetaan, yleisiä tekniikoita, joita käytetään, ja haasteita, joita kohtaavat. Aloita.
Mikä on fuzzy matching?
Fuzzy matching on tietojen vertailutekniikka, joka vertaa kahta tai useampaa rekisteriä ja laskee todennäköisyyden siitä, kuuluvatko ne samaan kokonaisuuteen. Sen sijaan, että laajasti luokittelee rekisterit vastaaviksi ja ei-vastaaviksi, fuzzy matching antaa luvun (yleensä 0-100 %), joka osoittaa, kuinka todennäköistä on, että nämä rekisterit kuuluvat samaan asiakkaaseen, tuotteeseen, työntekijään jne.
Teekkoinen fuzzy matching -algoritmi huolehtii laajasta tietojen epäselvyyksistä, kuten etu- ja sukunimien kääntämistä, lyhenteistä, lyhennetyistä nimistä, fonetiikasta ja tarkoituksellisista kirjoitusvirheistä, lyhenteistä, lisättyistä/poistettuista välimerkeistä jne.
Fuzzy matching -prosessi
Fuzzy matching -prosessi toteutetaan seuraavasti:
- Profiilirekisterit perusstandardointivirheiden korjaamiseksi. Nämä virheet korjataan, jotta voidaan saavuttaa yhdenmukainen ja standardoitu näkymä rekisterien yli.
- Valitse ja määritä attribuutit, joiden perusteella fuzzy matching toteutetaan. Koska nämä attribuutit voivat olla eri nimisiä, ne on määritettävä lähteiden mukaan.
- Valitse fuzzy matching -tekniikka kullekin attribuutille. Esimerkiksi nimet voidaan vertailla näppäin-etäisyyden tai nimi-varianttien perusteella, kun taas puhelinnumerot voidaan vertailla numeerisen samankaltaisuuden mittareiden perusteella.
- Valitse paino kullekin attribuutille, jotta attribuutit, joille on annettu korkeammat painot (tai korkeampi prioriteetti), vaikuttavat enemmän koko vertailun luottamusluokkaan verrattuna kenttiin, joilla on matalammat painot.
- Määritä kynnysarvo – rekisterit, joiden fuzzy matching -pisteet ovat korkeammat kuin kynnysarvo, ovat vastaavat, ja ne, jotka eivät yllä kynnykseen, eivät ole vastaavat.
- Suorita fuzzy matching -algoritmi ja analyysi vertailun tuloksista.
- Korjaa virheelliset positiiviset ja negatiiviset, jotka saattavat ilmetä.
- Yhdistä, poista kaksoiskappaleet tai poista kaksoiskappaleet.
Fuzzy matching -parametrit
Edellä määritellystä prosessista voidaan nähdä, että fuzzy matching -algoritmi sisältää useita parametreja, jotka muodostavat tämän tekniikan perustan. Nämä parametrit sisältävät attribuuttien painot, fuzzy matching -tekniikan ja pisteiden kynnysarvon.
Jotta saatkaan optimaalisen tuloksen, on suoritettava fuzzy matching -tekniikoita eri parametreilla ja etsittävä arvot, jotka sopivat parhaiten tietoihisi. Monet toimittajat pakkaavat tällaiset ominaisuudet fuzzy matching -ratkaisuun, jossa nämä parametrit voidaan mukauttaa tarpeidesi mukaan.
Mitä ovat fuzzy matching -tekniikat?
On olemassa useita fuzzy matching -tekniikoita, jotka eroavat toisistaan tarkalleen vertailuun ja vertailuun käytettävän algoritmin tai kaavan perusteella. Riippuen tietojen luonteesta, voit valita tekniikan, joka on sopivin tarpeisiisi. Tässä on luettelo yleisimmistä fuzzy matching -tekniikoista:
- Merkkipohjainen samankaltaisuus -mittaukset, jotka ovat parhaita merkkijonojen vertailuun. Nämä sisältävät:
- Muokkausetäisyys: Laskee etäisyyden kahden merkkijonon välillä, laskettuna merkin kerrallaan.
- Affine aukko-etäisyys: Laskee etäisyyden kahden merkkijonon välillä, ottaen huomioon myös aukon tai välit merkkijonojen välillä.
- Smith-Waterman-etäisyys: Laskee etäisyyden kahden merkkijonon välillä, ottaen huomioon myös etuliitteiden ja jälkiliitteiden läsnäolon.
- Jaro-etäisyys: On paras vertaamaan etu- ja sukunimiä.
- Sanapohjainen samankaltaisuus -mittaukset, jotka ovat parhaita vertaamaan kokonaisia sanoja merkkijonoissa. Nämä sisältävät:
- Atomiset merkkijonot: Jakaa pitkiä merkkijonoja sanoiksi, jotka on erotettu välimerkeillä, ja vertaa yksittäisiä sanoja.
- WHIRL: On samanlainen kuin atomiset merkkijonot, mutta WHIRL myös antaa painoarvon kullekin sanalle.
- Foneettinen samankaltaisuus -mittaukset, jotka ovat parhaita vertaamaan sanoja, jotka kuulostavat samanlaisilta, mutta joilla on täysin erilainen merkkikoostumus. Nämä sisältävät:
- Soundex: On paras vertaamaan sukunimiä, jotka ovat erilaisia oikeinkirjoitukseltaan, mutta kuulostavat samanlaisilta.
- NYSIIS: On samanlainen kuin Soundex, mutta se myös säilyttää tietoa vokaalien sijainnista.
- Metaphone: Vertaa samankaltaisia sanoja, jotka ovat englannin kielessä, muissa amerikkalaisten tuttuissa sanoissa ja yleisimmissä etu- ja sukunimissä, joita käytetään Yhdysvalloissa.
- Numeerinen samankaltaisuus -mittaukset, jotka vertaavat lukuja, niiden etäisyyttä toisistaan, numeerisen datan jakautumista jne.
Fuzzy matching -haasteet
Fuzzy matching -prosessi – vaikka se tarjoaa ihmeellisiä etuja – voi olla hyvin haasteellinen toteuttaa. Tässä on joitakin yleisiä haasteita, joita yritykset kohtaavat:
1. Korkeampi virheellisten positiivisten ja negatiivisten määrä
Monilla fuzzy matching -ratkaisuilla on korkeampi määrä virheellisiä positiivisia ja negatiivisia tuloksia. Tämä johtuu siitä, että algoritmi luokittelee virheellisesti vastaavat ja ei-vastaavat rekisterit. Määriteltävissä olevat vastaavuusmääritykset ja fuzzy-parametrit voivat auttaa vähentämään virheellisiä linkkejä mahdollisimman paljon.
2. Laskennallinen monimutkaisuus
Vertailuprosessin aikana jokainen rekisteri vertaillaan jokaiseen toiseen rekisteriin samassa tietokannassa. Ja jos käsittelet useita tietokantoja, vertailujen määrä kasvaa entisestään. On havaittu, että vertailut kasvavat neliportaisesti tietokannan koosta riippuen. Tämän vuoksi on käytettävä järjestelmää, joka pystyy käsittelemään resursseja vaativia laskelmia.
3. Validointitesti
Vastaavat rekisterit yhdistetään yhteen, jotta voidaan esittää täydellinen 360 asteen näkymä kokonaisuuksista. Mahdolliset virheet tässä prosessissa voivat aiheuttaa riskejä liiketoiminnalle. Tämän vuoksi on suoritettava yksityiskohtainen validointitesti, jotta voidaan varmistaa, että säädetyt algoritmit tuottavat johdonmukaisesti tuloksia korkealla oikeudenmukaisuuden tasolla.
Yhteenveto
Yritykset usein ajattelevat fuzzy matching -ratkaisuja monimutkaisina, resursseja vaativina ja kallina projekteina, jotka kestävät liian kauan. Totuus on, että sijoittaminen oikeaan ratkaisuun, joka tuottaa nopeita ja tarkkoja tuloksia, on avain. Organisaatioiden on otettava huomioon useita tekijöitä valitessaan fuzzy matching -työkalua, kuten aikaa ja rahaa, joita he ovat valmiit sijoittamaan, skaalautuvaa suunnittelua, jota he aikovat toteuttaa, ja tietojensa luonnetta. Tämä auttaa heitä valitsemaan ratkaisun, joka mahdollistaa heidän saada enemmän irti tietojaan.












