Lideri de opinie
Corespondența fuzzy – Definiție, Proces și Tehnici

O anchetă Accenture a arătat că 75% dintre consumatori preferă să cumpere de la retaileri care își cunosc numele și comportamentul de cumpărare, și 52% dintre ei sunt mai predispuși să schimbe brandurile dacă nu oferă experiențe personalizate. Cu milioane de puncte de date capturate de branduri aproape în fiecare zi, identificarea clienților unici și crearea profilurilor lor este una dintre cele mai mari provocări cu care se confruntă majoritatea companiilor.
Când o întreprindere utilizează multiple instrumente pentru capturarea datelor, este foarte obișnuit să greșească numele unui client sau să accepte o adresă de e-mail cu un model incorect. Mai mult, atunci când aplicațiile de date disparate au informații diferite despre același client, devine imposibil să obțineți insight-uri despre comportamentul și preferințele clientului.
Următorul, vom învăța ce este corespondența fuzzy, cum se implementează, care sunt tehnicile comune utilizate și care sunt provocările întâmpinate. Să începem.
Ce este corespondența fuzzy?
Corespondența fuzzy este o tehnică de potrivire a datelor care compară două sau mai multe înregistrări și calculează probabilitatea ca acestea să aparțină aceleiași entități. În loc să clasifice înregistrările în mod larg ca potrivite și nepotrivite, corespondența fuzzy oferă un număr (de obicei între 0-100%) care identifică cât de probabil este ca aceste înregistrări să aparțină aceluiași client, produs, angajat, etc.
Un algoritm de corespondență fuzzy eficient se ocupă de o gamă de ambiguități de date, cum ar fi inversarea numelor și prenumelor, abrevierile, prescurtările, omisiunile fonetice și deliberate, abrevierile, adăugarea sau eliminarea punctuațiilor, etc.
Procesul de corespondență fuzzy
Procesul de corespondență fuzzy se desfășoară astfel:
- Inregistrează profilurile pentru erorile de standardizare de bază. Aceste erori sunt corectate astfel încât să se obțină o vedere uniformă și standardizată pe întregul registru.
- Selecționează și asociați atributele pe baza cărora se va face corespondența fuzzy. Deoarece aceste atribute pot avea titluri diferite, ele trebuie să fie asociate între surse.
- Alegeți o tehnică de corespondență fuzzy pentru fiecare atribut. De exemplu, numele pot fi potrivite pe baza distanței de tastatură sau a variantelor de nume, în timp ce numerele de telefon pot fi potrivite pe baza metricilor de similaritate numerice.
- Selecționează o greutate pentru fiecare atribut, astfel încât atributele cu greutăți mai mari (sau prioritate mai mare) vor avea un impact mai mare asupra nivelului general de încredere în potrivire, comparativ cu câmpurile cu greutăți mai mici.
- Definiți nivelul de prag – înregistrările cu un scor de corespondență fuzzy mai mare decât nivelul de prag sunt considerate potrivite, iar cele care nu ating nivelul de prag sunt considerate nepotrivite.
- Rulați algoritmul de corespondență fuzzy și analizați rezultatele potrivirii.
- Anulați orice rezultate false pozitive și negative care pot apărea.
- Combinați, deduplicați sau eliminați pur și simplu înregistrările duplicate.
Parametrii de corespondență fuzzy
Din procesul definit mai sus, puteți vedea că un algoritm de corespondență fuzzy are o serie de parametri care stau la baza acestei tehnici. Acești parametri includ greutățile atributelor, tehnica de corespondență fuzzy și nivelul de prag al scorului.
Pentru a obține rezultate optime, trebuie să executați tehnici de corespondență fuzzy cu parametri variabili și să găsiți valorile care se potrivesc cel mai bine datelor dvs. Mulți furnizori de soluții de corespondență fuzzy oferă astfel de capacități în cadrul soluțiilor lor, unde acești parametri pot fi ajustați, dar și personalizați în funcție de nevoile dvs.
Ce sunt tehnicile de corespondență fuzzy?
Există multe tehnici de corespondență fuzzy utilizate astăzi, care diferă în funcție de algoritmul sau formula utilizată pentru compararea și potrivirea câmpurilor. În funcție de natura datelor dvs., puteți alege tehnica care se potrivește cel mai bine nevoilor dvs. Iată o listă cu tehnici comune de corespondență fuzzy:
- Metode de similaritate bazate pe caractere care sunt cele mai bune pentru potrivirea șirurilor de caractere. Acestea includ:
- Distanța de editare: Calculează distanța dintre două șiruri de caractere, caracter cu caracter.
- Distanța de gap afin: Calculează distanța dintre două șiruri de caractere, luând în considerare și spațiile sau golurile dintre șiruri.
- Distanța Smith-Waterman: Calculează distanța dintre două șiruri de caractere, luând în considerare și prezența sau absența prefixelor și sufixelor.
- Distanța Jaro: Cel mai bun pentru potrivirea numelor și prenumelor.
- Metode de similaritate bazate pe tokeni care sunt cele mai bune pentru potrivirea cuvintelor complete din șiruri de caractere. Acestea includ:
- Șiruri atomice: Împarte șiruri lungi de caractere în cuvinte delimitate de punctuații și le compară pe cuvinte individuale.
- WHIRL: Asemănător cu șirurile atomice, dar WHIRL atribuie și greutăți fiecărui cuvânt.
- Metode de similaritate fonetică care sunt cele mai bune pentru compararea cuvintelor care sună asemănător, dar au o compoziție de caractere complet diferită. Acestea includ:
- Soundex: Cel mai bun pentru compararea numelor de familie care sunt diferite ca ortografie, dar sună asemănător.
- NYSIIS: Asemănător cu Soundex, dar păstrează și detalii despre poziția vocalelor.
- Metaphone: Compara cuvinte care sună asemănător, inclusiv cuvinte din limba engleză, nume de familie și prenume comune în SUA.
- Metode de similaritate numerică care compară numere, cât de departe sunt unul de altul, distribuția datelor numerice, etc.
Provocările corespondenței fuzzy
Procesul de corespondență fuzzy – în ciuda beneficiilor uimitoare pe care le oferă – poate fi destul de dificil de implementat. Iată câteva provocări comune cu care se confruntă afacerile:
1. Rată mai mare de rezultate false pozitive și negative
Multe soluții de corespondență fuzzy au o rată mai mare de rezultate false pozitive și negative. Acest lucru se întâmplă atunci când algoritmul clasifică în mod greșit potrivirile și nepotrivirile sau invers. Definițiile de potrivire configurabile și parametrii fuzzy pot ajuta la reducerea legăturilor incorecte cât mai mult posibil.
2. Complexitate computațională
În timpul procesului de potrivire, fiecare înregistrare este comparată cu fiecare altă înregistrare din același set de date. Și dacă lucrați cu multiple seturi de date, numărul de comparații crește și mai mult. S-a observat că comparațiile cresc în mod exponențial pe măsură ce crește dimensiunea bazei de date. Din acest motiv, trebuie să utilizați un sistem capabil să gestioneze calcule intensive.
3. Testarea de validare
Înregistrările potrivite sunt combinate pentru a reprezenta o vedere completă de 360 de grade a entităților. Orice eroare apărută în timpul acestui proces poate adăuga risc operațiunilor dvs. de afaceri. Din acest motiv, testarea de validare detaliată trebuie efectuată pentru a asigura că algoritmul ajustat produce în mod constant rezultate cu o rată de acuratețe ridicată.
Rezumat
Afacerile consideră adesea soluțiile de corespondență fuzzy ca proiecte complexe, consumatoare de resurse și costisitoare, care durează prea mult. Adevărul este că investiția într-o soluție potrivită care produce rezultate rapide și precise este cheia. Organizațiile trebuie să ia în considerare un număr de factori atunci când aleg o soluție de corespondență fuzzy, cum ar fi timpul și banii pe care sunt dispuși să îi investească, proiectarea de scalabilitate pe care o au în vedere și natura seturilor de date. Acest lucru le va ajuta să selecteze o soluție care să le permită să obțină maximum de beneficii din datele lor. Organizațiile trebuie să ia în considerare o serie de factori atunci când optează pentru o soluție de corespondență fuzzy, cum ar fi timpul și banii pe care sunt dispuși să îi investească, proiectarea de scalabilitate pe care o au în vedere și natura seturilor de date. Acest lucru le va ajuta să selecteze o soluție care să le permită să obțină maximum de beneficii din datele lor.












