Leader di pensiero
Corrispondenza fuzzy – Definizione, processo e tecniche

Un sondaggio di Accenture ha mostrato che il 75% dei consumatori preferisce acquistare da rivenditori che conoscono il loro nome e il loro comportamento di acquisto, e il 52% di loro è più probabile passare a un’altra marca se non offrono esperienze personalizzate. Con milioni di punti di dati catturati dalle aziende quasi ogni giorno, identificare i clienti unici e costruire i loro profili è una delle sfide più grandi affrontate dalla maggior parte delle aziende.
Quando un’azienda utilizza più strumenti per catturare i dati, è molto comune scrivere male il nome di un cliente o accettare un indirizzo e-mail con un pattern errato. Inoltre, quando le applicazioni di dati disparate hanno informazioni diverse sullo stesso cliente, è impossibile ottenere informazioni sul comportamento e le preferenze del cliente.
In seguito, impareremo cosa è la corrispondenza fuzzy, come viene implementata, le tecniche comuni utilizzate e le sfide affrontate. Iniziamo.
Cosa è la corrispondenza fuzzy?
La corrispondenza fuzzy è una tecnica di abbinamento dei dati che confronta due o più record e calcola la probabilità che appartengano alla stessa entità. Piuttosto che categorizzare in modo ampio i record come abbinamenti e non abbinamenti, la corrispondenza fuzzy produce un numero (di solito tra 0-100%) che identifica quanto è probabile che questi record appartengano allo stesso cliente, prodotto, dipendente, ecc.
Un algoritmo di corrispondenza fuzzy efficiente gestisce una gamma di ambiguità dei dati, come ad esempio l’inversione del nome e del cognome, gli acronimi, i nomi abbreviati, le misspellazioni fonetiche e deliberate, le abbreviazioni, l’aggiunta o la rimozione di punteggiature, ecc.
Processo di corrispondenza fuzzy
Il processo di corrispondenza fuzzy viene eseguito come segue:
- Registra i record per gli errori di standardizzazione di base. Questi errori vengono corretti in modo che si ottenga una visione uniforme e standardizzata dei record.
- Seleziona e mappa gli attributi in base ai quali verrà eseguita la corrispondenza fuzzy. Poiché questi attributi possono avere titoli diversi, devono essere mappati tra le fonti.
- Scegli una tecnica di corrispondenza fuzzy per ogni attributo. Ad esempio, i nomi possono essere abbinati in base alla distanza della tastiera o alle varianti del nome, mentre i numeri di telefono possono essere abbinati in base a metriche di similarità numerica.
- Assegna un peso a ogni attributo, in modo che gli attributi con pesi più alti (o priorità più alta) abbiano un impatto maggiore sul livello di confidenza dell’abbinamento complessivo rispetto ai campi con pesi più bassi.
- Definisci il livello di soglia – i record con un punteggio di corrispondenza fuzzy superiore al livello vengono considerati come abbinamenti e quelli che non raggiungono il livello vengono considerati come non abbinamenti.
- Esegui gli algoritmi di corrispondenza fuzzy e analizza i risultati dell’abbinamento.
- Ignora i falsi positivi e i falsi negativi che potrebbero verificarsi.
- Unisci, duplica o semplicemente elimina i record duplicati.
Parametri di corrispondenza fuzzy
Dal processo definito sopra, si può vedere che un algoritmo di corrispondenza fuzzy ha una serie di parametri che costituiscono la base di questa tecnica. Questi includono i pesi degli attributi, la tecnica di corrispondenza fuzzy e il livello di soglia del punteggio.
Per ottenere risultati ottimali, è necessario eseguire le tecniche di corrispondenza fuzzy con parametri diversi e trovare i valori che si adattano meglio ai propri dati. Molti vendor forniscono queste capacità all’interno della loro soluzione di corrispondenza fuzzy, dove questi parametri vengono regolati automaticamente, ma possono essere personalizzati in base alle esigenze.
Che cosa sono le tecniche di corrispondenza fuzzy?
Ci sono molte tecniche di corrispondenza fuzzy utilizzate oggi che differiscono in base all’algoritmo o alla formula utilizzata per confrontare e abbinare i campi. A seconda della natura dei propri dati, è possibile scegliere la tecnica che si adatta meglio alle proprie esigenze. Ecco un elenco di tecniche di corrispondenza fuzzy comuni:
- Metriche di similarità basate sui caratteri che sono migliori per abbinare stringhe. Queste includono:
- Distanza di editing: calcola la distanza tra due stringhe, calcolata carattere per carattere.
- Distanza di gap affine: calcola la distanza tra due stringhe, considerando anche lo spazio o le lacune tra le stringhe.
- Distanza di Smith-Waterman: calcola la distanza tra due stringhe, considerando anche la presenza o l’assenza di prefissi e suffissi.
- Distanza di Jaro: migliore per abbinare i nomi e i cognomi.
- Metriche di similarità basate sui token che sono migliori per abbinare parole complete nelle stringhe. Queste includono:
- Stringhe atomiche: divide le stringhe lunghe in parole delimitate da punteggiature e confronta le parole individuali.
- WHIRL: simile alle stringhe atomiche, ma WHIRL assegna anche pesi alle parole.
- Metriche di similarità fonetiche che sono migliori per confrontare parole che suonano simili ma hanno una composizione di caratteri completamente diversa. Queste includono:
- Soundex: migliore per confrontare i cognomi che sono diversi nell’ortografia ma simili nel suono.
- NYSIIS: simile a Soundex, ma NYSIIS mantiene anche i dettagli sulla posizione delle vocali.
- Metaphone: confronta parole che suonano simili che esistono nella lingua inglese, altre parole familiari agli americani e nomi e cognomi comunemente utilizzati negli Stati Uniti.
- Metriche di similarità numerica che confrontano i numeri, quanto sono lontani l’uno dall’altro, la distribuzione dei dati numerici, ecc.
Sfide della corrispondenza fuzzy
Il processo di corrispondenza fuzzy – nonostante i benefici incredibili che offre – può essere piuttosto difficile da implementare. Ecco alcune sfide comuni affrontate dalle aziende:
1. Alta percentuale di falsi positivi e negativi
Molte soluzioni di corrispondenza fuzzy hanno un’alta percentuale di falsi positivi e negativi. Ciò accade quando l’algoritmo classifica in modo errato gli abbinamenti e i non abbinamenti o viceversa. Le definizioni di abbinamento configurabili e i parametri fuzzy possono aiutare a ridurre i collegamenti errati il più possibile.
2. Complessità computazionale
Durante il processo di abbinamento, ogni record viene confrontato con ogni altro record nello stesso set di dati. E se si sta lavorando con più set di dati, il numero di confronti aumenta ulteriormente. È stato notato che i confronti crescono quadraticamente con la crescita delle dimensioni del database. Per questo motivo, è necessario utilizzare un sistema in grado di gestire calcoli intensivi.
3. Validazione dei test
I record abbinati vengono uniti per rappresentare una visione completa a 360 gradi delle entità. Qualsiasi errore che si verifica durante questo processo può aggiungere rischi alle operazioni aziendali. È per questo che è necessario condurre test di validazione dettagliati per assicurarsi che l’algoritmo regolato produca risultati con un alto tasso di precisione.
Riepilogo
Le aziende spesso pensano alle soluzioni di corrispondenza fuzzy come progetti complessi, intensivi in termini di risorse e costosi che richiedono troppo tempo. La verità è che investire nella soluzione giusta che produce risultati rapidi e precisi è la chiave. Le organizzazioni devono considerare un certo numero di fattori quando scelgono uno strumento di corrispondenza fuzzy, come il tempo e il denaro che sono disposti a investire, il design di scalabilità che hanno in mente e la natura dei loro set di dati. Ciò aiuterà a selezionare una soluzione che consenta di ottenere il massimo dai propri dati.
Le organizzazioni devono considerare un certo numero di fattori mentre scelgono uno strumento di corrispondenza fuzzy, come il tempo e il denaro che sono disposti a investire, il design di scalabilità che hanno in mente e la natura dei loro set di dati. Ciò aiuterà a selezionare una soluzione che consenta di ottenere il massimo dai propri dati.












