Leaders d’opinion
Appariement flou – Définition, processus et techniques

Une enquête Accenture a montré que 75 % des consommateurs préfèrent acheter auprès de détaillants qui connaissent leur nom et leur comportement d’achat, et que 52 % d’entre eux sont plus susceptibles de changer de marque s’ils n’offrent pas d’expériences personnalisées. Avec des millions de points de données capturés par les marques presque chaque jour, identifier les clients uniques et construire leur profil est l’un des plus grands défis auxquels sont confrontées la plupart des entreprises.
Lorsqu’une entreprise utilise plusieurs outils pour capturer des données, il est très courant de mal orthographier le nom d’un client ou d’accepter une adresse e-mail avec un modèle incorrect. De plus, lorsque des applications de données disparates ont des informations différentes sur le même client, il devient impossible d’obtenir des informations sur le comportement et les préférences du client.
Ensuite, nous allons apprendre ce qu’est l’appariement flou, comment il est mis en œuvre, les techniques courantes utilisées et les défis rencontrés. Commençons.
Qu’est-ce que l’appariement flou ?
L’appariement flou est une technique de mise en correspondance de données qui compare deux ou plusieurs enregistrements et calcule la probabilité qu’ils appartiennent à la même entité. Plutôt que de catégoriser les enregistrements de manière large en correspondance et non-correspondance, l’appariement flou produit un nombre (généralement compris entre 0 et 100 %) qui identifie la probabilité que ces enregistrements appartiennent au même client, produit, employé, etc.
Un algorithme d’appariement flou efficace prend soin d’une gamme d’ambiguïtés de données, telles que les inversions de prénom et de nom, les acronymes, les noms abrégés, les fautes d’orthographe phonétiques et délibérées, les abréviations, les ponctuations ajoutées ou supprimées, etc.
Processus d’appariement flou
Le processus d’appariement flou est effectué comme suit :
- Enregistrements de profil pour les erreurs de standardisation de base. Ces erreurs sont corrigées afin d’obtenir une vue uniforme et standardisée sur les enregistrements.
- Sélection et mappage des attributs sur lesquels l’appariement flou aura lieu. Puisque ces attributs peuvent avoir des titres différents, ils doivent être mappés sur les sources.
- Choix d’une technique d’appariement flou pour chaque attribut. Par exemple, les noms peuvent être mis en correspondance en fonction de la distance du clavier ou des variantes de noms, tandis que les numéros de téléphone peuvent être mis en correspondance en fonction de métriques de similarité numérique.
- Sélection d’un poids pour chaque attribut, de telle sorte que les attributs ayant des poids plus élevés (ou une priorité plus élevée) auront un impact plus important sur le niveau de confiance de correspondance global par rapport aux champs ayant des poids plus faibles.
- Définition du niveau de seuil – les enregistrements avec un score d’appariement flou supérieur au niveau sont considérés comme une correspondance et ceux qui sont en dessous sont une non-correspondance.
- Exécution des algorithmes d’appariement flou et analyse des résultats de correspondance.
- Annulation de tout faux positif et négatif qui pourrait survenir.
- Fusion, déduplication ou élimination simple des enregistrements en double.
Paramètres d’appariement flou
À partir du processus défini ci-dessus, vous pouvez voir qu’un algorithme d’appariement flou a un certain nombre de paramètres qui forment la base de cette technique. Ces paramètres incluent les poids d’attribut, la technique d’appariement flou et le niveau de score de seuil.
Pour obtenir des résultats optimaux, vous devez exécuter des techniques d’appariement flou avec des paramètres variables et trouver les valeurs qui conviennent le mieux à vos données. De nombreux fournisseurs regroupent ces capacités dans leur solution d’appariement flou, où ces paramètres sont réglés automatiquement mais peuvent être personnalisés en fonction de vos besoins.
Quelles sont les techniques d’appariement flou ?
Il existe de nombreuses techniques d’appariement flou utilisées aujourd’hui qui diffèrent en fonction de l’algorithme ou de la formule utilisée pour comparer et mettre en correspondance les champs. En fonction de la nature de vos données, vous pouvez choisir la technique qui convient le mieux à vos besoins. Voici une liste de techniques d’appariement flou courantes :
- Métriques de similarité basées sur les caractères qui sont les meilleures pour mettre en correspondance les chaînes de caractères. Celles-ci incluent :
- Distance d’édition : Calcule la distance entre deux chaînes de caractères, calculée caractère par caractère.
- Distance d’espacement affine : Calcule la distance entre deux chaînes de caractères en tenant compte également des espaces entre les chaînes.
- Distance de Smith-Waterman : Calcule la distance entre deux chaînes de caractères en tenant compte également de la présence ou de l’absence de préfixes et de suffixes.
- Distance de Jaro : Meilleure pour mettre en correspondance les prénoms et les noms de famille.
- Métriques de similarité basées sur les jetons qui sont les meilleures pour mettre en correspondance les mots complets dans les chaînes de caractères. Celles-ci incluent :
- Chaînes atomiques : divise les longues chaînes de caractères en mots délimités par des ponctuations et compare les mots individuels.
- WHIRL : similaire aux chaînes atomiques, mais WHIRL attribue également des poids à chaque mot.
- Métriques de similarité phonétique qui sont les meilleures pour comparer les mots qui se prononcent de manière similaire mais ont une composition de caractères complètement différente. Celles-ci incluent :
- Soundex : Meilleure pour comparer les noms de famille qui sont différents dans l’orthographe mais se prononcent de manière similaire.
- NYSIIS : Similaire à Soundex, mais NYSIIS conserve également des détails sur la position des voyelles.
- Métaphone : Compare les mots qui se prononcent de manière similaire qui existent dans la langue anglaise, d’autres mots familiers aux Américains et les prénoms et les noms de famille couramment utilisés aux États-Unis.
- Métriques de similarité numérique qui comparent les nombres, leur distance les uns par rapport aux autres, la distribution des données numériques, etc.
Les défis de l’appariement flou
Le processus d’appariement flou – malgré les avantages incroyables qu’il offre – peut être assez difficile à mettre en œuvre. Voici quelques défis courants auxquels les entreprises sont confrontées :
1. Taux plus élevé de faux positifs et de faux négatifs
De nombreuses solutions d’appariement flou ont un taux plus élevé de faux positifs et de faux négatifs. Cela se produit lorsque l’algorithme classe incorrectement les correspondances et les non-correspondances ou vice versa. Des définitions de correspondance configurables et des paramètres flous peuvent aider à réduire les liens incorrects autant que possible.
2. Complexité computationnelle
Au cours du processus de mise en correspondance, chaque enregistrement est comparé à chaque autre enregistrement dans le même jeu de données. Et si vous travaillez avec plusieurs jeux de données, le nombre de comparaisons augmente encore. On a constaté que les comparaisons augmentent de manière quadratique à mesure que la taille de la base de données augmente. C’est pourquoi vous devez utiliser un système capable de gérer des calculs intensifs.
3. Test de validation
Les enregistrements mis en correspondance sont fusionnés pour représenter une vue complète à 360 degrés des entités. Toute erreur survenue au cours de ce processus peut ajouter un risque à vos opérations commerciales. C’est pourquoi des tests de validation détaillés doivent être effectués pour garantir que l’algorithme réglé produit des résultats avec un taux de précision élevé.
Conclusion
Les entreprises pensent souvent que les solutions d’appariement flou sont des projets complexes, gourmands en ressources et coûteux qui durent trop longtemps. La vérité est que l’investissement dans la bonne solution qui produit des résultats rapides et précis est la clé. Les organisations doivent considérer un certain nombre de facteurs lorsqu’elles choisissent un outil d’appariement flou, tels que le temps et l’argent qu’elles sont prêtes à investir, la conception de mise à l’échelle qu’elles ont en tête et la nature de leurs jeux de données. Cela les aidera à sélectionner une solution qui leur permettra de tirer le meilleur parti de leurs données.












