Líderes de opinión
Coincidencia difusa – Definición, Proceso y Técnicas

Una encuesta de Accenture mostró que el 75% de los consumidores prefieren comprar a minoristas que conocen su nombre y comportamiento de compra, y el 52% de ellos es más probable que cambie de marca si no ofrecen experiencias personalizadas. Con millones de puntos de datos capturados por las marcas casi todos los días, identificar a los clientes únicos y crear sus perfiles es uno de los mayores desafíos que enfrentan la mayoría de las empresas.
Cuando una empresa utiliza varias herramientas para capturar datos, es muy común que se escriba mal el nombre de un cliente o que se acepte una dirección de correo electrónico con un patrón incorrecto. Además, cuando las aplicaciones de datos dispares tienen información diferente sobre el mismo cliente, es imposible obtener información sobre su comportamiento y preferencias.
A continuación, aprenderemos qué es la coincidencia difusa, cómo se implementa, las técnicas comunes utilizadas y los desafíos que se enfrentan. Comencemos.
¿Qué es la coincidencia difusa?
La coincidencia difusa es una técnica de coincidencia de datos que compara dos o más registros y calcula la probabilidad de que pertenezcan a la misma entidad. En lugar de categorizar ampliamente los registros como coincidencia y no coincidencia, la coincidencia difusa produce un número (generalmente entre 0-100%) que identifica cuán probable es que estos registros pertenezcan al mismo cliente, producto, empleado, etc.
Un algoritmo de coincidencia difusa eficiente maneja una serie de ambigüedades de datos, como la reversión de nombres y apellidos, acrónimos, nombres abreviados, errores de escritura fonética y deliberados, abreviaturas, puntuaciones agregadas o eliminadas, etc.
Proceso de coincidencia difusa
El proceso de coincidencia difusa se lleva a cabo de la siguiente manera:
- Registros de perfil para errores de estandarización básicos. Estos errores se corrigen para que se logre una vista uniforme y estandarizada en todos los registros.
- Seleccionar y asignar atributos en función de los cuales se realizará la coincidencia difusa. Dado que estos atributos pueden tener títulos diferentes, deben asignarse en las fuentes.
- Seleccionar una técnica de coincidencia difusa para cada atributo. Por ejemplo, los nombres pueden coincidir en función de la distancia del teclado o las variantes de nombres, mientras que los números de teléfono pueden coincidir en función de la similitud numérica.
- Asignar un peso a cada atributo, de modo que los atributos con pesos más altos (o prioridad más alta) tengan un impacto mayor en el nivel general de confianza de la coincidencia en comparación con los campos con pesos más bajos.
- Definir el nivel de umbral – los registros con una puntuación de coincidencia difusa superior al nivel se consideran coincidencias y los que no alcanzan el nivel se consideran no coincidencias.
- Ejecutar algoritmos de coincidencia difusa y analizar los resultados de la coincidencia.
- Anular cualquier falso positivo y negativo que pueda surgir.
- Combinar, deduplicar o simplemente eliminar los registros duplicados.
Parámetros de coincidencia difusa
A partir del proceso definido anteriormente, puede ver que un algoritmo de coincidencia difusa tiene una serie de parámetros que forman la base de esta técnica. Estos incluyen los pesos de los atributos, la técnica de coincidencia difusa y el nivel de puntuación de umbral.
Para obtener resultados óptimos, debe ejecutar técnicas de coincidencia difusa con parámetros variables y encontrar los valores que mejor se adapten a sus datos. Muchos proveedores empaquetan estas capacidades dentro de su solución de coincidencia difusa, donde estos parámetros se ajustan automáticamente, pero se pueden personalizar según sea necesario.
¿Cuáles son las técnicas de coincidencia difusa?
Hay muchas técnicas de coincidencia difusa utilizadas hoy en día que difieren según el algoritmo o fórmula utilizados para comparar y coincidir campos. Dependiendo de la naturaleza de sus datos, puede elegir la técnica que mejor se adapte a sus necesidades. A continuación, se muestra una lista de técnicas de coincidencia difusa comunes:
- Métricas de similitud basadas en caracteres que son mejores para coincidir cadenas. Estas incluyen:
- Distancia de edición: Calcula la distancia entre dos cadenas, computada carácter por carácter.
- Distancia de brecha afín: Calcula la distancia entre dos cadenas, considerando también la brecha o espacios entre cadenas.
- Distancia de Smith-Waterman: Calcula la distancia entre dos cadenas, considerando también la presencia o ausencia de prefijos y sufijos.
- Distancia de Jaro: Mejor para coincidir en nombres y apellidos.
- Métricas de similitud basadas en tokens que son mejores para coincidir palabras completas en cadenas. Estas incluyen:
- Cadenas atómicas: Divide cadenas largas en palabras delimitadas por puntuaciones y compara en palabras individuales.
- WHIRL: Similar a las cadenas atómicas, pero WHIRL también asigna pesos a cada palabra.
- Métricas de similitud fonética que son mejores para comparar palabras que suenan similares pero tienen una composición de caracteres completamente diferente. Estas incluyen:
- Soundex: Mejor para comparar apellidos que son diferentes en ortografía pero suenan similares.
- NYSIIS: Similar a Soundex, pero también retiene detalles sobre la posición de las vocales.
- Metaphone: Compara palabras que suenan similares que existen en el idioma inglés, otras palabras familiares para los estadounidenses y nombres y apellidos comúnmente utilizados en los Estados Unidos.
- Métricas de similitud numérica que comparan números, cuán lejos están entre sí, la distribución de datos numéricos, etc.
Desafíos de la coincidencia difusa
El proceso de coincidencia difusa – a pesar de los beneficios increíbles que ofrece – puede ser bastante difícil de implementar. A continuación, se presentan algunos desafíos comunes que enfrentan las empresas:
1. Tasa más alta de falsos positivos y negativos
Muchas soluciones de coincidencia difusa tienen una tasa más alta de falsos positivos y negativos. Esto ocurre cuando el algoritmo clasifica incorrectamente las coincidencias y no coincidencias o viceversa. Las definiciones de coincidencia configurables y los parámetros difusos pueden ayudar a reducir los enlaces incorrectos tanto como sea posible.
2. Complejidad computacional
Durante el proceso de coincidencia, cada registro se compara con todos los demás registros en el mismo conjunto de datos. Y si está tratando con varios conjuntos de datos, el número de comparaciones aumenta más. Se ha observado que las comparaciones crecen cuadráticamente a medida que crece el tamaño de la base de datos. Por esta razón, debe utilizar un sistema que sea capaz de manejar cálculos intensivos en recursos.
3. Validación de pruebas
Los registros coincidentes se combinan para representar una visión completa de 360 grados de las entidades. Cualquier error incurrido durante este proceso puede agregar riesgo a las operaciones comerciales. Es por eso que se deben realizar pruebas de validación detalladas para garantizar que el algoritmo ajustado produzca resultados consistentemente con una tasa de precisión alta.
Conclusión
Las empresas a menudo piensan que las soluciones de coincidencia difusa son proyectos complejos, intensivos en recursos y costosos que duran demasiado tiempo. La verdad es que invertir en la solución adecuada que produce resultados rápidos y precisos es la clave. Las organizaciones necesitan considerar una serie de factores al optar por una herramienta de coincidencia difusa, como el tiempo y el dinero que están dispuestas a invertir, el diseño de escalabilidad que tienen en mente y la naturaleza de sus conjuntos de datos. Esto les ayudará a seleccionar una solución que les permita obtener el máximo provecho de sus datos.












