Лідери думок
Розмитне збігання – визначення, процес і техніки

Опитування Accenture показало, що 75% споживачів віддають перевагу покупкам у рітейлерів, які знають їхнє ім’я та поведінку під час покупок, а 52% із них більш схильні змінити бренд, якщо їм не пропонують персоналізовані досвіди. З мільйонами даних, що фіксуються брендами майже щодня, ідентифікація унікальних клієнтів та створення їхніх профілів є однією з найбільших проблем, з якими стикаються більшість компаній.
Коли підприємство використовує кілька інструментів для збору даних, досить часто трапляється, що ім’я клієнта написано з помилкою або прийнято електронну адресу з неправильним шаблоном. Крім того, коли різні програми обробки даних мають різну інформацію про одного й того самого клієнта, стає неможливо отримати уявлення про поведінку клієнта та його вподобання.
Далі ми дізнаємось, що таке розмитне збігання, як воно реалізується, які техніки використовуються та які проблеми виникають. Почнімо.
Що таке розмитне збігання?
Розмитне збігання – це техніка збігання даних, яка порівнює дві або більше записи та обчислює ймовірність того, що вони належать до однієї й тієї ж сутності. Замість того, щоб широко категоризувати записи як збіг та не-збіг, розмитне збігання виводить число (зазвичай між 0-100%), яке ідентифікує, наскільки ймовірно, що ці записи належать до одного й того самого клієнта, продукту, працівника тощо.
Ефективний алгоритм розмитного збігання займається рядом неоднозначностей даних, таких як помилки у імені та прізвищі, абревіатури, скорочені імена, фонетичні та навмисні помилки, абревіатури, додані/видалені знаки пунктуації тощо.
Процес розмитного збігання
Процес розмитного збігання проводиться наступним чином:
- Створити профіль записів для базових стандартних помилок. Ці помилки виправляються, щоб досягти уніфікованого та стандартизованого вигляду записів.
- Вибрати та зіставити атрибути на основі яких буде проводитись розмитне збігання. Оскільки ці атрибути можуть мати різні назви, їх потрібно зіставити між джерелами.
- Вибрати техніку розмитного збігання для кожного атрибуту. Наприклад, імена можна зіставляти на основі клавішної відстані або варіантів імен, тоді як номери телефонів можна зіставляти на основі числової подібності.
- Вибрати вагу для кожного атрибуту, так що атрибути з вищою вагою (або вищим пріоритетом) будуть мати більший вплив на загальний рівень впевненості у збігу порівняно з полями, що мають нижчу вагу.
- Визначити рівень порогу – записи з результатом розмитного збігання вищим за цей рівень вважаються збігом, а ті, що нижче – не-збігом.
- Виконати алгоритми розмитного збігання та проаналізувати результати збігання.
- Перевірити будь-які хибні позитиви та негативи, які можуть виникнути.
- Об’єднати, видалити дублікати або просто видалити дублікатні записи.
Параметри розмитного збігання
З визначеного вище процесу можна побачити, що алгоритм розмитного збігання має ряд параметрів, які становлять основу цієї техніки. До них належать ваги атрибутів, техніка розмитного збігання та рівень порогу.
Для отримання оптимальних результатів потрібно виконувати техніки розмитного збігання з різними параметрами та знайти значення, які найкраще підходять вашим даним. Багато постачальників пропонують такі можливості у своїх рішеннях розмитного збігання, де ці параметри автоматично налаштовуються, але можуть бути налаштовані залежно від ваших потреб.
Які техніки розмитного збігання?
Існує багато технік розмитного збігання, які використовуються сьогодні і відрізняються за точним алгоритмом або формулою, яка використовується для порівняння та збігання полів. залежно від характеру ваших даних, ви можете вибрати техніку, яка підходить вашим вимогам. Ось перелік поширених технік розмитного збігання:
- Похідна подібність на основі символів метрик, які найкраще підходять для збігання рядків. До них належать:
- Відстань редагування: Обчислює відстань між двома рядками, обчислену символ за символом.
- Відстань афінного розриву: Обчислює відстань між двома рядками, враховуючи також розриви або пробіли між рядками.
- Відстань Сміт-Вотермана: Обчислює відстань між двома рядками, враховуючи також наявність або відсутність префіксів і суфіксів.
- Відстань Джаро: Найкраще підходить для збігання імен та прізвищ.
- Похідна подібність на основі токенів метрик, які найкраще підходять для збігання повних слів у рядках. До них належать:
- Атомарні рядки: Ділить довгі рядки на слова, розділені знаками пунктуації, та порівнює окремі слова.
- WHIRL: Подібний до атомарних рядків, але WHIRL також присвоює ваги кожному слову.
- Фонетична подібність метрик, які найкраще підходять для порівняння слів, які звучать схоже, але мають зовсім іншу символьну структуру. До них належать:
- Soundex: Найкраще підходить для порівняння прізвищ, які написані по-різному, але звучать схоже.
- NYSIIS: Подібний до Soundex, але також зберігає інформацію про положення голосних.
- Метафон: Порівнює схоже звучні слова, які існують в англійській мові, інші слова, знайомі американцям, та імена та прізвища, поширені в США.
- Числова подібність метрик, які порівнюють числа, їхню відстань один від одного, розподіл числових даних тощо.
Проблеми розмитного збігання
Процес розмитного збігання – незважаючи на неймовірні переваги, які він пропонує, – може бути досить складним для реалізації. Ось деякі поширені проблеми, з якими стикаються підприємства:
1. Більша кількість хибних позитивів і негативів
Багато рішень розмитного збігання мають більшу кількість хибних позитивів і негативів. Це відбувається, коли алгоритм неправильно класифікує збіги та не-збіги або навпаки. Конфігуровані визначення збігів та параметри розмитного збігання можуть допомогти зменшити неправильні зв’язки якомога більше.
2. Обчислювальна складність
Під час процесу збігання кожен запис порівнюється з кожним іншим записом у тому ж наборі даних. І якщо ви працюєте з кількома наборами даних, то кількість порівнянь зростає ще більше. Було помічено, що порівняння зростають квадратично з ростом розміру бази даних. Через це вам потрібно використовувати систему, яка здатна обробляти ресурсоємні обчислення.
3. Перевірка тестування
Збігаються записи об’єднуються, щоб представити повний 360-градусний вигляд сутностей. Будь-яка помилка, що виникає під час цього процесу, може додати ризик до ваших бізнес-операцій. Через це потрібно провести детальне тестування перевірки, щоб забезпечити, що налаштований алгоритм постійно видає результати з високим рівнем точності.
Висновок
Підприємства часто вважають рішення розмитного збігання складними, ресурсоємними та коштоємкими проектами, які тривають занадто довго. Правда полягає в тому, що інвестування у правильне рішення, яке видає швидкі та точні результати, є ключем. Організаціям потрібно враховувати ряд факторів під час вибору інструменту розмитного збігання, таких як час і гроші, які вони готові інвестувати, проект масштабування, який вони мають на увазі, та характер їхніх наборів даних. Це допоможе їм вибрати рішення, яке дозволить їм отримати максимальну вигоду від своїх даних.












