Лидеры мнений
Нечеткое совпадение – определение, процесс и методы

Опрос Accenture показал, что 75% потребителей предпочитают покупать у ритейлеров, которые знают их имя и поведение при покупке, и 52% из них с большей вероятностью перейдут к другим брендам, если они не предлагают персонализированные trải nghiệm. С учетом миллионов данных, которые бренды захватывают почти каждый день, определение уникальных клиентов и построение их профилей является одной из самых больших проблем, с которыми сталкиваются большинство компаний.
Когда предприятие использует несколько инструментов для сбора данных, очень часто происходит опечатка в имени клиента или принятие электронного адреса с неправильным шаблоном. Кроме того, когда различные приложения для сбора данных имеют разную информацию о одном и том же клиенте, становится невозможно получить представление о поведении и предпочтениях клиентов.
Далее мы узнаем, что такое нечеткое совпадение, как оно реализуется, какие методы используются и какие проблемы возникают. Давайте начнем.
Что такое нечеткое совпадение?
Нечеткое совпадение – это метод сопоставления данных, который сравнивает две или более записи и рассчитывает вероятность того, что они принадлежат одному и тому же объекту. Вместо того, чтобы широко категоризировать записи как совпадение и несовпадение, нечеткое совпадение выводит число (обычно между 0-100%), которое определяет, насколько вероятно, что эти записи принадлежат одному и тому же клиенту, продукту, сотруднику и т. д.
Эффективный алгоритм нечеткого совпадения учитывает ряд неоднозначностей в данных, таких как обратные имена и фамилии, аббревиатуры, сокращенные имена, фонетические и намеренные опечатки, аббревиатуры, добавленные или удаленные знаки препинания и т. д.
Процесс нечеткого совпадения
Процесс нечеткого совпадения выполняется следующим образом:
- Стандартизация записей для базовых ошибок стандартизации. Эти ошибки исправляются, чтобы получить унифицированное и стандартизированное представление записей.
- Выбор и сопоставление атрибутов на основе которых будет выполняться нечеткое совпадение. Поскольку эти атрибуты могут иметь разные названия, они должны быть сопоставлены между источниками.
- Выбор метода нечеткого совпадения для каждого атрибута. Например, имена можно сопоставлять на основе расстояния клавиатуры или вариантов имен, а номера телефонов можно сопоставлять на основе числовых метрик подобия.
- Выбор веса для каждого атрибута, так что атрибуты с более высокими весами (или более высоким приоритетом) будут иметь больше влияния на общий уровень уверенности в совпадении по сравнению с полями, имеющими более низкие веса.
- Определение порогового уровня – записи с результатом нечеткого совпадения выше этого уровня считаются совпадением, а те, которые ниже, – несовпадением.
- Выполнение алгоритмов нечеткого совпадения и анализ результатов совпадения.
- Переопределение ложных положительных и отрицательных результатов, которые могут возникнуть.
- Объединение, удаление дубликатов или просто удаление дубликатов записей.
Параметры нечеткого совпадения
Из описанного выше процесса можно видеть, что алгоритм нечеткого совпадения имеет ряд параметров, которые образуют основу этого метода. К ним относятся веса атрибутов, метод нечеткого совпадения и пороговый уровень балла.
Чтобы получить оптимальные результаты, необходимо выполнить методы нечеткого совпадения с разными параметрами и найти значения, которые лучше всего подходят для ваших данных. Многие поставщики включают такие возможности в свои решения по нечеткому совпадению, где эти параметры автоматически настраиваются, но могут быть настроены в зависимости от ваших потребностей.
Какие методы нечеткого совпадения существуют?
Существует множество методов нечеткого совпадения, используемых сегодня, которые различаются в зависимости от точного алгоритма или формулы, используемой для сравнения и сопоставления полей. В зависимости от характера ваших данных вы можете выбрать метод, который лучше всего подходит для ваших потребностей. Вот список распространенных методов нечеткого совпадения:
- Метрики подобия на основе символов, которые лучше всего подходят для сопоставления строк. К ним относятся:
- Расстояние редактирования: рассчитывает расстояние между двумя строками, вычисленное символ за символом.
- Расстояние с аффинным зазором: рассчитывает расстояние между двумя строками, учитывая также пробелы или зазоры между строками.
- Расстояние Смита-Ватермана: рассчитывает расстояние между двумя строками, учитывая также наличие или отсутствие префиксов и суффиксов.
- Расстояние Джаро: лучше всего подходит для сопоставления имен и фамилий.
- Метрики подобия на основе токенов, которые лучше всего подходят для сопоставления полных слов в строках. К ним относятся:
- Атомарные строки: делит длинные строки на слова, разделенные знаками препинания, и сравнивает их по отдельным словам.
- WHIRL: аналогичен атомарным строкам, но WHIRL также присваивает веса каждому слову.
- Фонетические метрики подобия, которые лучше всего подходят для сравнения слов, которые звучат похоже, но имеют совершенно разную структуру символов. К ним относятся:
- Soundex: лучше всего подходит для сравнения фамилий, которые пишутся по-разному, но звучат одинаково.
- NYSIIS: аналогичен Soundex, но также сохраняет информацию о положении гласных.
- Metaphone: сравнивает слова, которые звучат похоже, существующие в английском языке, а также имена и фамилии, часто используемые в США.
- Числовые метрики подобия, которые сравнивают числа, их расстояние друг от друга, распределение числовых данных и т. д.
Проблемы нечеткого совпадения
Процесс нечеткого совпадения – несмотря на потрясающие преимущества, которые он предлагает, – может быть довольно сложным для реализации. Вот некоторые общие проблемы, с которыми сталкиваются бизнесы:
1. Более высокий уровень ложных положительных и отрицательных результатов
Многие решения нечеткого совпадения имеют более высокий уровень ложных положительных и отрицательных результатов. Это происходит, когда алгоритм неправильно классифицирует совпадения и несовпадения или наоборот. Настраиваемые определения совпадений и параметры нечеткого совпадения могут помочь уменьшить количество неправильных связей как можно больше.
2. Вычислительная сложность
Во время процесса сопоставления каждая запись сравнивается с каждой другой записью в одной и той же базе данных. И если вы работаете с несколькими базами данных, то количество сравнений увеличивается еще больше. Обратили внимание, что сравнения растут квадратично с ростом размера базы данных. По этой причине вы должны использовать систему, способную обрабатывать вычислительные ресурсы.
3. Проверка тестирования
Сопоставленные записи объединяются вместе, чтобы представить полную 360-градусную картину объектов. Любая ошибка, возникшая во время этого процесса, может добавить риски для ваших бизнес-операций. Поэтому необходимо провести подробное тестирование, чтобы убедиться, что настроенный алгоритм последовательно производит результаты с высоким уровнем точности.
Итог
Бизнесы часто считают решения нечеткого совпадения сложными, ресурсоемкими и дорогостоящими проектами, которые длятся слишком долго. Правда в том, что инвестиции в правильное решение, которое производит быстрые и точные результаты, является ключом. Организации должны учитывать ряд факторов при выборе инструмента нечеткого совпадения, таких как время и деньги, которые они готовы инвестировать, проект масштабируемости, который они имеют в виду, и характер их наборов данных. Это поможет им выбрать решение, которое позволит им получить максимальную пользу от своих данных.












