Лидеры мнений

Нечеткое совпадение – определение, процесс и методы

mm
Добавьте Unite.AI в избранные источники в Google

Опрос Accenture показал, что 75% потребителей предпочитают покупать у ритейлеров, которые знают их имя и поведение при покупке, и 52% из них с большей вероятностью перейдут к другим брендам, если они не предлагают персонализированные trải nghiệm. С учетом миллионов данных, которые бренды захватывают почти каждый день, определение уникальных клиентов и построение их профилей является одной из самых больших проблем, с которыми сталкиваются большинство компаний.

Когда предприятие использует несколько инструментов для сбора данных, очень часто происходит опечатка в имени клиента или принятие электронного адреса с неправильным шаблоном. Кроме того, когда различные приложения для сбора данных имеют разную информацию о одном и том же клиенте, становится невозможно получить представление о поведении и предпочтениях клиентов.

Далее мы узнаем, что такое нечеткое совпадение, как оно реализуется, какие методы используются и какие проблемы возникают. Давайте начнем.

Что такое нечеткое совпадение?

Нечеткое совпадение – это метод сопоставления данных, который сравнивает две или более записи и рассчитывает вероятность того, что они принадлежат одному и тому же объекту. Вместо того, чтобы широко категоризировать записи как совпадение и несовпадение, нечеткое совпадение выводит число (обычно между 0-100%), которое определяет, насколько вероятно, что эти записи принадлежат одному и тому же клиенту, продукту, сотруднику и т. д.

Эффективный алгоритм нечеткого совпадения учитывает ряд неоднозначностей в данных, таких как обратные имена и фамилии, аббревиатуры, сокращенные имена, фонетические и намеренные опечатки, аббревиатуры, добавленные или удаленные знаки препинания и т. д.

Процесс нечеткого совпадения

Процесс нечеткого совпадения выполняется следующим образом:

  1. Стандартизация записей для базовых ошибок стандартизации. Эти ошибки исправляются, чтобы получить унифицированное и стандартизированное представление записей.
  2. Выбор и сопоставление атрибутов на основе которых будет выполняться нечеткое совпадение. Поскольку эти атрибуты могут иметь разные названия, они должны быть сопоставлены между источниками.
  3. Выбор метода нечеткого совпадения для каждого атрибута. Например, имена можно сопоставлять на основе расстояния клавиатуры или вариантов имен, а номера телефонов можно сопоставлять на основе числовых метрик подобия.
  4. Выбор веса для каждого атрибута, так что атрибуты с более высокими весами (или более высоким приоритетом) будут иметь больше влияния на общий уровень уверенности в совпадении по сравнению с полями, имеющими более низкие веса.
  5. Определение порогового уровня – записи с результатом нечеткого совпадения выше этого уровня считаются совпадением, а те, которые ниже, – несовпадением.
  6. Выполнение алгоритмов нечеткого совпадения и анализ результатов совпадения.
  7. Переопределение ложных положительных и отрицательных результатов, которые могут возникнуть.
  8. Объединение, удаление дубликатов или просто удаление дубликатов записей.

Параметры нечеткого совпадения

Из описанного выше процесса можно видеть, что алгоритм нечеткого совпадения имеет ряд параметров, которые образуют основу этого метода. К ним относятся веса атрибутов, метод нечеткого совпадения и пороговый уровень балла.

Чтобы получить оптимальные результаты, необходимо выполнить методы нечеткого совпадения с разными параметрами и найти значения, которые лучше всего подходят для ваших данных. Многие поставщики включают такие возможности в свои решения по нечеткому совпадению, где эти параметры автоматически настраиваются, но могут быть настроены в зависимости от ваших потребностей.

Какие методы нечеткого совпадения существуют?

Существует множество методов нечеткого совпадения, используемых сегодня, которые различаются в зависимости от точного алгоритма или формулы, используемой для сравнения и сопоставления полей. В зависимости от характера ваших данных вы можете выбрать метод, который лучше всего подходит для ваших потребностей. Вот список распространенных методов нечеткого совпадения:

  1. Метрики подобия на основе символов, которые лучше всего подходят для сопоставления строк. К ним относятся:
    1. Расстояние редактирования: рассчитывает расстояние между двумя строками, вычисленное символ за символом.
    2. Расстояние с аффинным зазором: рассчитывает расстояние между двумя строками, учитывая также пробелы или зазоры между строками.
    3. Расстояние Смита-Ватермана: рассчитывает расстояние между двумя строками, учитывая также наличие или отсутствие префиксов и суффиксов.
    4. Расстояние Джаро: лучше всего подходит для сопоставления имен и фамилий.
  2. Метрики подобия на основе токенов, которые лучше всего подходят для сопоставления полных слов в строках. К ним относятся:
    1. Атомарные строки: делит длинные строки на слова, разделенные знаками препинания, и сравнивает их по отдельным словам.
    2. WHIRL: аналогичен атомарным строкам, но WHIRL также присваивает веса каждому слову.
  3. Фонетические метрики подобия, которые лучше всего подходят для сравнения слов, которые звучат похоже, но имеют совершенно разную структуру символов. К ним относятся:
    1. Soundex: лучше всего подходит для сравнения фамилий, которые пишутся по-разному, но звучат одинаково.
    2. NYSIIS: аналогичен Soundex, но также сохраняет информацию о положении гласных.
    3. Metaphone: сравнивает слова, которые звучат похоже, существующие в английском языке, а также имена и фамилии, часто используемые в США.
  4. Числовые метрики подобия, которые сравнивают числа, их расстояние друг от друга, распределение числовых данных и т. д.

Проблемы нечеткого совпадения

Процесс нечеткого совпадения – несмотря на потрясающие преимущества, которые он предлагает, – может быть довольно сложным для реализации. Вот некоторые общие проблемы, с которыми сталкиваются бизнесы:

1.     Более высокий уровень ложных положительных и отрицательных результатов

Многие решения нечеткого совпадения имеют более высокий уровень ложных положительных и отрицательных результатов. Это происходит, когда алгоритм неправильно классифицирует совпадения и несовпадения или наоборот. Настраиваемые определения совпадений и параметры нечеткого совпадения могут помочь уменьшить количество неправильных связей как можно больше.

2.     Вычислительная сложность

Во время процесса сопоставления каждая запись сравнивается с каждой другой записью в одной и той же базе данных. И если вы работаете с несколькими базами данных, то количество сравнений увеличивается еще больше. Обратили внимание, что сравнения растут квадратично с ростом размера базы данных. По этой причине вы должны использовать систему, способную обрабатывать вычислительные ресурсы.

3.     Проверка тестирования

Сопоставленные записи объединяются вместе, чтобы представить полную 360-градусную картину объектов. Любая ошибка, возникшая во время этого процесса, может добавить риски для ваших бизнес-операций. Поэтому необходимо провести подробное тестирование, чтобы убедиться, что настроенный алгоритм последовательно производит результаты с высоким уровнем точности.

Итог

Бизнесы часто считают решения нечеткого совпадения сложными, ресурсоемкими и дорогостоящими проектами, которые длятся слишком долго. Правда в том, что инвестиции в правильное решение, которое производит быстрые и точные результаты, является ключом. Организации должны учитывать ряд факторов при выборе инструмента нечеткого совпадения, таких как время и деньги, которые они готовы инвестировать, проект масштабируемости, который они имеют в виду, и характер их наборов данных. Это поможет им выбрать решение, которое позволит им получить максимальную пользу от своих данных.

Я являюсь аналитиком по маркетингу продукта в Data Ladder с опытом работы в области информационных технологий. Я с увлечением пишу о реальных проблемах, связанных с гигиеной данных, с которыми сталкиваются многие организации сегодня. Мне нравится общаться решения, советы и практики, которые могут помочь бизнесу достичь внутреннего качества данных в процессах бизнес-интеллекта. Я стремлюсь создавать контент, ориентированный на широкий круг аудитории, от технического персонала до конечных пользователей, а также продвигать его на различных цифровых платформах.