Liderzy opinii

Dopasowanie nieostre – definicja, proces i techniki

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Badanie przeprowadzone przez Accenture wykazało, że 75% konsumentów woli kupować od detalistów, którzy znają ich imię i zachowania przy zakupach, a 52% z nich jest bardziej skłonnych do zmiany marki, jeśli nie oferują spersonalizowanych doświadczeń. Z milionami punktów danych przechwytywanych przez marki几乎 każdego dnia, identyfikacja unikalnych klientów i tworzenie ich profili jest jednym z największych wyzwań, przed którymi stają większość firm.

Gdy przedsiębiorstwo używa wielu narzędzi do przechwytywania danych, jest bardzo często, że nazwisko klienta jest niepoprawnie wpisane lub zaakceptowane z niepoprawnym wzorcem adresu e-mail. Ponadto, gdy rozproszone aplikacje danych mają różne informacje o tym samym kliencie, staje się to niemożliwe, aby uzyskać wgląd w zachowania i preferencje klienta.

Następnie dowiemy się, co to jest dopasowanie nieostre, jak jest wdrażane, jakie są powszechne techniki stosowane oraz jakie są wyzwania. Zaczynajmy.

Co to jest dopasowanie nieostre?

Dopasowanie nieostre jest techniką dopasowania danych, która porównuje dwie lub więcej rekordów i oblicza prawdopodobieństwo, że należą one do tej samej jednostki. Zamiast ogólnie klasyfikować rekordy jako dopasowane i niedopasowane, dopasowanie nieostre generuje liczbę (zwykle między 0-100%) wskazującą, jak prawdopodobne jest, że te rekordy należą do tego samego klienta, produktu, pracownika itp.

Wydajny algorytm dopasowania nieostrego zajmuje się szeregiem niejasności danych, takich jak odwrócenia imion i nazwisk, skróty, skrócone nazwy, fonetyczne i celowe błędy pisarskie, skróty, dodane lub usunięte znaki przestankowe itp.

Proces dopasowania nieostrego

Proces dopasowania nieostrego jest realizowany w następujący sposób:

  1. Rekordy profili dla podstawowych błędów standaryzacji. Te błędy są poprawione, aby osiągnąć jednolitą i standaryzowaną perspektywę we wszystkich rekordach.
  2. Wybierz i mapuj atrybuty na podstawie których będzie odbywało się dopasowanie nieostre. Ponieważ te atrybuty mogą mieć różne nazwy, muszą być mapowane w różnych źródłach.
  3. Wybierz technikę dopasowania nieostrego dla każdego atrybutu. Na przykład nazwy mogą być dopasowane na podstawie odległości klawiatury lub wariantów nazw, podczas gdy numery telefonów mogą być dopasowane na podstawie metryk podobieństwa numerycznego.
  4. Wybierz wagę dla każdego atrybutu, tak aby atrybuty z wyższymi wagami (lub wyższym priorytetem) miały większy wpływ na ogólny poziom ufności dopasowania w porównaniu z polami o niższych wagach.
  5. Określ poziom progowy – rekordy z wynikiem dopasowania nieostrego wyższym niż ten poziom są uważane za dopasowane, a te poniżej są niedopasowane.
  6. Uruchom algorytmy dopasowania nieostrego i przeanalizuj wyniki dopasowania.
  7. Nadpisz fałszywe pozytywy i negatywy, które mogą pojawić się.
  8. Połącz, usunięcie duplikatów lub po prostu usunięcie duplikatów rekordów.

Parametry dopasowania nieostrego

Z procesu zdefiniowanego powyżej wynika, że algorytm dopasowania nieostrego ma wiele parametrów, które tworzą podstawę tej techniki. Obejmują one wagę atrybutów, technikę dopasowania nieostrego i poziom progowy wyniku.

Aby uzyskać optymalne wyniki, należy wykonać techniki dopasowania nieostrego z różnymi parametrami i znaleźć wartości, które najlepiej odpowiadają Twoim danym. Wiele dostawców pakietuje takie możliwości w ramach swoich rozwiązań dopasowania nieostrego, w których te parametry są automatycznie dostosowywane, ale mogą być dostosowane w zależności od Twoich potrzeb.

Co to są techniki dopasowania nieostrego?

Istnieje wiele technik dopasowania nieostrego stosowanych dzisiaj, które różnią się w zależności od dokładnego algorytmu lub formuły użytej do porównania i dopasowania pól. W zależności od natury Twoich danych, możesz wybrać technikę, która jest odpowiednia dla Twoich wymagań. Oto lista powszechnych technik dopasowania nieostrego:

  1. Podobieństwo oparte na znakach metryki, które są najlepsze do dopasowania ciągów znaków. Obejmują one:
    1. Odległość edycyjna: Oblicza odległość między dwiema ciągami znaków, obliczaną znak po znaku.
    2. Odległość luki afrykańskiej: Oblicza odległość między dwiema ciągami znaków, biorąc pod uwagę również lukę lub spacje między ciągami.
    3. Odległość Smitha-Watermana: Oblicza odległość między dwiema ciągami znaków, biorąc pod uwagę również obecność lub brak prefiksów i sufiksów.
    4. Odległość Jaro: Najlepsza do dopasowania na imiona i nazwiska.
  2. Podobieństwo oparte na tokenach metryki, które są najlepsze do dopasowania pełnych słów w ciągach znaków. Obejmują one:
    1. Atomiczne ciągi znaków: Dzieli długie ciągi znaków na słowa oddzielone znakami przestankowymi i porównuje je z poszczególnymi słowami.
    2. WHIRL: Podobne do atomowych ciągów znaków, ale WHIRL również przypisuje wagi do każdego słowa.
  3. Metryki podobieństwa fonetycznego, które są najlepsze do porównywania słów, które brzmią podobnie, ale mają całkowicie różną kompozycję znaków. Obejmują one:
    1. Soundex: Najlepszy do porównywania nazwisk, które są różne w pisowni, ale brzmią podobnie.
    2. NYSIIS: Podobny do Soundex, ale również zachowuje szczegóły o położeniu samogłosek.
    3. Metaphone: Porównuje słowa, które brzmią podobnie, które istnieją w języku angielskim, inne słowa znane Amerykanom i imiona i nazwiska powszechnie używane w USA.
  4. Metryki podobieństwa numerycznego, które porównują liczby, jak daleko są one od siebie, dystrybucję danych numerycznych itp.

Wyzwania dopasowania nieostrego

Proces dopasowania nieostrego – pomimo niesamowitych korzyści, które oferuje – może być dość trudny do wdrożenia. Oto niektóre powszechne wyzwania, przed którymi stają się firmy:

1.     Wyższy wskaźnik fałszywych pozytywów i negatywów

Wiele rozwiązań dopasowania nieostrego ma wyższy wskaźnik fałszywych pozytywów i negatywów. To się zdarza, gdy algorytm niepoprawnie klasyfikuje dopasowania i niedopasowania lub odwrotnie. Konfigurowalne definicje dopasowań i parametry dopasowania nieostrego mogą pomóc zredukować niepoprawne połączenia jak najwięcej.

2.     Złożoność obliczeniowa

Podczas procesu dopasowania każdy rekord jest porównywany z każdym innym rekordem w tym samym zbiorze danych. A jeśli masz do czynienia z wieloma zbiorami danych, to liczba porównań wzrasta jeszcze bardziej. Zauważono, że porównania rosną kwadratowo wraz ze wzrostem rozmiaru bazy danych. Z tego powodu musisz użyć systemu, który jest w stanie obsłużyć obliczenia wymagające dużych zasobów.

3.     Walidacja testowa

Dopasowane rekordy są łączone, aby reprezentować pełny widok 360 stopni jednostek. Każdy błąd powstały podczas tego procesu może dodać ryzyko do Twoich operacji biznesowych. Dlatego też musi być przeprowadzona szczegółowa walidacja testowa, aby upewnić się, że dostrojony algorytm jest niezawodnie wytwarzany z wysokim wskaźnikiem dokładności.

Podsumowanie

Firmy często myślą o rozwiązaniach dopasowania nieostrego jako złożonych, wymagających zasobów i pieniędzy projektach, które trwają zbyt długo. Prawdą jest, że inwestowanie w odpowiednie rozwiązanie, które daje szybkie i dokładne wyniki, jest kluczem. Organizacje muszą wziąć pod uwagę szereg czynników przy wyborze narzędzia dopasowania nieostrego, takich jak czas i pieniądze, które są gotowe zainwestować, projekt skalowalności, jaki mają na myśli, oraz naturę ich zbiorów danych. To pomoże im wybrać rozwiązanie, które pozwoli im uzyskać najwięcej z ich danych.

Jestem analitykiem marketingu produktów w Data Ladder z doświadczeniem w branży IT. Piszę z pasją o prawdziwych problemach z higieną danych, z którymi borykają się wiele organizacji dzisiaj. Lubię komunikować rozwiązania, porady i praktyki, które mogą pomóc firmom w osiągnięciu wewnętrznej jakości danych w procesach analityki biznesowej. Staram się tworzyć treści skierowane do szerokiego grona odbiorców, od personelu technicznego po użytkowników końcowych, a także promować je na różnych platformach cyfrowych.