Vordenker
Fuzzy Matching – Definition, Prozess und Techniken

Eine Accenture-Umfrage zeigte, dass 75% der Verbraucher es bevorzugen, bei Einzelhändlern zu kaufen, die ihren Namen und ihr Kaufverhalten kennen, und 52% von ihnen sind eher bereit, zu einer anderen Marke zu wechseln, wenn sie keine personalisierten Erfahrungen anbieten. Da Unternehmen jeden Tag Millionen von Datenpunkten erfassen, ist die Identifizierung einzigartiger Kunden und die Erstellung ihrer Profile eine der größten Herausforderungen, mit denen die meisten Unternehmen konfrontiert sind.
Wenn ein Unternehmen mehrere Tools zur Datenerfassung verwendet, ist es sehr häufig, dass ein Kundenname falsch geschrieben wird oder eine E-Mail-Adresse mit einem falschen Muster akzeptiert wird. Darüber hinaus ist es, wenn verschiedene Datenanwendungen unterschiedliche Informationen über denselben Kunden haben, unmöglich, Einblicke in das Kundenverhalten und die Vorlieben zu erhalten.
Als nächstes werden wir erfahren, was Fuzzy Matching ist, wie es implementiert wird, die gängigen Techniken, die verwendet werden, und die Herausforderungen, die auftreten. Lassen Sie uns beginnen.
Was ist Fuzzy Matching?
Fuzzy Matching ist eine Datenabgleich-Technik, die zwei oder mehr Datensätze vergleicht und die Wahrscheinlichkeit berechnet, dass sie zur gleichen Entität gehören. Anstatt Datensätze grob in Übereinstimmungen und Nicht-Übereinstimmungen einzuteilen, gibt Fuzzy Matching eine Zahl (normalerweise zwischen 0-100%) aus, die angibt, wie wahrscheinlich es ist, dass diese Datensätze zur gleichen Person, zum gleichen Produkt, zum gleichen Mitarbeiter usw. gehören.
Ein effizientes Fuzzy-Matching-Algorithmus berücksichtigt eine Reihe von Datenunsicherheiten, wie z. B. Umkehrungen von Vor- und Nachnamen, Abkürzungen, verkürzte Namen, phonetische und vorsätzliche Tippfehler, Abkürzungen, hinzugefügte oder entfernte Interpunktionen usw.
Fuzzy-Matching-Prozess
Der Fuzzy-Matching-Prozess wird wie folgt durchgeführt:
- Profildatensätze für grundlegende Standardisierungsfehler. Diese Fehler werden behoben, um eine einheitliche und standardisierte Ansicht über alle Datensätze zu erreichen.
- Auswählen und Zuordnen von Attributen, basierend auf denen Fuzzy Matching durchgeführt wird. Da diese Attribute möglicherweise unterschiedlich benannt sind, müssen sie über Quellen hinweg zugeordnet werden.
- Auswählen einer Fuzzy-Matching-Technik für jedes Attribut. Beispielsweise können Namen basierend auf der Tastenentfernung oder Namensvarianten abgeglichen werden, während Telefonnummern basierend auf numerischer Ähnlichkeit abgeglichen werden können.
- Auswählen eines Gewichts für jedes Attribut, sodass Attribute mit höheren Gewichten (oder höherer Priorität) einen größeren Einfluss auf das Gesamtniveau der Übereinstimmung haben als Felder mit niedrigeren Gewichten.
- Definieren des Schwellenwerts – Datensätze mit einem Fuzzy-Matching-Score höher als dem Schwellenwert werden als Übereinstimmung betrachtet und diejenigen, die unter dem Schwellenwert liegen, als Nicht-Übereinstimmung.
- Ausführen von Fuzzy-Matching-Algorithmen und Analysieren der Übereinstimmungsergebnisse.
- Überschreiben von Falschpositiven und Falschnegativen, die auftreten können.
- Zusammenführen, Entfernen von Duplikaten oder einfach Entfernen von Duplikat-Datensätzen.
Fuzzy-Matching-Parameter
Aus dem oben definierten Prozess können Sie erkennen, dass ein Fuzzy-Matching-Algorithmus eine Reihe von Parametern hat, die die Grundlage dieser Technik bilden. Dazu gehören die Attributgewichte, die Fuzzy-Matching-Technik und der Schwellenwert.
Um optimale Ergebnisse zu erzielen, müssen Sie Fuzzy-Matching-Techniken mit verschiedenen Parametern ausführen und die Werte finden, die am besten zu Ihren Daten passen. Viele Anbieter bieten solche Funktionen in ihren Fuzzy-Matching-Lösungen an, wobei diese Parameter automatisch eingestellt werden können, aber je nach Bedarf angepasst werden können.
Was sind Fuzzy-Matching-Techniken?
Es gibt viele Fuzzy-Matching-Techniken, die heute verwendet werden und die sich aufgrund des genauen Algorithmus oder der Formel unterscheiden, die zum Vergleichen und Abgleichen von Feldern verwendet wird. Abhängig von der Art Ihrer Daten können Sie die Technik auswählen, die Ihren Anforderungen am besten entspricht. Hier ist eine Liste gängiger Fuzzy-Matching-Techniken:
- Zeichenbasierte Ähnlichkeitsmetriken, die am besten zum Abgleichen von Zeichenfolgen geeignet sind. Dazu gehören:
- Entfernung: Berechnet die Entfernung zwischen zwei Zeichenfolgen, berechnet zeichenweise.
- Affine Lückenentfernung: Berechnet die Entfernung zwischen zwei Zeichenfolgen, wobei auch die Lücken oder Leerzeichen zwischen den Zeichenfolgen berücksichtigt werden.
- Smith-Waterman-Entfernung: Berechnet die Entfernung zwischen zwei Zeichenfolgen, wobei auch die Anwesenheit oder Abwesenheit von Präfixen und Suffixen berücksichtigt wird.
- Jaro-Entfernung: Am besten zum Abgleichen von Vornamen und Nachnamen.
- Tokenbasierte Ähnlichkeitsmetriken, die am besten zum Abgleichen von vollständigen Wörtern in Zeichenfolgen geeignet sind. Dazu gehören:
- Atomare Zeichenfolgen: Teilt lange Zeichenfolgen in Wörter auf, die durch Interpunktion getrennt sind, und vergleicht sie mit einzelnen Wörtern.
- WHIRL: Ähnlich wie atomare Zeichenfolgen, aber WHIRL weist auch jedem Wort ein Gewicht zu.
- Phonetische Ähnlichkeitsmetriken, die am besten zum Vergleichen von Wörtern geeignet sind, die ähnlich klingen, aber eine völlig andere Zeichenzusammensetzung haben. Dazu gehören:
- Soundex: Am besten zum Vergleichen von Nachnamen, die unterschiedlich geschrieben sind, aber ähnlich klingen.
- NYSIIS: Ähnlich wie Soundex, aber NYSIIS behält auch Details über die Vokalposition bei.
- Metaphone: Vergleicht ähnlich klingende Wörter, die in der englischen Sprache existieren, andere Wörter, die Amerikanern vertraut sind, und Vornamen und Familiennamen, die in den USA häufig verwendet werden.
- Numerische Ähnlichkeitsmetriken, die Zahlen vergleichen, wie weit sie voneinander entfernt sind, die Verteilung von numerischen Daten usw.
Herausforderungen des Fuzzy Matchings
Der Fuzzy-Matching-Prozess – trotz der erstaunlichen Vorteile, die er bietet – kann sehr schwierig zu implementieren sein. Hier sind einige gängige Herausforderungen, mit denen Unternehmen konfrontiert sind:
1. Höhere Rate an Falschpositiven und Falschnegativen
Viele Fuzzy-Matching-Lösungen haben eine höhere Rate an Falschpositiven und Falschnegativen. Dies geschieht, wenn der Algorithmus Übereinstimmungen und Nicht-Übereinstimmungen falsch klassifiziert oder umgekehrt. Konfigurierbare Übereinstimmungsdefinitionen und Fuzzy-Parameter können helfen, falsche Verbindungen so weit wie möglich zu reduzieren.
2. Rechnerische Komplexität
Während des Abgleichprozesses wird jeder Datensatz mit jedem anderen Datensatz im gleichen Datensatz verglichen. Und wenn Sie mit mehreren Datensätzen arbeiten, erhöht sich die Anzahl der Vergleiche. Es ist festgestellt worden, dass die Vergleiche quadratisch ansteigen, wenn die Datenbankgröße steigt. Aus diesem Grund müssen Sie ein System verwenden, das in der Lage ist, rechenintensive Berechnungen zu bewältigen.
3. Validierungstests
Die abgeglichen Datensätze werden zusammengeführt, um eine vollständige 360-Grad-Ansicht von Entitäten darzustellen. Jeder Fehler, der während dieses Prozesses auftritt, kann ein Risiko für Ihre Geschäftsoperationen darstellen. Aus diesem Grund müssen detaillierte Validierungstests durchgeführt werden, um sicherzustellen, dass der abgestimmte Algorithmus konsistent Ergebnisse mit hoher Genauigkeitsrate produziert.
Zusammenfassung
Unternehmen denken oft, dass Fuzzy-Matching-Lösungen komplexe, rechenintensive und kostspielige Projekte sind, die zu lange dauern. Die Wahrheit ist, dass Investitionen in die richtige Lösung, die schnelle und genaue Ergebnisse liefert, der Schlüssel ist. Unternehmen müssen mehrere Faktoren berücksichtigen, wenn sie eine Fuzzy-Matching-Lösung auswählen, wie z. B. die Zeit und das Geld, die sie investieren möchten, das Skalierungsdesign, das sie im Sinn haben, und die Art ihrer Datensätze. Dies hilft ihnen, eine Lösung auszuwählen, die es ihnen ermöglicht, das Beste aus ihren Daten zu machen.












