ソートリーダー

ファジー・マッチング – 定義、プロセス、テクニック

mm
Unite.AI を Google の優先ソースに追加

アクセンチュアの調査によると、消費者の75%が名前と購入行動を知っている小売業者から買うことを好み、52%がパーソナライズされた体験を提供しない場合、ブランドを切り替える可能性が高い。企業が毎日収集する膨大な量のデータを分析し、ユニークな顧客を特定し、プロファイルを構築することは、多くの企業が直面している最大の課題の1つである。

企業がデータを収集するために複数のツールを使用する場合、顧客の名前を誤って入力したり、不正なパターンのメールアドレスを受け入れたりすることはよくあることである。さらに、異なるデータアプリケーションに同じ顧客に関する異なる情報がある場合、顧客の行動や嗜好についての洞察を得ることは不可能になる。

次に、ファジー・マッチングとは何か、どのように実装されるか、一般的なテクニック、課題について学びましょう。始めましょう。

ファジー・マッチングとは何か

ファジー・マッチングは、2つ以上のレコードを比較し、それらが同じエンティティに属する可能性を計算するデータマッチング技術である。レコードを単純にマッチまたはノンマッチに分類するのではなく、ファジー・マッチングは0〜100%の間の数字を出力し、これらのレコードが同じ顧客、製品、従業員などに属する可能性を示す。

効率的なファジー・マッチングアルゴリズムは、名前の逆順、頭字語、短縮名、音響的および故意のスペルミス、略語、追加または削除された句読点などのデータの曖昧さを処理する。

ファジー・マッチングのプロセス

ファジー・マッチングのプロセスは以下の通りである:

  1. プロファイルレコードを基本的な標準化エラーのために。这些エラーは修正され、レコード全体で統一された標準化されたビューが達成される。
  2. 属性を選択してマップし、ファジー・マッチングが行われる。这些属性は異なるタイトルを持つ可能性があるため、ソース全体でマップされる必要がある。
  3. ファジー・マッチングのテクニックを選択し、各属性に。例えば、名前はキーボード距離または名前のバリアントに基づいてマッチングされることができ、電話番号は数値の類似性メトリックに基づいてマッチングされることができる。
  4. 各属性に重みを割り当てし、重みが高い(または優先度が高い)属性は、重みが低い(または優先度が低い)フィールドよりも全体的なマッチング信頼度レベルに大きく影響する。
  5. しきい値レベルを定義し、ファジー・マッチングスコアがこのレベルを超えるレコードはマッチとみなされ、しきい値を満たさないレコードはノンマッチとみなされる。
  6. ファジー・マッチングアルゴリズムを実行し、マッチング結果を分析する。
  7. 誤った陽性と陰性を上書きする。
  8. レコードを結合し、重複を削除または単純に削除する。

ファジー・マッチングのパラメータ

上記のプロセスから、ファジー・マッチングアルゴリズムには、属性の重み、ファジー・マッチングのテクニック、スコアのしきい値レベルなどのパラメータが含まれることがわかる。

最適な結果を得るには、さまざまなパラメータでファジー・マッチングのテクニックを実行し、データに最も適した値を見つける必要がある。多くのベンダーは、ファジー・マッチングのソリューションにこれらの機能をパッケージ化しており、必要に応じてカスタマイズできる。

ファジー・マッチングのテクニックとは何か

現在使用されているファジー・マッチングのテクニックは多数あり、使用されるアルゴリズムまたは式によって異なる。データの性質に応じて、適切なテクニックを選択することができる。以下は一般的なファジー・マッチングのテクニックのリストである:

  1. 文字ベースの類似性メトリックは、文字列をマッチングするために最適である。这些には以下のものが含まれる:
    1. 編集距離: 2つの文字列の間の距離を計算する。文字ごとに計算される。
    2. アフィンギャップ距離: 2つの文字列の間の距離を計算する。文字列間のギャップまたはスペースも考慮する。
    3. スミス・ウォーターマン距離: 2つの文字列の間の距離を計算する。接頭辞と接尾辞の存在または不存在も考慮する。
    4. ジャロ距離: 名前と姓をマッチングするために最適である。
  2. トークンベースの類似性メトリックは、文字列内の完全な単語をマッチングするために最適である。这些には以下のものが含まれる:
    1. アトミック文字列:長い文字列を句読点で区切られた単語に分割し、個々の単語を比較する。
    2. WHIRL:アトミック文字列と同様だが、WHIRLは各単語に重みを割り当てる。
  3. 音響的類似性メトリックは、発音が似ているが文字の構成がまったく異なる単語を比較するために最適である。这些には以下のものが含まれる:
    1. サウンドクス:姓がスペルは異なれど発音が似ている場合に最適である。
    2. NYSIIS:サウンドクスと同様だが、NYSIISは母音の位置に関する詳細も保持する。
    3. メタフォーン:英語で発音が似ている単語、米国で一般的な名前、姓を比較する。
  4. 数値類似性メトリックは、数値を比較し、それらの間の距離、数値データの分布などを計算する。

ファジー・マッチングの課題

ファジー・マッチングのプロセス – 驚くべき利点を提供するにもかかわらず – 実装するのが非常に難しいことがある。企業が直面している一般的な課題は以下の通りである:

1.     誤った陽性と陰性の高い率

多くのファジー・マッチングのソリューションには、誤った陽性と陰性の高い率がある。アルゴリズムがマッチとノンマッチを誤って分類した場合やその逆の場合に発生する。構成可能なマッチ定義とファジー・パラメータを使用すると、不正なリンクをできるだけ減らすことができる。

2.     計算の複雑さ

マッチングプロセス中に、各レコードは同じデータセット内の他のすべてのレコードと比較される。複数のデータセットを扱う場合、比較の数はさらに増加する。比較はデータベースのサイズが増加するにつれて二乗して増加することが観察される。したがって、リソースを大量に消費する計算を処理できるシステムを使用する必要がある。

3.     検証テスト

マッチングされたレコードは、エンティティの完全な360度のビューを表すために結合される。マッチングプロセス中に発生するエラーは、ビジネス運用にリスクをもたらす可能性がある。したがって、調整されたアルゴリズムが高い精度率で結果を生成していることを確認するために、詳細な検証テストを実行する必要がある。

まとめ

企業は、ファジー・マッチングのソリューションを複雑で、リソースを大量に消費し、長期間にわたる、コストのかかるプロジェクトと見なしていることが多い。実際、適切なソリューションに投資することは、迅速で正確な結果を生み出すことが重要である。組織は、ファジー・マッチングのツールを選択する際に、投資する時間とお金、想定するスケーラビリティのデザイン、データセットの性質などの要素を考慮する必要がある。これにより、データの最大の価値を引き出すことができるソリューションを選択できる。

私は Data Ladder の製品マーケティングアナリストです。ITの背景を持っています。私は、今日多くの組織が直面しているリアルなデータハイジーンの問題について情熱的に書いています。私は、ビジネスインテリジェンスプロセスで固有のデータ品質を達成するのに役立つソリューション、ヒント、ベストプラクティスを伝えることを好みます。私は、技術人員からエンドユーザーまで、幅広い聴衆に向けてターゲットを絞ったコンテンツを作成し、さまざまなデジタルプラットフォームでマーケティングすることを目指しています。