사상 리더

퍼지 매칭 – 정의, 프로세스 및 기술

mm
Unite.AI를 Google의 선호 소스에 추가

Accenture 설문조사에 따르면 75%의 소비자는 이름과 구매 행동을 알고 있는 소매업체에서 구매하는 것을 선호하며, 52%의 소비자는 개인화된 경험을 제공하지 않는 경우 브랜드를 변경할 가능성이 더 높습니다. 브랜드가 거의 매일 수백만 개의 데이터 포인트를 캡처하는 경우 고유한 고객을 식별하고 프로필을 구축하는 것은 대부분의 회사에서 직면하는 가장 큰 도전 중 하나입니다.

기업이 데이터를 캡처하기 위해 여러 도구를 사용하는 경우 고객의 이름을 잘못拼거나 잘못된 패턴의 이메일 주소를 수락하는 것은 매우 일반적입니다. 또한 서로 다른 데이터 애플리케이션이 동일한 고객에 대한 다양한 정보를 가지고 있는 경우 고객의 행동과 선호도에 대한 통찰력을 얻는 것이 불가능해집니다.

다음으로, 퍼지 매칭이 무엇인지, 어떻게 구현되는지, 일반적으로 사용되는 기술, 그리고 직면하는 도전에 대해 알아보겠습니다. 시작해 보겠습니다.

퍼지 매칭이란?

퍼지 매칭은 데이터 매칭 기술의 하나로 두 개 이상의 레코드를 비교하고 동일한 엔티티에 속하는 가능성을 계산합니다. 레코드를 간단하게 일치와 불일치로 분류하는 대신, 퍼지 매칭은 이러한 레코드가 동일한 고객, 제품, 직원 등에 속하는 가능성을 나타내는 숫자(通常 0-100% 사이)를 출력합니다.

효율적인 퍼지 매칭 알고리즘은 이름 반전, 약자, 축약명, 음성적 및 의도적인拼写 오류, 약어, 추가/제거된 구두점 등 다양한 데이터 모호성을 처리합니다.

퍼지 매칭 프로세스

퍼지 매칭 프로세스는 다음과 같이 수행됩니다:

  1. 기본 표준화 오류를 위한 프로필 레코드를 수정합니다. 이러한 오류를 수정하여 레코드 전체에 걸쳐 일관된 표준화된 뷰를 달성합니다.
  2. 퍼지 매칭을 수행할 속성을 선택하고 매핑합니다. 이러한 속성이 서로 다른 제목으로 표시될 수 있으므로 소스 간에 매핑되어야 합니다.
  3. 각 속성에 대한 퍼지 매칭 기술을 선택합니다. 예를 들어, 이름은 키보드 거리 또는 이름 변형에 따라 일치시킬 수 있으며, 전화번호는 숫자 유사성 지표에 따라 일치시킬 수 있습니다.
  4. 각 속성에 대한 가중치를 선택합니다. 가중치가 높은 속성(또는 높은 우선순위)은 일치 신뢰도 수준에 더 큰 영향을 미치며, 가중치가 낮은 필드는 더 낮은 영향을 미칩니다.
  5. 임계값 수준을 정의합니다. 퍼지 매칭 점수가 이 수준보다 높은 레코드는 일치로 간주되며, 그렇지 않은 레코드는 불일치로 간주됩니다.
  6. 퍼지 매칭 알고리즘을 실행하고 일치 결과를 분석합니다.
  7. 잘못된 양성과 음성을 재정의합니다.
  8. 중복 레코드를 병합, 중복 제거 또는 제거합니다.

퍼지 매칭 매개변수

위에서 정의한 프로세스에서 볼 수 있듯이 퍼지 매칭 알고리즘에는 속성 가중치, 퍼지 매칭 기술 및 점수 임계값과 같은 여러 매개변수가 있습니다.

최적의 결과를 얻으려면 다양한 매개변수로 퍼지 매칭 기술을 실행하고 데이터에 가장 적합한 값을 찾는 것이 중요합니다. 많은 벤더가 이러한 기능을 패키지화하여 자동으로 매개변수를 조정할 수 있지만 필요에 따라 사용자 지정할 수 있습니다.

퍼지 매칭 기술은 무엇인가?

오늘날 사용되는 퍼지 매ッチング 기술은 비교 및 매칭에 사용되는 알고리즘 또는 수식에 따라 다릅니다. 데이터의 특성에 따라 요구 사항에 적합한 기술을 선택할 수 있습니다. 여기에는 일반적인 퍼지 매칭 기술이 있습니다:

  1. 문자 기반 유사성 지표는 문자열을 일치시키는 데 가장 적합합니다. 여기에는 다음이 포함됩니다:
    1. 편집 거리: 두 문자열 사이의 거리를 계산합니다.
    2. 아핀 갭 거리: 문자열 사이의 갭 또는 공백을 고려하여 두 문자열 사이의 거리를 계산합니다.
    3. 스미스-워터먼 거리: 접두사와 접미사의 존재 또는 부재를 고려하여 두 문자열 사이의 거리를 계산합니다.
    4. 자로 거리: 이름과 성을 일치시키는 데 가장 적합합니다.
  2. 토큰 기반 유사성 지표는 문자열의 완전한 단어를 일치시키는 데 가장 적합합니다. 여기에는 다음이 포함됩니다:
    1. 원자 문자열: 긴 문자열을 구두점으로 구분된 단어로 나누고 개별 단어를 비교합니다.
    2. WHIRL: 원자 문자열과 유사하지만 WHIRL은 각 단어에 가중치를 할당합니다.
  3. 음성 유사성 지표는 발음이 유사하지만 문자 구성이 완전히 다른 단어를 비교하는 데 가장 적합합니다. 여기에는 다음이 포함됩니다:
    1. 사운드엑스:拼写이 다른姓이지만 발음이 유사한姓을 비교하는 데 가장 적합합니다.
    2. NYSIIS: 사운드엑스와 유사하지만 모음 위치에 대한 세부 정보를 유지합니다.
    3. 메타폰: 영어 단어, 미국에서 일반적으로 사용되는 이름 및姓을 비교합니다.
  4. 숫자 유사성 지표는 숫자를 비교하여 숫자 간의 거리, 숫자 데이터의 분포 등입니다.

퍼지 매칭의 도전

퍼지 매칭 프로세스 – 놀라운 이점을 제공함에도 불구하고 – 구현하기가 매우 어려울 수 있습니다. 여기에는 일반적인 도전이 있습니다:

1.     거짓 양성과 음성의 높은 비율

많은 퍼지 매칭 솔루션은 거짓 양성과 음성의 비율이 높습니다. 이는 알고리즘이 일치와 불일치를 잘못 분류할 때 발생합니다. 구성 가능한 일치 정의와 퍼지 매개변수를 사용하면 잘못된 링크를 최대한 줄일 수 있습니다.

2.     계산 복잡성

매칭 프로세스 동안 각 레코드는 동일한 데이터 세트의 모든 다른 레코드와 비교됩니다. 여러 데이터 세트를 다루는 경우 비교 횟수가 증가합니다. 데이터베이스 크기가 증가함에 따라 비교가 제곱으로 증가하는 것으로 나타났습니다. 이러한 이유로 계산 집약적인 연산을 처리할 수 있는 시스템을 사용해야 합니다.

3.     검증 테스트

일치한 레코드는 완전한 360도 엔티티 뷰를 나타내는 데 함께 병합됩니다. 이 프로세스 동안 발생하는 오류는 비즈니스 운영에 위험을 가할 수 있습니다. 따라서 높은 정확도率으로 일관되게 결과를 생성하는지 확인하기 위해 자세한 검증 테스트를 수행해야 합니다.

まとめ

기업은 퍼지 매칭 솔루션을 복잡하고, 자원 집약적이며, 돈을 많이 드는 프로젝트로 생각하는 경우가 많습니다. 하지만 사실은 빠르고 정확한 결과를 생성하는 올바른 솔루션에 투자하는 것이 핵심입니다. 조직은 퍼지 매칭 도구를 선택할 때 투자할 시간과 돈, 설계할 확장성, 데이터 세트의 특성을 고려해야 합니다. 이렇게 하면 데이터에서 최대한의 이익을 얻을 수 있는 솔루션을 선택할 수 있습니다.

나는 Data Ladder의 Product Marketing Analyst로 IT 분야의 배경을 가지고 있습니다. 나는 많은 조직에서 오늘날 직면하는 실제 데이터 위생 문제에 대해 열정적으로 글을 씁니다. 나는 비즈니스 인텔리전스 프로세스에서 내재된 데이터 품질을 달성하는 데 도움이 될 수 있는 솔루션, 팁 및 관행을 전달하는 것을 좋아합니다. 나는 기술人員부터 최종 사용자에 이르기까지 다양한 대상과 다양한 디지털 플랫폼에 걸쳐 콘텐츠를 생성하려고 노력합니다.