사상 리더
엔티티 해결이 AI 인프라로 바뀌고 있는 이유

일찍이 나는 한 AI 에이전트가 완전히 틀린 답을 자신감 있게 주는 것을 보았다. 한 사업체에는 두 개의 기록이 있었다. 하나에는 이전의 상호와 재무 담당자의 이름이 들어있었고, 다른 하나에는 최근의 법적 이름과 다른 청구 주소가 들어있었다. 에이전트는 간단한 질문을 받았다. 이 계정이 정상적인지 아닌지. 에이전트는 한 기록을 찾았고, 연체된 청구서가 없다는 것을 보고, 예라고 말했다. 하지만 연체된 청구서는 다른 이름으로 기록되어 있었다.
그것은 환상이 아니었다. 모델은 제공된 데이터에 대해 깨끗이推論했다. 데이터는 단지 두 개의 고객이 실제로는 하나라는 사실을 담고 있었다. 오류는 언어 모델에 있지 않았다. 조인에 있었다.
나는 이것이 기업 AI에서 가장 과소평가되는 위험 중 하나이며, 가장 적게 논의되는 것 중 하나라고 생각하게 되었다. 우리는 모델의 정확성, 프롬프트 디자인, 거버넌스에 대해 끝없이 논의한다. 하지만 시스템이 실제로 어떤 고객, 공급자, 또는 계정을 다루고 있는지에 대해 거의 논의하지 않는다. 그 질문에는 이름이 있다. 그것은 엔티티 해결이라고 불린다. 그리고 60년 동안 배경에서 일해왔지만, 조용히 라이브 인프라로 바뀌고 있다.
문제는 시제가 바뀌었다
대부분의 경우에 “이 두 개의 기록은 같은 엔티티인가?”라는 질문은 클린업 질문이었다. 배치로 실행되었고, 일정에 따라, 마스터 데이터 관리 프로그램, 웨어하우스, 또는 분석 파이프라인 안에서 실행되었다. 그것은 완벽하지 않았지만, 살아남을 수 있었다. 왜냐하면 출력은 다음 주에 읽을 보고서였기 때문이다. 만약 두 개의 공급자 기록이 병합되지 않았다면, 지출 금액이 약간 잘못 나왔지만, 분석가는 그것을 다음 실행에서 고칠 수 있었다. 시스템에는 여유가 있었다. 시간이 오류를 흡수했다.
AI 에이전트는 그 여유를 제거한다. 그것은 질문의 시제를 “결과적으로”에서 “지금”으로 바꾼다. 에이전트가 환불을 승인하거나, 케이스를 라우팅하거나, 프로필을 업데이트하거나, 컴플라이언스 질문에 답할 때, 해결된 엔티티는 더 이상 대시보드를 공급하지 않는다. 그것은 행동을 유발한다. 잘못된 조인의 비용은 약간 잘못된 숫자에서 즉시 발생하는 것으로 바뀐다. 그리고 대부분의 경우에는 인간이 그것을 잡을 수 없다.
그것이 중요한 변화이다. 기본적인 문제는 오래전부터 이해되어 왔다. 하지만 새로운 것은 그것을 직접적으로 독립적으로 작동하는 시스템에 연결했다는 것이다.
1960년대 통계 문제
엔티티 해결은 대형 언어 모델과 함께 도착하지 않았다. 펀치 카드와 함께 도착했다. 1959년, H. B. Newcombe와 그의 동료들은 자동으로 연결된 필수 기록에 대한 짧은 논문을 과학 저널에 발표했다. 그것은 컴퓨터가 출생 기록과 결혼 기록이 같은 사람을 가리키는지どうか 결정할 수 있음을 설명했다. 10년 후, Ivan Fellegi와 Alan Sunter는 그것에 대한 형식적인 수학적 이론을 주었다. 그것은 현재도 사용되는 세 가지 결과를 정의했다. 연결, 비연결, 그리고 사람에게 검토를 필요로 하는 가능성 연결.
그것에 대한 한 가지 세부 사항이 중요하다. 그것은 사람들이 가장 часто 잘못 이해하는 부분이다. 기록 연결은 단순히 이메일 주소나 공유 ID에 대한 정확한 일치가 아니었다. 처음부터 그것은 확률적이었다. 그것은 두 개의 기록이 동의하는 성, 날짜, 장소를 가중치로 하여 점수를 생성했다. 왜냐하면 인간이 입력한 데이터는 지저분하기 때문이다. 정확한 키가 끊임없이 실패한다. 현대의 엔티티 해결도 여전히 이렇게 작동한다. 그것은 결정론적인 규칙과 확률적이고 퍼지한 머신 러닝 매칭을 결합한다. 타이포, 별명, 전송된 필드, 약어, 그리고 같은 시스템에서 동일한 사람이나 회사에 대한 작은 차이들을 처리한다. 좋은 분야 조사는 1950년대의 필수 기록에서 현재 사용되는 클러스터링과 머신 러닝 방법까지의 끊임없는 선을 추적한다.
真正로 바뀐 것은 언제 답이 필요한지이다. 연구자들은 쿼리 시간에 엔티티를 해결하는 것에 대해 글을 썼다. 그것은 이전에는 흥미로운 최적화였다. 하지만 지금은 거의 요구사항이다.
에이전트가 그것을 인프라로 바꾸는 이유
대부분의 기업 AI 시스템은 모델의 메모리에서 답을 얻지 않는다. 그것은 검색한다. 검색-증강 생성이라고 불리는 패턴은 에이전트가 질문의 순간에 관련된 컨텍스트를 가져오고 그것에 대해推論한다. 그것은 일반적으로 좋은 것이다. 그것은 답을 모델의 훈련에서 아니라 데이터에 आध__/base한다.
하지만 그것은 쉽게 놓칠 수 있는 결과를 가지고 있다. 에이전트는 검색 단계에서 무엇을 받는지 상속한다. 검색이 단편적인 고객을 반환한다면, 에이전트는 세 개의 고객에 대해推論할 것이다. 검색이 잘못 병합된 기록을 반환한다면, 두 개의 다른 회사를 하나의 프로필로 병합한 것처럼, 에이전트는 하나의 고객에 대해推論할 것이다. 소스 시스템에 이미 있는 모호함이 직접적으로 모델에 전달되고, 해결된 사실로 표시된다. 모델은 조인이 잘못되었다는 것을 알 수 없다. 당신이 전에 본 적 없는 기록의 정리된 요약을 읽을 때와 마찬가지로.
따라서 해결은 분기마다 실행되는 후속 작업이 될 수 없다. 엔티티는 데이터가 입력될 때 조립되어야 하고, 현재 해결된 뷰는 에이전트가 질문할 때 즉시 검색할 수 있어야 한다. 그것은 런타임 의존성이다. 그것은 데이터베이스나 인증 서비스와 더 비슷하다. 그리고 그것은 다른 시스템과 마찬가지로 설계되고, 모니터링되고, 신뢰되어야 한다.
아무도 정확하게 이름을 붙이지 않는 준비도
산업계는 이미 무엇인가가 부족하다는 것을 감지하고 있다. 시스코의 AI 준비도 지수 2025는 83%의 조직이 자율 에이전트를 배포할 계획이지만, 실제로 준비가 된 인프라를 가지고 있는 조직은 약 3분의 1에 불과하다는 것을 발견했다. 또한 약 4분의 1의 조직만이 실제로 에이전트가 하는 일을 제어하고 관리할 수 있다고 느끼고 있다. 맥킨지의 최근 AI 상태 조사에서는 약 88%의 조직이 현재 AI를至少 하나의 기능에서 사용하고 있지만, 대부분의 조직이 아직 기업 전체에 걸쳐 확장하지 못하고 있다는 것을 설명했다.
人们解释这种差距时, 그들은 두 단어를 사용한다. 데이터 품질과 거버넌스. 둘 다 중요하다. 하지만 거기에 더 좁은 질문이 있다. 깨끗하고 잘 관리된 데이터만으로는 답을 줄 수 없다. 시스템이 실제로 어떤 엔티티를 다루고 있는지에 대한 질문이다. 그것은 데이터 품질이나 거버넌스와는 별개이다. 그것은 시스템 사이의 공간에 있다. 동일한 고객이 세 개의 異なる 얼굴을 하고 있는 곳이다.
에이전트를 실행하기 전에 확인해야 할 사항
엔티티 해결을 라이브 인프라로 다루면, 그것을 인프라로 검사할 수 있다. 작동 실패 모드는 특정하고 테스트 가능하다. 분할된 동일 엔티티, 잘못 병합된 기록, 구식 생존 규칙, 누락된 영속적 식별자, 에이전트가 소스 시스템의 모호함을inherit하는 것 등이다.
실용적인 준비 테스트는 새로운 모델이나 벤더 카테고리가 필요하지 않다.真正로 이해하는 엔티티의 그라운드 트루스 집합을 모은다. 그것을 에이전트가 사용하는 동일한 검색 경로로 실행한다. 그리고 실제로 결과를 결정하는 것들을 측정한다. 잘못된 병합과 잘못된 분할, 시스템이 실제 모호함을 처리하는 방식, 시스템의 신뢰도 임계값, 시스템이 인간에게 위임하는 시기, 그리고 시스템이 기존의 마스터 데이터와 거버넌스 컨트롤에 어떻게 청구하는지 등이다. 팀이 이러한 질문에 답할 수 없다면, 에이전트는 검증할 수 없는 아이덴티티에 대해 실행되고 있으며, 그 출력에 대한 신뢰는 잘못된 것이다.
이것은 마스터 데이터 관리, 거버넌스, 고객 데이터 플랫폼, 웨어하우스를 대체하지 않는다. 그것들은 다른 질문에 답한다. 그리고 여전히 필요하다. 거버넌스는 에이전트가 무엇을 할 수 있는지 결정한다. 엔티티 해결은 에이전트가誰를 다루고 있는지 결정한다. 첫 번째는 대부분의 큰 조직에서 성숙했다. 두 번째는 많은 사람들이 필요로 하는 계층이다. 그리고 그것은 실시간으로 필요하다. 에이전트가 실행하기 전에.
나는 본 에이전트는 더智能한 모델이 필요하지 않았다. 그것은 두 개의 이름이 하나의 고객이라는 것을 알 필요가 있었다. 그리고 그것은 자신감을 가지고 말할 수 있었다. 우리는 이러한 시스템에 실제 권한을 주기 시작할 때, 그 60년 된 조용한 규율은 클린업에서 부하를 지는 것으로 바뀌기 시작한다.












