Entity Resolution이란?

엔티티 해석은 저장 방식이 달라도 실제로는 같은 사람, 회사, 제품, 장소를 가리키는 레코드를 찾아냅니다. 같은 고객이 청구 시스템에는 Jon Smith로, 상담 도구에는 다른 이메일과 함께 Jonathan Smith로 들어가 있을 수 있습니다. 이름, 주소, 식별자, 날짜 같은 속성을 비교해 두 레코드가 같은 대상일 가능성을 점수로 매기고, 레코드를 연결하거나 합칩니다. 레코드 연결(record linkage)이라고도 부르며, 마스터 데이터 관리의 바탕이 됩니다.

매칭 규칙에는 판단이 들어갑니다. 비슷한 두 레코드가 한 고객일 수도, 같은 주소를 쓰는 두 사람일 수도 있습니다. 같은 날 들어온 주문 두 건이 중복일 수도, 실제 재구매일 수도 있습니다. 그래서 팀은 원래 레코드와 매칭 판단을 함께 남겨, 합친 결과를 다시 검토하거나 되돌릴 수 있게 합니다. AI 업무에서는 레코드를 어떻게 연결하느냐에 따라 모델이나 에이전트가 한 고객으로 보는 범위가 달라지므로, 규칙이 업무에 맞아야 합니다.

자주 묻는 질문

엔티티 해석과 중복 제거는 무엇이 다릅니까?

중복 제거는 한 데이터셋 안의 중복 레코드를 없애는 일입니다. 엔티티 해석은 더 넓어서, 데이터셋 안이나 여러 데이터셋에 걸쳐 같은 대상의 레코드를 연결하고, 레코드를 따로 둔 채 연결 관계만 기록하기도 합니다.

엔티티 해석은 마스터 데이터 관리의 일부입니까?

그렇습니다. 마스터 데이터 관리는 여러 원천 시스템의 고객·제품·공급사 레코드를 신뢰할 수 있는 단일 레코드로 만들 때 엔티티 해석을 씁니다.

엔티티 해석은 어떻게 합니까?

이름과 주소 같은 필드를 표준화하고, 후보 쌍을 규칙이나 머신러닝 모델로 비교해 매칭 가능성을 점수로 매긴 뒤, 불확실한 사례는 사람이 검토합니다.