Data Enrichment란?

데이터 인리치먼트(Data Enrichment)는 데이터셋에 부족한 정보를 내부의 다른 소스나 외부 데이터에서 가져와 더해 완성도를 높이는 과정입니다. 데이터 인핸스먼트(Data Enhancement)라고도 부릅니다. 누락된 속성 채우기, 인구통계·기업 정보 필드 추가, 카테고리 표준화, 지역 코드 같은 참조 데이터 결합이 대표적입니다.

인리치먼트는 클렌징과 다릅니다. 클렌징이 이미 테이블에 있는 값의 오류를 고치는 일이라면, 인리치먼트는 아직 없는 정보를 새로 들여오는 일입니다. 예를 들어 이메일 열만 있는 고객 테이블에 기업 규모와 업종을 더하면 세그먼트 분석이 가능해집니다.

AI 작업에서는 인리치먼트가 데이터셋의 사용 가능 여부를 가르는 경우가 많습니다. 희소하거나 불완전한 레코드는 모델이 배울 수 있는 범위를 제한하므로, 학습 전에 빠진 맥락을 채우는 보강이 필요합니다. 무엇을 어디서 더했는지 기록해 두면 보강된 데이터셋을 추적하고 재현할 수 있습니다.

관련 용어: Data Cleansing · Data Augmentation · Data Quality · AI-Ready Data

자주 묻는 질문

데이터 인리치먼트는 데이터 클렌징과 무엇이 다른가요?

클렌징은 데이터셋에 이미 있는 값의 오류를 고치고, 인리치먼트는 누락 속성이나 외부 참조 필드처럼 데이터셋에 없는 새 정보를 더합니다.

대표적인 데이터 인리치먼트 기법은 무엇인가요?

내부 테이블 결합, 서드파티 데이터 추가, 카테고리 표준화, 누락 속성 보완으로 각 레코드가 충분한 맥락을 갖게 만듭니다.

데이터 인리치먼트는 왜 AI에 중요한가요?

희소하거나 불완전한 레코드는 모델이 배울 수 있는 것을 제한하므로, 학습 전 보강이 데이터셋의 사용 가능 여부를 가르는 경우가 많습니다.