Data Completeness란?

데이터 완전성(Data Completeness)은 정해진 목적에 필요한 레코드와 값이 데이터셋에 빠짐없이 존재하는 정도를 뜻합니다. 모든 필드를 무조건 채워야 한다는 가정이 아니라, 사전에 정한 요구사항을 기준으로 측정합니다. 따라서 서로 다른 속성, 대상 범위, 기간, 상세 수준을 요구하는 두 작업에서는 같은 데이터셋의 완전성 평가가 달라질 수 있습니다.

예를 들어 고객 테이블에 필수 계정 식별자가 모두 있어도 특정 분석에 필요한 동의 상태가 없다면 해당 목적에는 불완전할 수 있습니다. 값이 입력된 필드의 비율은 누락을 찾는 데 도움이 되지만, 레코드가 예상 모집단을 충분히 대표하는지 또는 각 값이 정확한지는 별도로 확인해야 합니다. AI 업무에서는 필수 필드와 레코드, 활용 목적, 측정 범위, 관측 시점을 함께 기록해야 합니다. 그래야 빠진 맥락을 확인하고 결과를 비교할 수 있으며, 완전성만으로 전체 준비 상태를 판단하는 오류를 피할 수 있습니다.

자주 묻는 질문

데이터 완전성은 어떻게 측정하나요?

정해진 목적에 필요한 레코드와 값을 실제로 존재하는 항목과 비교하며, 개수나 비율로 결과를 나타낼 수 있습니다.

완전한 데이터셋은 모든 필드가 채워져 있어야 하나요?

아닙니다. 선택 필드는 비어 있을 수 있지만, 목적상 필요한 필드나 레코드가 빠지면 해당 활용에는 불완전한 데이터가 됩니다.

완전한 데이터는 반드시 정확한가요?

아닙니다. 완전성은 필요한 정보가 존재하는지를 나타내며, 값이 실제 대상이나 사건을 올바르게 표현하는지는 정확성 검사로 별도 확인해야 합니다.