다크 데이터(dark data)는 조직이 수집해 저장하지만 분석, 의사결정, AI에는 쓰지 않는 데이터입니다. 원래 목적이 끝난 뒤 저장소에 남아 있는 로그 파일, 보관된 이메일, 통화 녹음, 스캔한 서식, 센서 측정값이 대표적입니다. 다크 데이터를 가르는 기준은 데이터의 위치가 아니라 쓰임입니다. 최신 클라우드 웨어하우스에 있는 데이터셋이라도 아무도 조회하지 않는다면 다크 데이터입니다.
데이터가 묻혀 있는 데는 대개 현실적인 이유가 있습니다. 필드가 무엇을 뜻하는지 적힌 문서가 없거나, 도구가 읽지 못하는 형식이거나, 민감한 내용이 섞여 다시 쓰기 어렵거나, 공통 식별자 없이 여러 시스템에 흩어져 있을 수 있습니다. 예를 들어 수년 치 정비 기록에 설비 고장 내용이 자유 서술로 적혀 있어도, 이를 읽도록 학습한 모델이 없을 수 있습니다. 다크 데이터를 AI 업무에 쓰려면 먼저 찾아내고, 무엇인지 설명하고, 어떤 업무에 쓸 수 있을지 정해야 합니다.