Dark Data란?

다크 데이터(dark data)는 조직이 수집해 저장하지만 분석, 의사결정, AI에는 쓰지 않는 데이터입니다. 원래 목적이 끝난 뒤 저장소에 남아 있는 로그 파일, 보관된 이메일, 통화 녹음, 스캔한 서식, 센서 측정값이 대표적입니다. 다크 데이터를 가르는 기준은 데이터의 위치가 아니라 쓰임입니다. 최신 클라우드 웨어하우스에 있는 데이터셋이라도 아무도 조회하지 않는다면 다크 데이터입니다.

데이터가 묻혀 있는 데는 대개 현실적인 이유가 있습니다. 필드가 무엇을 뜻하는지 적힌 문서가 없거나, 도구가 읽지 못하는 형식이거나, 민감한 내용이 섞여 다시 쓰기 어렵거나, 공통 식별자 없이 여러 시스템에 흩어져 있을 수 있습니다. 예를 들어 수년 치 정비 기록에 설비 고장 내용이 자유 서술로 적혀 있어도, 이를 읽도록 학습한 모델이 없을 수 있습니다. 다크 데이터를 AI 업무에 쓰려면 먼저 찾아내고, 무엇인지 설명하고, 어떤 업무에 쓸 수 있을지 정해야 합니다.

자주 묻는 질문

왜 다크 데이터라고 부릅니까?

저장은 되어 있지만 의사결정을 하는 사람과 시스템의 눈에 띄지 않아, 빛이 닿지 않는 공간처럼 가치가 쓰이지 않은 채 남아 있기 때문입니다.

다크 데이터와 비정형 데이터는 같은 말입니까?

아닙니다. 다크 데이터 중에는 비정형 데이터가 많지만, 아무도 쓰지 않는 정형 표도 다크 데이터일 수 있고, 비정형 데이터도 활발히 쓰일 수 있습니다.

다크 데이터에는 어떤 위험이 있습니까?

저장 비용이 늘고 아무도 관리하지 않는 민감한 정보가 들어 있을 수 있습니다. 동시에 조직은 이미 가진 가치를 놓칩니다.