Data Synthesis란?

데이터 합성(data synthesis)은 두 가지 뜻으로 쓰입니다. 연구 분야에서는 체계적 문헌고찰이나 메타분석처럼 여러 연구나 자료의 결과를 하나로 종합하는 일을 말합니다. 데이터 엔지니어링과 AI 분야에서는 원본 데이터셋의 통계적 패턴, 구조, 관계를 따르되 원래 레코드를 그대로 복사하지 않는 새 데이터 레코드를 만드는 일을 말합니다.

두 뜻 모두 목표는 같습니다. 어느 한 자료만으로는 얻을 수 없는 쓸모 있는 결과를 만드는 것입니다. 예를 들어 드문 설비 고장 사례가 40건밖에 없다면, 분류 모델이 학습 중에 충분한 사례를 볼 수 있도록 예시를 더 합성할 수 있습니다. 합성한 데이터도 검증을 거쳐야 합니다. 쓰려는 업무를 기준으로 원본과 비교하고 개별 원본 레코드가 그대로 드러나지 않는지 점검합니다. 합성 데이터가 도움이 되는지는 레코드가 얼마나 그럴듯해 보이는지가 아니라 해당 업무에 달려 있습니다.

자주 묻는 질문

데이터 합성과 데이터 분석은 무엇이 다릅니까?

데이터 분석은 이미 있는 데이터에서 패턴이나 답을 찾습니다. 데이터 합성은 여러 자료를 종합한 결과나 원본에서 만든 새 레코드처럼 새로운 것을 만들어 냅니다.

데이터 합성은 합성 데이터 생성과 같은 말입니까?

AI와 데이터 엔지니어링에서는 같은 뜻으로 자주 씁니다. 연구 분야에서는 보통 연구 결과를 종합하는 일을 뜻하며, 레코드를 새로 만들지 않습니다.

합성한 데이터는 어떻게 확인합니까?

쓰려는 업무 기준으로 원본 데이터와 비교하고, 합성한 데이터에서 원본 레코드를 되찾을 수 있는지 시험합니다.