Data Normalization란?

데이터 정규화(Data Normalization)는 데이터를 일관된 표준 형태로 정리하는 과정입니다. 이 용어는 두 가지 관련 작업을 아우릅니다. 데이터베이스에서는 각 사실이 한 번만 저장되도록 테이블을 구조화해 중복과 갱신 오류를 줄입니다. 분석과 머신러닝에서는 나이와 소득처럼 단위가 다른 값을 비교 가능한 범위로 다시 조정해, 한 피처가 모델을 지배하지 않게 합니다.

두 의미의 목표는 같습니다. 데이터가 예측 가능하게 움직이게 만드는 것입니다. 단위 불일치, “USA”와 “United States”처럼 섞인 표기, 중복 레코드, 크게 벌어진 스케일은 모두 분석과 모델 학습을 왜곡합니다.

정규화는 AI용 데이터 준비의 표준 단계입니다. 어떤 규칙을 어느 데이터 버전에 적용했는지 기록하는 팀은 나중에 결과를 재현할 수 있습니다. 즉흥적으로 정규화하는 팀은 같은 모델의 두 실행이 왜 다른지 설명하지 못하는 경우가 많습니다.

관련 용어: Data Cleansing · Data Quality · Tabular Data

자주 묻는 질문

머신러닝에서 데이터 정규화란 무엇인가요?

피처 값을 0에서 1처럼 비교 가능한 범위로 다시 조정해, 숫자가 큰 피처가 모델 학습을 지배하지 않게 만드는 일입니다.

데이터베이스 정규화란 무엇인가요?

각 사실이 한 번만 저장되도록 테이블을 구조화해 중복을 줄이고 갱신·삭제 오류를 막는 일입니다.

정규화는 왜 AI 결과에 중요한가요?

기록되지 않은 정규화 선택은 모델이 배우는 내용을 바꾸므로, 어떤 규칙이 어느 데이터 버전에 적용됐는지 추적해야 결과를 설명하고 재현할 수 있습니다.