데이터 정규화(Data Normalization)는 데이터를 일관된 표준 형태로 정리하는 과정입니다. 이 용어는 두 가지 관련 작업을 아우릅니다. 데이터베이스에서는 각 사실이 한 번만 저장되도록 테이블을 구조화해 중복과 갱신 오류를 줄입니다. 분석과 머신러닝에서는 나이와 소득처럼 단위가 다른 값을 비교 가능한 범위로 다시 조정해, 한 피처가 모델을 지배하지 않게 합니다.
두 의미의 목표는 같습니다. 데이터가 예측 가능하게 움직이게 만드는 것입니다. 단위 불일치, “USA”와 “United States”처럼 섞인 표기, 중복 레코드, 크게 벌어진 스케일은 모두 분석과 모델 학습을 왜곡합니다.
정규화는 AI용 데이터 준비의 표준 단계입니다. 어떤 규칙을 어느 데이터 버전에 적용했는지 기록하는 팀은 나중에 결과를 재현할 수 있습니다. 즉흥적으로 정규화하는 팀은 같은 모델의 두 실행이 왜 다른지 설명하지 못하는 경우가 많습니다.
관련 용어: Data Cleansing · Data Quality · Tabular Data