DTS는 CUBIG의 AI-native Data Reconstruction 기술입니다. 부족하거나 불균형하거나 제한된 기업 데이터를 AI 업무에 필요한 패턴과 관계를 유지하며 재구성합니다. 원본을 옮기지 않고도 클래스 불균형을 보정하고, 커버리지 공백을 메우고, 학습 데이터를 늘릴 수 있습니다. 단독으로 도입할 수 있고 Syntitan의 핵심 역량으로도 작동하며, 필요할 때 차등 프라이버시(DP)를 적용합니다.
쓸 수 없는 데이터를
AI-Ready 데이터셋으로 재구성.
대부분의 기업 데이터는 그대로 AI에 쓸 수 없습니다.
DTS가 제한되거나 불균형하거나 부족한 데이터를
실제로 쓸 수 있는 AI-Ready 데이터셋으로 재구성합니다.
제한된 데이터는 쓸 수 있는 형태로 재구성하고,
불균형한 데이터셋은 추가 데이터로 바로잡고, 커버리지 공백은 새 AI-Ready 데이터로 채웁니다.
데이터가 AI에 닿지 못하는 네 가지 이유.
데이터는 대개 이미 있습니다. 다만 AI 업무에 쓸 수 있는 형태가 아닐 뿐입니다.
DTS가 업무에 맞게 재구성합니다.
재구성이 먼저, 합성데이터는 방법 중 하나.
DTS는 AI 업무에 필요한 패턴과 관계를 재구성합니다.
합성 레코드 생성은 여러 방법 중 하나이고,
데이터에 필요할 때 차등 프라이버시를 적용합니다.
증강
희소 클래스와 엣지 케이스 사례를 더해, 모델이 학습할 만큼 채웁니다.
보정
결측·커버리지 공백을 채우고 치우친 구간을 바로잡습니다. 필드 사이 관계는 그대로 둡니다.
합성 생성
원본을 그대로 쓸 수 없을 때 통계 모델로 새 레코드를 만듭니다. 차등 프라이버시는 여기서 적용합니다.
구성 기술
- 01재구성 전 데이터 확인
- 컬럼 자동 분류
- 02데이터 재구성
- 표·텍스트 합성 데이터 생성LLM 기반 결측 보정임베딩 기반 유사도 평가
- 03품질·적합성 평가
- TVD · 2D CorrelationCoverage · Copy RiskTSTR 분류 평가
- 04평가 기록
- 결과 manifest·로그 기록
필요한 곳에, 차등 프라이버시.
차등 프라이버시란
차등 프라이버시(DP)는 한 개인의 데이터가 합성 출력에 미치는 영향을 수학적으로 제한하는 프레임워크입니다. 누군가 외부 정보를 결합하더라도 재식별 위험이 정해진 한도 안에서 관리됩니다.
DTS는 필요할 때 DP를 적용하며, 사후 마스킹 단계가 아니라 생성 과정 자체에 적용합니다. 프라이버시 속성은 마스킹이나 필드 제거에 기대지 않고 생성 과정에서 확보되며, 증명 가능한 경계를 가집니다.
엡실론(ε)은 레코드 하나가 결과를 얼마나 바꿀 수 있는지 정하는 값입니다. ε이 작을수록 경계가 엄격합니다.
DTS가 새 레코드를 생성하는 방식
원본 레코드를 저장하지 않고 실제 데이터셋의 통계 특성(분포·상관관계를 비롯한 통계 패턴)을 분석합니다.
데이터에 필요한 경우, 정해진 DP 경계 안에서 보정된 노이즈를 통계 모델에 더합니다.
모델에서 새 레코드를 만들어, 실제 레코드를 복사하지 않고도 업무에 필요한 패턴과 관계를 유지합니다.
결과를 원본 분포와 대조합니다. Syntitan 안에서는 선택한 모델·에이전트로 같은 조건에서 함께 검증합니다.
DTS 단독으로도, Syntitan 안에서도.
DTS 단독 도입
데이터 소스에 DTS를 단독으로 도입합니다. 원본 레코드에 손대지 않고, AI 업무에 부족한 데이터를 재구성합니다.
- 클래스 불균형 보정: 분포 충실도를 유지한 채 희소 클래스 예시를 추가 생성
- 희소 데이터셋을 프로덕션급 규모로 증강
- 엣지 케이스·희소 이벤트 샘플 생성
DTS + Syntitan
Syntitan 안에서 DTS는 활용 목적별 데이터 준비 단계에서 작동합니다. 재구성한 데이터는 선택한 모델·에이전트로 검증하고, 데이터 버전으로 릴리스해 실행마다 연결합니다.
- 제한 데이터는 고객 환경 안에 두고, 재구성 결과만 전달
- 업무 적합성 검증 단계에서 같은 모델·평가 조건으로 전후 결과 비교
- 데이터 버전 릴리스로 모든 실행과 이후 재검증에 연결
사기·거래 패턴을 학습 데이터로 확장
DTS로 사기·거래 데이터를 재구성해 AI 학습 레코드를 늘렸습니다.
이탈 예측 데이터를 DTS로 재구성
교보생명의 이탈 예측 AI에 필요한 데이터를 DTS로 재구성했습니다.
학습 데이터셋을 AI-Ready로
DTS로 국방 데이터를 AI-Ready 학습 데이터셋으로 재구성했습니다.
제한 데이터를 다루는 다른 방식과 DTS 비교.
| 역량 | DTS | 마스킹 / 비식별화 | 데이터 샘플링 | 수작업 라벨링 |
|---|---|---|---|---|
| 커버리지 확장 | ✓ 업무에 필요한 규모로 생성 | ✗ 새 데이터 생성 불가 | △ 실데이터 양에 한정 | △ 비싸고 느림 |
| 희소 클래스 증강 | ✓ 필요한 클래스만 골라 생성 | ✗ | ✗ 희소 이벤트 생성 불가 | △ 매우 높은 비용 |
| 분포 충실도 | ✓ 실통계 대조 검증 | △ 마스킹으로 왜곡 | △ 샘플링 편향 위험 | △ 라벨러 편차 |
| 프라이버시 경계 | ✓ DP 적용 시 형식적 경계 (ε) | △ 재식별 위험 잔존 | ✗ 없음 | ✗ |
| 외부 공유 | ✓ 원본 대신 재구성 결과 공유 | ✗ 잔여 위험 | ✗ | ✗ |
| Syntitan 연동 | ✓ 네이티브 버전 관리·바인딩 | ✗ | ✗ | ✗ |
DTS가 맞는 다섯 가지 상황.
AI 프로젝트는 데이터 조건이 학습·검증·배포를 막을 때 멈춥니다.
DTS는 이런 상황을 위해 만들어졌습니다.
GDPR·PIPA·HIPAA나 내부 보존 정책이 데이터가 모델에 닿는 것을 막습니다.
희소 클래스 비중이 너무 작고, 사기 패턴이 적고, 엣지 케이스가 학습 데이터에 없습니다.
과거 데이터가 보존 정책에 따라 삭제될 예정이라, 모델이 학습한 패턴도 함께 사라질 수 있습니다.
기밀·환자·고객 데이터는 내부에서조차 AI 학습용으로 반출할 수 없습니다.
원본 데이터셋이 견고한 모델을 학습하기엔 너무 작고, 더 모으는 데 몇 달이 걸립니다.
검증 결과와 인증·수상.
Gartner® Emerging Tech: Provider Differentiation Strategy–Trends for Hyper-Synthetic Data (2025)에 대표 벤더(Representative Vendor)로 등재.Gartner는 자사 리서치 발행물에 표시된 어떤 벤더·제품·서비스도 보증하지 않습니다. GARTNER는 Gartner, Inc. 및/또는 그 계열사의 등록상표입니다.
자주 묻는 질문
차등 프라이버시(DP)는 한 개인의 데이터가 출력에 미치는 영향을 수학적으로 제한하는 프레임워크입니다. 누군가 외부 정보를 결합하더라도 재식별 위험은 정해진 한도 안에서 관리됩니다. DTS는 데이터에 필요할 때 생성 과정에 DP를 적용해, 실제 개인 레코드를 복사하지 않고도 통계적 대표성을 유지하는 데이터셋을 만듭니다.
네. 데이터 재구성 작업에는 DTS를 단독으로 도입할 수 있습니다. Syntitan 안에서 쓰면 재구성한 데이터셋을 데이터 버전으로 릴리스하고, 해당 데이터를 쓴 실행과 연결합니다.
네 가지입니다. 사례가 너무 적은 데이터, 그대로는 쓸 수 없는 데이터, 업무에 맞는 형태가 아닌 데이터, 조건이 바뀌어 기준에 못 미치게 된 데이터입니다.
네. DTS는 고객 환경 안에서 실행되어 원본 데이터를 옮기지 않고 통계 특성을 분석하고, 재구성 결과만 전달합니다(필요 시 DP 적용). 기밀·규제·폐쇄망 환경에도 적용할 수 있습니다.
DTS는 CUBIG의 AI-native Data Reconstruction 기술이고, 단독으로 도입할 수 있습니다. Syntitan은 데이터 준비 상태를 진단하고, 선택한 모델·에이전트로 데이터의 업무 적합성을 검증하고, 모든 실행을 릴리스한 데이터 버전에 연결하는 AI-Ready Data Platform입니다. 활용 목적에 부족하거나 제한된 데이터가 필요하면 Syntitan이 DTS로 재구성합니다.
막혀 있던 데이터를,
AI가 쓸 수 있게.
부족하거나 제한된 데이터를 AI 업무에 필요한 형태로 재구성합니다.
GS 인증 1등급을 받았고, 조달청 혁신제품으로 선정된 제품입니다.