DTS · AI-native 데이터 재구성

쓸 수 없는 데이터를
AI-Ready 데이터셋으로 재구성.

대부분의 기업 데이터는 그대로 AI에 쓸 수 없습니다.
DTS가 제한되거나 불균형하거나 부족한 데이터를
실제로 쓸 수 있는 AI-Ready 데이터셋으로 재구성합니다.

제한된 데이터는 쓸 수 있는 형태로 재구성하고,
불균형한 데이터셋은 추가 데이터로 바로잡고, 커버리지 공백은 새 AI-Ready 데이터로 채웁니다.

입점 마켓플레이스 AWS Marketplace Naver Cloud Marketplace
데이터 문제

데이터가 AI에 닿지 못하는 네 가지 이유.

데이터는 대개 이미 있습니다. 다만 AI 업무에 쓸 수 있는 형태가 아닐 뿐입니다.
DTS가 업무에 맞게 재구성합니다.

사례가 너무 적다

부족한 사례를 재구성해 채웁니다. 희소 이벤트, 사기 사례, 엣지 케이스가 너무 적어 학습·검증에 쓰기 어렵습니다.

  • 원본 데이터 패턴과 일관되게 희소 클래스 사례 추가
  • 업무에 필요한 양만큼 부족한 데이터셋 확장
  • 테스트·검증용 엣지 케이스 생성

그대로는 쓸 수 없다

원본을 옮기지 않고 재구성합니다. 규제·민감 레코드는 그대로 학습·검증에 넣을 수 없습니다.

  • 업무에 필요한 통계 패턴 유지
  • 데이터에 필요할 때 차등 프라이버시 적용
  • 고객 정책에 맞춰 팀·파트너와 공유

업무에 맞는 형태가 아니다

목표 업무에 맞게 다듬습니다. 결측치, 편향, 오래된 형식이 모델이 배우는 내용을 왜곡합니다.

  • 결측·커버리지 공백을 채우고 치우친 구간 보정
  • 필드 사이 관계를 그대로 유지
  • 원본 분포와 대조해 결과 확인

조건이 계속 바뀐다

바뀌면 다시 확인합니다. 새 데이터, 스키마 변경, 정책 갱신으로 이전 데이터셋이 기준에 못 미칠 수 있습니다.

  • 영향받는 범위만 재구성
  • Syntitan 안에서 같은 모델·에이전트로 재검증
  • 새 데이터를 버전으로 릴리스
역량

재구성이 먼저, 합성데이터는 방법 중 하나.

DTS는 AI 업무에 필요한 패턴과 관계를 재구성합니다.
합성 레코드 생성은 여러 방법 중 하나이고,
데이터에 필요할 때 차등 프라이버시를 적용합니다.

01사례 부족

증강

희소 클래스와 엣지 케이스 사례를 더해, 모델이 학습할 만큼 채웁니다.

02품질 부족

보정

결측·커버리지 공백을 채우고 치우친 구간을 바로잡습니다. 필드 사이 관계는 그대로 둡니다.

03사용 제한

합성 생성

원본을 그대로 쓸 수 없을 때 통계 모델로 새 레코드를 만듭니다. 차등 프라이버시는 여기서 적용합니다.

구성 기술

01재구성 전 데이터 확인
컬럼 자동 분류
02데이터 재구성
표·텍스트 합성 데이터 생성LLM 기반 결측 보정임베딩 기반 유사도 평가
03품질·적합성 평가
TVD · 2D CorrelationCoverage · Copy RiskTSTR 분류 평가
04평가 기록
결과 manifest·로그 기록
차등 프라이버시

필요한 곳에, 차등 프라이버시.

차등 프라이버시란

차등 프라이버시(DP)는 한 개인의 데이터가 합성 출력에 미치는 영향을 수학적으로 제한하는 프레임워크입니다. 누군가 외부 정보를 결합하더라도 재식별 위험이 정해진 한도 안에서 관리됩니다.

DTS는 필요할 때 DP를 적용하며, 사후 마스킹 단계가 아니라 생성 과정 자체에 적용합니다. 프라이버시 속성은 마스킹이나 필드 제거에 기대지 않고 생성 과정에서 확보되며, 증명 가능한 경계를 가집니다.

경계

엡실론(ε)은 레코드 하나가 결과를 얼마나 바꿀 수 있는지 정하는 값입니다. ε이 작을수록 경계가 엄격합니다.

DTS가 새 레코드를 생성하는 방식

01
통계 프로파일링

원본 레코드를 저장하지 않고 실제 데이터셋의 통계 특성(분포·상관관계를 비롯한 통계 패턴)을 분석합니다.

02
필요할 때 DP 적용

데이터에 필요한 경우, 정해진 DP 경계 안에서 보정된 노이즈를 통계 모델에 더합니다.

03
재구성

모델에서 새 레코드를 만들어, 실제 레코드를 복사하지 않고도 업무에 필요한 패턴과 관계를 유지합니다.

04
적합성 확인

결과를 원본 분포와 대조합니다. Syntitan 안에서는 선택한 모델·에이전트로 같은 조건에서 함께 검증합니다.

배포

DTS 단독으로도, Syntitan 안에서도.

Mode A · 직접 도입

DTS 단독 도입

데이터 소스에 DTS를 단독으로 도입합니다. 원본 레코드에 손대지 않고, AI 업무에 부족한 데이터를 재구성합니다.

  • 클래스 불균형 보정: 분포 충실도를 유지한 채 희소 클래스 예시를 추가 생성
  • 희소 데이터셋을 프로덕션급 규모로 증강
  • 엣지 케이스·희소 이벤트 샘플 생성
Mode B · 연동형

DTS + Syntitan

Syntitan 안에서 DTS는 활용 목적별 데이터 준비 단계에서 작동합니다. 재구성한 데이터는 선택한 모델·에이전트로 검증하고, 데이터 버전으로 릴리스해 실행마다 연결합니다.

  • 제한 데이터는 고객 환경 안에 두고, 재구성 결과만 전달
  • 업무 적합성 검증 단계에서 같은 모델·평가 조건으로 전후 결과 비교
  • 데이터 버전 릴리스로 모든 실행과 이후 재검증에 연결
도입 사례
금융 · IBK 기업은행

사기·거래 패턴을 학습 데이터로 확장

DTS로 사기·거래 데이터를 재구성해 AI 학습 레코드를 늘렸습니다.

금융 · 교보생명

이탈 예측 데이터를 DTS로 재구성

교보생명의 이탈 예측 AI에 필요한 데이터를 DTS로 재구성했습니다.

국방

학습 데이터셋을 AI-Ready로

DTS로 국방 데이터를 AI-Ready 학습 데이터셋으로 재구성했습니다.

비교

제한 데이터를 다루는 다른 방식과 DTS 비교.

역량DTS마스킹 / 비식별화데이터 샘플링수작업 라벨링
커버리지 확장✓ 업무에 필요한 규모로 생성✗ 새 데이터 생성 불가△ 실데이터 양에 한정△ 비싸고 느림
희소 클래스 증강✓ 필요한 클래스만 골라 생성✗✗ 희소 이벤트 생성 불가△ 매우 높은 비용
분포 충실도✓ 실통계 대조 검증△ 마스킹으로 왜곡△ 샘플링 편향 위험△ 라벨러 편차
프라이버시 경계✓ DP 적용 시 형식적 경계 (ε)△ 재식별 위험 잔존✗ 없음✗
외부 공유✓ 원본 대신 재구성 결과 공유✗ 잔여 위험✗✗
Syntitan 연동✓ 네이티브 버전 관리·바인딩✗✗✗
도입 신호

DTS가 맞는 다섯 가지 상황.

AI 프로젝트는 데이터 조건이 학습·검증·배포를 막을 때 멈춥니다.
DTS는 이런 상황을 위해 만들어졌습니다.

제한된 데이터
데이터는 있는데 컴플라이언스가 AI 접근을 막는다.

GDPR·PIPA·HIPAA나 내부 보존 정책이 데이터가 모델에 닿는 것을 막습니다.

사용 불가 데이터
불균형 데이터셋·커버리지 공백이 모델을 왜곡한다.

희소 클래스 비중이 너무 작고, 사기 패턴이 적고, 엣지 케이스가 학습 데이터에 없습니다.

사용 불가 데이터
보존 정책이 AI에 필요한 데이터를 삭제한다.

과거 데이터가 보존 정책에 따라 삭제될 예정이라, 모델이 학습한 패턴도 함께 사라질 수 있습니다.

제한된 데이터
민감 레코드가 고객 환경을 벗어날 수 없다.

기밀·환자·고객 데이터는 내부에서조차 AI 학습용으로 반출할 수 없습니다.

사용 불가 데이터
학습 데이터가 너무 적어 믿을 만한 AI를 만들기 어렵다.

원본 데이터셋이 견고한 모델을 학습하기엔 너무 작고, 더 모으는 데 몇 달이 걸립니다.

결과

어느 경우든 DTS는 제한되거나 쓸 수 없는 데이터를 원본 레코드를 옮기지 않고 AI-Ready 데이터셋으로 바꿉니다.

내 데이터에 DTS가 맞는지 확인
검증

검증 결과와 인증·수상.

SK텔레콤
교보생명
대한민국 육군
대한민국 공군
IBK 기업은행
우리은행
국가유산청
NH농협은행
다날
국민건강보험공단
국민대학교
Intellyx Digital Innovator Award 2026 NextRise Global Innovator 2024 Information Security Product Innovation Award 2024, DTS GS Certified Grade 1, DTS 2025 Startup World Cup Finalist 2025 ISO/IEC 27001:2022 Information Security ISO/IEC 42001:2023 AI Management Emerging AI+X Top 100 2026 (AIIA) AI Medical Innovation Award, AI EXPO KOREA 2025
12곳
고객·PoC
금융·공공·국방 등
GS 1등급
소프트웨어 품질 인증
2025년 인증
2곳
클라우드 마켓플레이스
AWS · 네이버 클라우드

Gartner® Emerging Tech: Provider Differentiation Strategy–Trends for Hyper-Synthetic Data (2025)에 대표 벤더(Representative Vendor)로 등재.Gartner는 자사 리서치 발행물에 표시된 어떤 벤더·제품·서비스도 보증하지 않습니다. GARTNER는 Gartner, Inc. 및/또는 그 계열사의 등록상표입니다.

FAQ

자주 묻는 질문

DTS는 CUBIG의 AI-native Data Reconstruction 기술입니다. 부족하거나 불균형하거나 제한된 기업 데이터를 AI 업무에 필요한 패턴과 관계를 유지하며 재구성합니다. 원본을 옮기지 않고도 클래스 불균형을 보정하고, 커버리지 공백을 메우고, 학습 데이터를 늘릴 수 있습니다. 단독으로 도입할 수 있고 Syntitan의 핵심 역량으로도 작동하며, 필요할 때 차등 프라이버시(DP)를 적용합니다.

차등 프라이버시(DP)는 한 개인의 데이터가 출력에 미치는 영향을 수학적으로 제한하는 프레임워크입니다. 누군가 외부 정보를 결합하더라도 재식별 위험은 정해진 한도 안에서 관리됩니다. DTS는 데이터에 필요할 때 생성 과정에 DP를 적용해, 실제 개인 레코드를 복사하지 않고도 통계적 대표성을 유지하는 데이터셋을 만듭니다.

네. 데이터 재구성 작업에는 DTS를 단독으로 도입할 수 있습니다. Syntitan 안에서 쓰면 재구성한 데이터셋을 데이터 버전으로 릴리스하고, 해당 데이터를 쓴 실행과 연결합니다.

네 가지입니다. 사례가 너무 적은 데이터, 그대로는 쓸 수 없는 데이터, 업무에 맞는 형태가 아닌 데이터, 조건이 바뀌어 기준에 못 미치게 된 데이터입니다.

네. DTS는 고객 환경 안에서 실행되어 원본 데이터를 옮기지 않고 통계 특성을 분석하고, 재구성 결과만 전달합니다(필요 시 DP 적용). 기밀·규제·폐쇄망 환경에도 적용할 수 있습니다.

DTS는 CUBIG의 AI-native Data Reconstruction 기술이고, 단독으로 도입할 수 있습니다. Syntitan은 데이터 준비 상태를 진단하고, 선택한 모델·에이전트로 데이터의 업무 적합성을 검증하고, 모든 실행을 릴리스한 데이터 버전에 연결하는 AI-Ready Data Platform입니다. 활용 목적에 부족하거나 제한된 데이터가 필요하면 Syntitan이 DTS로 재구성합니다.

막혀 있던 데이터를,
AI가 쓸 수 있게.

부족하거나 제한된 데이터를 AI 업무에 필요한 형태로 재구성합니다.
GS 인증 1등급을 받았고, 조달청 혁신제품으로 선정된 제품입니다.

입점 마켓플레이스 AWS Marketplace Naver Cloud Marketplace