안녕하세요. 기업 데이터가 AI 업무에 실제로 활용될 수 있도록 돕는 큐빅(CUBIG)입니다.
행정안전부와 한국지능정보사회진흥원은 개방한 데이터를 AI가 바로 쓸 수 있는 상태로 관리하는 방법을 정리한 공공데이터 AI 친화 가이드라인 v1.1을 2026년 7월에 냈습니다.
평가용 체크리스트의 필수 문항을 모두 적정으로 채운 데이터라도, 개방하고 반년쯤 지나 활용 기업에서 문의가 들어오면 담당자가 답하지 못합니다. 형식은 다 맞췄지만 그 데이터가 어떻게 만들어졌는지 기록이 남아 있지 않기 때문입니다.
가이드라인은 데이터가 어떻게 만들어졌는지를 남긴 기록을 요구하고, 그 기록 가운데 네 가지는 갱신할 때마다 새로 만들어야 합니다.
개방한 공공데이터의 품질과 갱신을 맡은 담당자, 내년 데이터 사업을 기획하는 담당자를 위한 글입니다.
공공데이터 개방 후에 들어오는 질문 3가지
교통사고 상세정보를 CSV로 개방했다고 하겠습니다. 컬럼이 항목별로 나뉘고 빈값·중복이 없고 날짜 표기가 통일돼 있으며, 누적 10만 행에 데이터 사전도 붙였습니다. 평가용 체크리스트 14문항이 전부 적정입니다. 반년 뒤 이 데이터로 사고 위험 예측 모델을 만들던 기업에서 문의가 세 가지 들어옵니다.
- 이 데이터가 어느 지역, 어느 기간을 대표하나요? 전국이라고 보고 학습시켜도 되나요?
- 지난 분기 파일과 이번 파일의 값 분포가 다릅니다. 현상이 변한 건가요, 정제 규칙이 바뀐 건가요?
- 특정 구간 값이 이상합니다. 원천 시스템 문제인가요, 가공하면서 생긴 건가요?
같은 질문이 기관 안에서도 나옵니다. 보유 데이터로 AI 에이전트를 만드는 사업을 발주하면 수행사도 착수 단계에서 같은 질문을 합니다. 답할 기록이 없으면 수행사가 데이터를 다시 뜯어보는 데 시간을 쓰고, 그만큼 구축 일정이 밀립니다. 반대로 개방 과정에서 남긴 기록은 내부 AI 사업을 시작할 때 출발 자료가 됩니다.
세 질문에 답하려면 개방 시점의 형식이 아니라 데이터가 어떻게 만들어졌는지를 남긴 기록이 필요합니다. 각각 수집 범위와 분포, 갱신 전후 변경 이력, 원천에서 산출물까지의 경로를 기록해 두어야 합니다. 셋 다 파일을 열어서는 확인할 수 없고, 만들 때 남겨 두지 않으면 나중에 복원할 수도 없습니다.
공공데이터 AI 친화 가이드라인이 정의하는 AI-Ready Data
가이드라인이 말하는 AI-Ready Data는 별도의 정제·가공 공정 없이 AI 모델에 그대로 투입할 수 있고, 그 상태를 문서와 기록으로 증명할 수 있는 데이터 상태입니다.
가이드라인은 120면에 걸쳐 그 상태를 만드는 방법을 셋으로 나눠 제시합니다. 기관 차원에는 관리 원칙 15개, 데이터셋 차원에는 품질 지표 6개, 개별 데이터셋에는 데이터 카드 38개 항목입니다.
관리 원칙: 기관의 거버넌스
15개 원칙은 개별 데이터셋이 아니라 기관의 관리 체계를 대상으로 합니다. 데이터를 어떤 형식으로 내보낼지, 누가 품질을 책임질지, 접근 권한을 어떻게 나눌지, 생애주기 단계마다 무엇을 기록으로 남길지를 정하도록 요구합니다. 기관 차원의 절차로 만들어 두라는 뜻입니다.
품질 지표: 형식 검사에서 활용 가능성 검사로
품질 6지표는 지표마다 정의를 기존 정의와 확장 정의, 둘로 나눕니다. 기존 정의는 형식이 맞는지를 봅니다. 날짜 칸에 날짜가 들어 있는지, 필수 항목이 비어 있지 않은지, 코드값이 규칙을 지켰는지를 확인합니다. 확장 정의는 그 데이터로 AI를 학습시켰을 때 쓸 만한지를 봅니다.
형식 검사를 통과한 데이터가 활용 가능성 검사에서는 통과하지 못할 수 있습니다. 전국 교통사고 데이터에 빈칸이 하나도 없고 날짜 표기가 모두 통일돼 있으면 형식 검사는 통과합니다. 그런데 수집분의 대부분이 수도권에서 나왔다면 그 데이터로 만든 모델은 지방에서 제 성능을 내지 못해, 형식은 맞지만 쓸 수 없는 데이터가 됩니다.
가이드라인 39면은 이 차이를 “기존 공공데이터는 구조적 정합성 중심, 인공지능 친화적 공공데이터는 의미적 완결성 중심”이라고 적습니다. 목표는 “별도의 정제·공정 없이 AI 모델에 즉시 투입 가능한 실효적 품질 구현”입니다.
여섯 지표 중 완전성을 예로 들면 두 정의의 차이가 뚜렷합니다. 기존 정의는 필수 항목의 누락 여부와 대상·기간·지역·집단 등 필요한 범위의 정보 포함 수준을 봅니다. 확장 정의는 여기에 「주요 활용 맥락을 반영할 수 있는 수준의 정보를 확보했는가」라는 기준을 더하고, 주요 속성으로 충분성과 대표성·균형성 둘을 둡니다.
진단방법까지 지표 안에 적혀 있습니다. 대표성·균형성은 먼저 속성별 빈도수 히스토그램으로 편향을 눈으로 점검합니다. 그다음 학습 데이터와 검증 데이터의 분포 차이를 범주형이면 카이제곱 검증, 연속형이면 KS 테스트로 확인하도록 합니다. 이 검증이 걸러내야 할 상태도 예시로 적혀 있습니다. 전국 대상 서비스인데 수도권 데이터가 90% 이상을 차지하면, 형식 검사는 통과해도 지방 환경에서 인식 성능이 떨어집니다.

데이터 카드: 데이터셋마다 하나씩
데이터 카드는 데이터셋마다 하나씩 작성하는 설명 문서로, 활용 여부를 판단하는 데 필요한 핵심 정보를 표준화된 형태로 제공해야 합니다. 38개 항목 가운데 대부분은 사업계획서·품질진단 보고서·데이터 사전에 이미 있는 정보를 활용하면 되고, 재현성과 편향성 및 한계, 분할 정보만 새로 만들면 됩니다.

가이드라인 요구는 기관 판단과 도구 처리로 나뉩니다
세 묶음이 요구하는 기록은 성격이 둘로 나뉩니다. 기관이 판단해서 문장으로 남겨야 하는 기록이 있고, 갱신할 때마다 반복돼 수작업으로는 감당하기 어려운 기록이 있습니다.
도구가 대신할 수 없는 판단
편향성 및 한계와 권장·비권장 사용 범위는 도구로 대신할 수 없습니다. 편향은 적어 두고 활용 기업에 넘길 정보입니다. 다시 수집할 수 없는 편중이라면 데이터셋 설명에 한 줄을 적어 둡니다. 「이 데이터는 특정 조건에 치우쳐 있으므로 다른 환경에서는 별도 검증이 필요하다」고 적어 두면 활용 기업이 대응할 수 있습니다. 그 한 줄이 없으면 문의가 올 때마다 담당자가 기억으로 답하고, 담당자가 바뀌면 답도 달라집니다.
권장·비권장 사용 범위도 같습니다. 어떤 용도까지 허용할지는 기관이 사업 목적과 책임 범위를 보고 판단해야 하며, 분포 수치만으로는 정할 수 없습니다. 도구가 산출한 값은 판단의 근거가 될 뿐, 판단 자체를 대신하지는 않습니다.
데이터를 갱신할 때마다 함께 남겨야 할 기록
대표성 진단·재현성·계보·버전 이력은 데이터셋 하나라면 수작업으로 가능합니다. 분포를 한 번 세고 전처리 규칙을 적어 두면 끝납니다. 개방 목록이 수십 건이고 분기마다 갱신되면 사정이 달라집니다.
교통사고 데이터를 분기마다 갱신한다고 하겠습니다. 갱신할 때마다 다음 네 가지를 새로 만들어야 합니다.
- 대표성: 시도·연령대·사고유형별 건수 분포를 다시 셉니다
- 재현성: 그 분기에 적용한 전처리 규칙과 실행 환경을 다시 적습니다
- 계보: 원천 DB에서 개방 파일까지 거친 단계를 남깁니다
- 버전 이력: 직전 분기와 어느 컬럼이 달라졌는지 비교합니다
데이터셋이 서른 건이면 네 가지 작업을 서른 번씩, 분기마다 120건의 기록을 새로 만들어야 합니다. 한 번 빠뜨리면 그 분기의 기록이 비고, 비어 있는 기록은 나중에 복원되지 않습니다.
우리 기관의 개방 데이터는 준비됐나요?
내년 계획을 세우기 전에 다섯 가지를 확인해 보세요.
- 개방한 데이터셋마다 수집 범위와 분포를 적은 기록이 있나요?
- 분기 갱신 때 직전 파일과 무엇이 달라졌는지 비교한 기록이 남나요?
- 원천 DB에서 개방 파일까지 거친 가공 단계를 설명할 수 있나요?
- 지난 갱신에 쓴 전처리 규칙과 실행 환경을 그대로 다시 구성할 수 있나요?
- 편향과 한계, 비권장 사용 범위를 데이터 카드에 문장으로 적어 두었나요?
다섯 문항 가운데 두 개 이상에 “예”라고 답하기 어렵다면, 정비 계획에는 이 기록을 자동으로 남기는 일부터 넣어야 합니다.
Syntitan은 갱신마다 반복되는 기록을 자동으로 남깁니다
이 기록을 갱신할 때마다 사람이 다시 만들어야 하면 부담은 그대로 남습니다. CUBIG Syntitan은 기업 데이터의 AI 준비 상태를 진단·개선·검증하는 AI-Ready Data Platform입니다. 데이터가 AI에 쓸 수 있는 상태인지 진단하고, 그 시점의 상태를 고정해 두었다가, 나중에 같은 상태를 다시 불러옵니다. 가이드라인 요구마다 어떤 기능이 대응하고, 갱신할 때 어떤 기록이 자동으로 남는지는 아래와 같습니다.



Run Binding이 남기는 데이터 계보와 실행 메타데이터는 CUBIG이 출원한 특허 10-2026-0053050(AI 실행 통제를 위한 데이터 관리 방법 및 시스템, 2026.3.24. 출원)이 다루는 내용이기도 합니다. 재현성은 이 기록이 있어야 성립합니다. 어떤 데이터 상태로 실행했는지가 남아 있지 않으면, 같은 조건을 다시 만들 수도 없습니다.
평가 점수를 만드는 도구는 아닙니다. 개방·활용 영역 지표 ②(AI 친화·고가치 데이터 개방 노력)는 A기관 10점·B기관 8점짜리 정성평가이고 심사자는 사람이라, 점수를 보장하는 도구는 없습니다. 제품은 증빙이 필요한 항목의 근거를 만들고, 그 근거를 다음 해에도 같은 조건으로 다시 꺼내 볼 수 있게 보존합니다.
올해 남은 기간에 새로 만들 수 있는 실적은 많지 않으므로, 내년 사업에 반영해 두어야 합니다. 데이터 정제·품질진단·데이터 카드 작성을 별도 사업으로 잡거나 기존 데이터 사업의 과업에 넣어야 내년에 쓸 수 있습니다. 과업지시서에 넣을 항목은 셋입니다.
- 정제 과정 기록 산출물
- 분포·품질 검증 결과서
- 데이터 카드 작성
컨설팅 결과 파일만 납품받으면 내년에 같은 작업을 처음부터 다시 해야 합니다.
내년 데이터 사업을 기획한다면, 과업 산출물에 이 세 가지 기록이 들어 있는지부터 확인하세요. 개방 준비를 어디서부터 시작할지 막힌다면 공공데이터 개방 준비 문의로 연락 주세요.
