Golden Dataset이란?

골든 데이터셋(golden dataset)은 모델, AI 애플리케이션, 데이터 파이프라인을 평가할 때 기준으로 쓰는, 검토를 거쳐 고정해 둔 입력과 기대 출력의 모음입니다. 기대 답안은 보통 해당 분야 전문가가 작성하거나 승인하며 흔한 사례와 이미 알려진 어려운 사례를 함께 담습니다. 비즈니스 인텔리전스 분야에서는 보고서가 기준으로 삼아야 하는 인증된 데이터셋을 가리키기도 합니다.

골든 데이터셋으로는 매번 같은 사례를 채점하므로 버전끼리 공정하게 비교할 수 있습니다. 예를 들어 계약서 어시스턴트의 새 프롬프트를 시험할 때, 검토를 마친 질문 200개를 다시 실행해 이전 버전과 정확도를 비교할 수 있습니다. 골든 데이터셋 자체도 관리가 필요합니다. 업무나 정책, 원천 데이터가 바뀌면 일부 기대 답안이 틀린 답이 되므로, 결과를 계속 비교할 수 있도록 데이터셋을 검토하고 버전을 매겨야 합니다.

자주 묻는 질문

골든 데이터셋은 얼마나 커야 합니까?

해당 업무의 주요 사례 유형과 알려진 예외 사례를 담을 만큼이면 됩니다. 많은 팀이 검토한 예시 수백 개로 시작해 새로운 실패가 나올 때마다 사례를 더합니다.

골든 데이터셋은 누가 만듭니까?

정답을 아는 해당 분야 전문가가 시스템을 만들거나 평가하는 팀과 함께 만듭니다.

골든 데이터셋과 학습 데이터셋은 무엇이 다릅니까?

학습 데이터셋은 모델을 학습시키거나 조정하는 데 씁니다. 골든 데이터셋은 평가용으로 고정해 두고 학습에 쓰지 않아야 합니다. 그래야 모델이 배우지 않은 사례에서 어떤 성능을 내는지 점수로 확인할 수 있습니다.