골든 데이터셋(golden dataset)은 모델, AI 애플리케이션, 데이터 파이프라인을 평가할 때 기준으로 쓰는, 검토를 거쳐 고정해 둔 입력과 기대 출력의 모음입니다. 기대 답안은 보통 해당 분야 전문가가 작성하거나 승인하며 흔한 사례와 이미 알려진 어려운 사례를 함께 담습니다. 비즈니스 인텔리전스 분야에서는 보고서가 기준으로 삼아야 하는 인증된 데이터셋을 가리키기도 합니다.
골든 데이터셋으로는 매번 같은 사례를 채점하므로 버전끼리 공정하게 비교할 수 있습니다. 예를 들어 계약서 어시스턴트의 새 프롬프트를 시험할 때, 검토를 마친 질문 200개를 다시 실행해 이전 버전과 정확도를 비교할 수 있습니다. 골든 데이터셋 자체도 관리가 필요합니다. 업무나 정책, 원천 데이터가 바뀌면 일부 기대 답안이 틀린 답이 되므로, 결과를 계속 비교할 수 있도록 데이터셋을 검토하고 버전을 매겨야 합니다.