LLM 평가(LLM evaluation)는 대규모 언어 모델이 실제로 필요한 일을 해내는지 측정하는 과정입니다. 답 하나만 보고 모델을 판단하지 않고, 정해진 테스트 세트로 모델을 돌려 정확성·관련성·사실 근거·안전성·일관성 같은 기준으로 출력을 채점합니다. 방법은 자동 지표와 기준 답 비교부터 사람 검토, LLM-as-a-judge라 부르는 모델 기반 채점까지 다양합니다.
평가는 모델이 데모에서 실제 운영으로 넘어갈 때 특히 중요합니다. 운영에서는 같은 프롬프트가 시간이 지나도 믿을 만한 결과를 내야 하기 때문입니다. 평가 사이에 테스트 데이터나 실행 조건이 바뀌면 벤치마크 숫자 하나는 큰 의미가 없습니다. 그래서 신뢰할 수 있는 평가는 고정되고 버전이 관리되는 AI-Ready 데이터와 재현 가능한 실행에 기반합니다. 그래야 점수를 매번 새로 만들지 않고 비교하고 신뢰할 수 있습니다.
관련 용어: Model Evaluation · LLM Observability · Ground Truth · Reproducibility · Reproducible AI Execution