평가 데이터
정답 데이터
Ground truth
뜻
비교 기준으로 사용하는 신뢰 가능한 목표 답변이나 라벨입니다.
언제 쓰나
정답을 신뢰성 있게 정의할 수 있는 작업의 평가에 사용합니다.
활용 예시
추출된 송장 총액을 인간이 검증한 기준 값과 비교합니다.Generative AI Engineering
AI 품질을 검증하는 데이터셋, 평가 기준, 사람·모델 평가, 회귀 테스트, 효율성 지표의 핵심 용어를 설명합니다.
12 개 용어
평가 데이터
Ground truth
비교 기준으로 사용하는 신뢰 가능한 목표 답변이나 라벨입니다.
정답을 신뢰성 있게 정의할 수 있는 작업의 평가에 사용합니다.
추출된 송장 총액을 인간이 검증한 기준 값과 비교합니다.평가 데이터
Evaluation dataset
모델이나 애플리케이션의 동작을 측정하기 위해 구성한 사례 모음입니다.
실제 사용에서 나온 일반, 난이도 높은, 다국어, 안전 중요 사례를 포함합니다.
200개의 익명화된 지원 질문으로 구성된 고정 평가 데이터 세트를 생성합니다.평가 데이터
Benchmark
공통 조건에서 시스템을 비교하는 표준화된 과제나 데이터셋입니다.
방향성 비교에 사용한 뒤 실제 업무 데이터로 다시 검증합니다.
공개 벤치마크와 내부 평가 세트에서 후보 모델을 비교합니다.평가 기준
Metric
선택한 품질, 안전, 속도, 비용 특성을 수치로 나타낸 값입니다.
사용자와 업무 요구사항에 직접 연결되는 지표를 선택합니다.
답변 정확도, 인용 정확도, 거부 품질, 지연 시간 및 비용을 추적합니다.평가 기준
Rubric
결과물을 판단하기 위한 서술형 기준과 점수 수준의 집합입니다.
정확 일치보다 세밀한 판단이 필요한 품질 평가에 사용합니다.
증거 요구 사항과 함께 1에서 5까지 사실 확인을 평가합니다.평가 방법
Pointwise evaluation
하나의 결과를 기준이나 참조 답안에 따라 독립적으로 채점하는 방식입니다.
합격·불합격 판정이나 절대 품질 점수에 사용합니다.
대안을 보지 않고 이 답변의 정확성과 완전성을 평가합니다.평가 방법
Pairwise evaluation
같은 입력에 대한 두 결과를 비교해 더 나은 것을 고르는 방식입니다.
절대 점수보다 상대적인 선호를 판단하기 쉬울 때 사용합니다.
응답 A와 B가 주어졌을 때, 어느 응답이 원본 증거를 더 잘 따르는지 선택합니다.평가 방법
Human evaluation
사람이 지침과 라벨 예시를 바탕으로 수행하는 평가입니다.
주관적이거나 영향이 크고 문맥에 민감한 품질을 평가할 때 사용합니다.
두 명의 분야 전문가가 의료 요약의 정확성을 검토하고 의견 불일치를 해결합니다.평가 방법
LLM-as-a-judge
언어 모델로 다른 모델의 결과를 채점·순위화·비평하는 방식입니다.
사람의 판단과 보정한 뒤 대규모 평가에 사용합니다.
평가 모델도 편향되거나 일관되지 않을 수 있으므로 대표적인 사람 평가 사례로 점검해야 합니다.
판별 모델에 인용 지원에 대한 점수를 매기도록 요청하고, 고정된 평가 기준을 사용합니다.운영
Pass rate
정해진 합격 기준을 만족한 평가 사례의 비율입니다.
배포 기준과 시간에 따른 품질 변화를 추적할 때 사용합니다.
릴리스 전에 중요한 정책 질문에 대해 95% 이상의 합격률을 요구합니다.운영
Regression test
변경 후 기존에 잘 동작하던 기능이 깨졌는지 반복 확인하는 테스트입니다.
모델, 프롬프트, 검색, 도구, 정책이 바뀔 때 실행합니다.
시스템 지침을 업데이트한 후 수정된 평가 스위트를 다시 실행합니다.운영
Efficiency metrics
응답 지연 시간, 토큰 사용량, 처리량, 금전 비용 같은 측정값입니다.
품질과 함께 평가해 대규모 운영에서도 실용적인지 확인합니다.
요청 수뿐만 아니라 성공적인 작업당 p95 지연 시간과 비용을 비교합니다.