LLM 평가는 입력 사례, 기대 동작, 채점 기준을 정하고 후보 답변을 비교하는 과정입니다. 정확성, 근거성, 형식 준수처럼 서로 다른 기준을 분리하면 어떤 개선이 실제로 도움이 되는지 볼 수 있습니다.
데모의 점수는 가상의 예시이며 두 답변이 기준별로 다른 결과를 받는 장면을 보여줍니다. 평가셋이 실제 사용자 과제를 대표하는지와 채점의 일관성도 함께 확인해야 합니다.
언제 쓰나
모델 교체나 프롬프트 수정 전후를 감각이 아닌 재현 가능한 사례로 비교할 때 사용합니다.