LLM-as-a-Judge를 인간의 선호도에 맞게 정렬하기
·2024.06.27 01:59
LangSmith가 인간의 피드백을 학습하여 LLM 평가 모델을 스스로 개선하는 기능을 선보였다.
LLM 애플리케이션의 성능을 측정할 때, 자연어 출력의 특성상 기존의 하드코딩된 규칙이나 유닛 테스트로는 정확한 평가가 어렵습니다. 이를 해결하기 위해 별도의 LLM을 평가자로 사용하는 LLM-as-a-Judge 방식이 널리 사용되고 있습니다.
하지만 LLM-as-a-Judge를 제대로 작동시키기 위해서는 평가용 프롬프트를 설계하는 별도의 프롬프트 엔지니어링 과정이 필요하다는 단점이 있습니다. 이를 해결하기 위해 LangSmith는 새로운 '자기 개선(self-improvement)' 솔루션을 도입했습니다.
이 기능의 핵심은 다음과 같습니다:
- 사용자가 LLM-as-a-Judge의 결과물을 수정하면, 해당 인간의 피드백이 Few-shot 예시로 저장됩니다.
- 저장된 예시는 다음 평가 시 프롬프트에 자동으로 포함되어 평가 모델의 성능을 높입니다.
- 결과적으로 복잡한 프롬프트 엔지니어링 없이도 사용자의 선호도를 반영하는 맞춤형 평가기를 구축할 수 있습니다.
LLM-as-a-Judge는 RAG의 환각(Hallucination) 탐지, 정답 여부 확인, 유해성 검사 등 다양한 유스케이스에서 활용되며, 평가 시점에 정답(Ground Truth) 정보를 제공함으로써 생성 단계보다 더 높은 정확도로 답변을 판별할 수 있습니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.