테스트 실행 비교 기능
·2023.10.18 00:37
LangChain이 LLM 애플리케이션 평가를 위해 여러 테스트 실행 결과를 나란히 비교할 수 있는 LangSmith의 신기능을 공개했다.
LLM 애플리케이션 구축 시 프롬프트나 체인 변경에 따른 효과를 정량적으로 평가하는 것은 매우 어렵습니다. 많은 개발자가 LLM 기반 평가를 활용하면서도, 동시에 결과에 대한 완전한 신뢰를 갖기 위해 데이터를 직접 검토하는 과정을 병행하고 있습니다.
LangChain은 이러한 니즈를 반영하여 LangSmith에 Test Run Comparisons 기능을 출시했습니다. 기존에는 각 테스트가 독립적으로 실행되어 비교가 어려웠으나, 이제는 여러 테스트 실행 결과를 나란히 놓고 비교할 수 있습니다.
주요 기능은 다음과 같습니다:
- 사이드 바이 사이드(Side-by-side) 뷰: 동일한 입력값에 대해 각 테스트 실행의 입력, 참조 출력, 실제 출력, 평가 지표, 지연 시간(Latency) 등을 한눈에 비교할 수 있습니다.
- 상세 데이터 드릴다운: 특정 데이터 포인트를 클릭하여 상세 정보를 확인하거나, 화살표 버튼을 통해 실행 결과 간을 빠르게 전환하며 검토할 수 있습니다.
- 엑셀 스타일의 필터링: 각 열에 필터를 적용하여 원하는 조건의 데이터만 골라낼 수 있습니다.
특히 한 테스트 실행은 정답인 데이터만, 다른 실행은 오답인 데이터만 필터링하여 비교하면 두 실행 간의 결정적인 차이점을 빠르게 파악할 수 있어 애플리케이션 개선에 큰 도움을 줍니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.