Contextual Answers, 질의응답 성능에서 Foundation Model 능가
AI21 Labs의 Contextual Answers 모델이 주요 Foundation Model들을 제치고 질의응답 성능과 신뢰성 지표에서 우수한 결과를 기록했다.
언어 모델의 질의응답(QA) 품질을 결정하는 세 가지 핵심 지표는 Output accuracy(출력 정확도), Context integrity(문맥 무결성), Answer relevance(답변 관련성)이다. 특히 기업용 GenAI 솔루션 도입 시에는 환각(Hallucination)을 최소화하여 신뢰성을 확보하는 것이 무엇보다 중요하다.
AI21 Labs는 자사의 질의응답 특화 모델인 Contextual Answers의 성능을 검증하기 위해 SQuAD 2.0 데이터셋을 활용한 실험을 진행했다. 실험은 답변 가능 여부가 50:50으로 나뉜 1,000개의 샘플을 대상으로 수행되었다.
실험 결과, Contextual Answers는 다음과 같은 주요 Foundation Model들을 능가하는 성능을 보였다:
- Claude 3 Sonnet & Haiku
- GPT-4 Turbo & GPT 3.5 Turbo
- Mixtral 8x7B
특히 Contextual Answers는 답변이 없는 질문을 정확히 식별하여 환각을 방지하는 Context integrity와 불필요한 정보 없이 핵심만 전달하는 Answer relevance 측면에서 압도적인 신뢰성을 입증했다. 이는 범용 모델보다 특정 작업에 최적화된 Task-Specific Model이 특정 분야에서 더 높은 효율을 낼 수 있음을 보여준다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.