Contextual Answers, 질의응답 성능에서 Foundation Model 능가
핵심 내용
AI21 Labs의 Contextual Answers 모델이 주요 Foundation Model들을 제치고 질의응답 성능과 신뢰성 지표에서 우수한 결과를 기록했다.
자세히 보기
언어 모델의 질의응답(QA) 품질을 결정하는 세 가지 핵심 지표는 Output accuracy(출력 정확도), Context integrity(문맥 무결성), Answer relevance(답변 관련성)이다. 특히 기업용 GenAI 솔루션 도입 시에는 환각(Hallucination)을 최소화하여 신뢰성을 확보하는 것이 무엇보다 중요하다.
AI21 Labs는 자사의 질의응답 특화 모델인 Contextual Answers의 성능을 검증하기 위해 SQuAD 2.0 데이터셋을 활용한 실험을 진행했다. 실험은 답변 가능 여부가 50:50으로 나뉜 1,000개의 샘플을 대상으로 수행되었다.
실험 결과, Contextual Answers는 다음과 같은 주요 Foundation Model들을 능가하는 성능을 보였다:
- Claude 3 Sonnet & Haiku
- GPT-4 Turbo & GPT 3.5 Turbo
- Mixtral 8x7B
특히 Contextual Answers는 답변이 없는 질문을 정확히 식별하여 환각을 방지하는 Context integrity와 불필요한 정보 없이 핵심만 전달하는 Answer relevance 측면에서 압도적인 신뢰성을 입증했다. 이는 범용 모델보다 특정 작업에 최적화된 Task-Specific Model이 특정 분야에서 더 높은 효율을 낼 수 있음을 보여준다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.