AI Briefing

LLM 기반 VQA 평가 지표 LAVE 제안

LAVE: Zero-shot VQA Evaluation on Docmatix with LLMs - Do We Still Need Fine-Tuning?

·2024.07.25 09:00

기존의 문자열 매칭 방식 대신 LLM을 활용해 의미적 유사성을 평가하는 LAVE 지표를 제안한다.

기존 VQA(Visual Question Answering) 평가는 모델의 답변과 정답을 정확히 일치시키는 Exact String Matching 방식에 의존해 왔다. 그러나 Docmatix와 같은 대규모 합성 데이터셋을 활용한 제로샷(Zero-shot) 환경에서는 답변의 형식이 다르더라도 의미적으로는 정답인 경우가 많아, 기존 지표(CIDER, ANLS, BLEU 등)가 모델의 성능을 과소평가하는 한계가 있다.

이를 해결하기 위해 LAVE(LLM-Assisted VQA Evaluation) 지표가 제안되었다. LAVE는 LLM을 활용하여 모델의 답변과 참조 답변 간의 의미적 유사성을 평가함으로써, 기존 지표보다 인간의 판단과 더 높은 상관관계를 갖도록 설계되었다.

연구 과정에서 벤치마크 점수를 높이기 위해 모델을 추가 파인튜닝할 경우, 오히려 인간 평가자 기준으로는 성능이 저하되는 현상이 발견되었다. 이는 단순한 수치 최적화보다 모델의 실제 성능을 반영할 수 있는 새로운 평가 패러다임이 필요함을 시사한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.