AI Briefing

KorQuAD 2.0 1위 달성: 긴 문맥 질의응답을 위한 생성형 모델

·2026.07.16 09:00

LG AI연구원이 EXAONE LM 1.0을 활용해 한국어 기계독해 평가 KorQuAD 2.0에서 1위를 달성했다.

LG AI연구원 EXAONE Lab은 한국어 기계독해(MRC) 평가 데이터셋인 KorQuAD 2.0 리더보드에서 1위를 달성했다. 이는 지난 6월 KorQuAD 1.0 1위에 이은 성과다.

KorQuAD 2.0은 기존 1.0보다 문서 길이가 길고 복잡하며, HTML 태그가 포함된 위키백과 문서를 입력으로 받는다. 모델은 짧은 답변부터 표(Table), 리스트(List) 형태의 긴 문단 답변까지 다양한 형태를 정확하게 생성해야 하는 도전적인 과제를 안고 있다.

이를 위해 LG AI연구원은 EXAONE LM 1.0 모델을 개발했다. 이 모델은 Encoder-Decoder 구조를 채택하여 문서 이해와 생성 능력을 동시에 확보했으며, 전문가 데이터를 통해 학습되어 적은 컴퓨팅 자원으로도 높은 성능을 발휘한다.

성능 고도화를 위해 Post-training 기법을 적용했다. HTML 구조의 맥락 유실을 방지하고자 HTML 문서와 QA 데이터셋을 활용해 Span Corruption Objective로 추가 학습을 진행했으며, 특히 HTML-T5에서 제안된 Long Span Denoising 방식을 도입해 긴 답변 처리 능력을 극대화했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.