KorQuAD 2.0 1위 달성: 긴 문맥 질의응답을 위한 생성형 모델
·2026.07.16 09:00
핵심 내용
LG AI연구원이 EXAONE LM 1.0을 활용해 한국어 기계독해 평가 KorQuAD 2.0에서 1위를 달성했다.
1 / 2
자세히 보기
LG AI연구원 EXAONE Lab은 한국어 기계독해(MRC) 평가 데이터셋인 KorQuAD 2.0 리더보드에서 1위를 달성했다. 이는 지난 6월 KorQuAD 1.0 1위에 이은 성과다.
KorQuAD 2.0은 기존 1.0보다 문서 길이가 길고 복잡하며, HTML 태그가 포함된 위키백과 문서를 입력으로 받는다. 모델은 짧은 답변부터 표(Table), 리스트(List) 형태의 긴 문단 답변까지 다양한 형태를 정확하게 생성해야 하는 도전적인 과제를 안고 있다.
이를 위해 LG AI연구원은 EXAONE LM 1.0 모델을 개발했다. 이 모델은 Encoder-Decoder 구조를 채택하여 문서 이해와 생성 능력을 동시에 확보했으며, 전문가 데이터를 통해 학습되어 적은 컴퓨팅 자원으로도 높은 성능을 발휘한다.
성능 고도화를 위해 Post-training 기법을 적용했다. HTML 구조의 맥락 유실을 방지하고자 HTML 문서와 QA 데이터셋을 활용해 Span Corruption Objective로 추가 학습을 진행했으며, 특히 HTML-T5에서 제안된 Long Span Denoising 방식을 도입해 긴 답변 처리 능력을 극대화했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.