AI Briefing

DeepAmbigQA: LLM 답변 완전성 평가를 위한 모호한 다단계 질문

·2026.08.06 09:00

핵심 내용

DeepAmbigQA가 모호성과 다단계 추론을 결합해 LLM의 답변 완전성을 평가한다.

자세히 보기

DeepAmbigQA는 검색 도구를 사용하는 LLM이 복잡한 질문에 대해 답변을 얼마나 완전하게 수집하는지 평가하는 데이터셋이다. 동일한 이름을 가진 여러 대상을 구분하고, 대규모 후보 집합에서 정보를 모아 통합해야 하는 질문을 다룬다.

연구진은 텍스트 코퍼스와 연결형 지식 그래프를 기반으로 DEEPAMBIGQAGEN 자동 생성 파이프라인을 구축했다. 이를 통해 이름 모호성과 다단계 추론을 체계적으로 포함하면서도 자연스럽고 검증 가능한 질문을 생성했다.

DEEPAMBIGQA는 총 3,600개 질문으로 구성되며, 절반은 명시적인 이름 모호성 해소를 요구한다. 실험에서 최신 모델인 GPT-5도 답변을 완성하는 데 어려움을 보였으며, 정확 일치 점수는 모호한 질문에서 0.13, 비모호한 질문에서 0.21에 그쳤다.

연구 결과는 단순한 검색이나 단일 정답 예측을 넘어, 여러 정보를 빠짐없이 수집하고 통합하는 능력을 평가·개선할 필요가 있음을 보여준다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.