AI Briefing

IndQA 소개

·2025.11.04 07:30

AI 모델의 인도 문화 및 언어 이해도를 평가하기 위한 새로운 벤치마크인 IndQA가 공개되었다.

기존 다국어 벤치마크인 MMMLU 등은 이미 점수가 포화 상태에 이르러 모델의 실제 발전을 측정하기 어렵다. 또한, 단순 번역이나 객관식 위주의 평가 방식은 언어의 맥락, 문화, 역사 등 실질적인 이해도를 파악하는 데 한계가 있다.

이를 해결하기 위해 개발된 IndQA는 AI 모델이 인도 언어로 된 질문을 얼마나 잘 이해하고 추론하는지 평가한다. 인도는 약 10억 명의 비영어권 사용자와 22개의 공식 언어를 보유한 거대 시장이며, ChatGPT의 두 번째로 큰 시장이다.

IndQA의 주요 특징은 다음과 같다:

  • 12개 언어(Hinglish 포함) 및 10개 문화 영역 커버
  • 2,278개의 질문과 261명의 분야 전문가 참여
  • 건축, 예술, 음식, 역사, 법률, 종교 등 폭넓은 주제 포함

평가 방식은 전문가가 작성한 루브릭(Rubric) 기반이다. 각 답변은 전문가가 설정한 기준에 따라 모델 기반 채점기(Model-based grader)를 통해 점수가 매겨진다.

질문의 품질을 높이기 위해 적대적 필터링(Adversarial filtering) 과정을 거쳤다. GPT-4o, OpenAI o3, GPT-4.5 등 최신 모델들이 해결하지 못하는 고난도 질문만을 선별하여 모델의 발전 가능성을 확보했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.