SimpleQA 공개
·2024.10.30 19:00
OpenAI가 언어 모델의 사실성을 측정하기 위한 새로운 벤치마크인 SimpleQA를 오픈소스로 공개했다.
언어 모델의 고질적인 문제인 **할루시네이션(hallucinations)**을 측정하고 줄이기 위해, OpenAI는 짧고 사실 중심적인 질문에 대한 답변 능력을 평가하는 SimpleQA 벤치마크를 오픈소스로 공개했다.
SimpleQA는 다음과 같은 특징을 갖는다.
- 높은 정확도: 두 명의 독립적인 AI 트레이너가 검증한 정답을 사용한다.
- 다양성: 과학, 기술부터 TV 쇼, 비디오 게임까지 폭넓은 주제를 다룬다.
- 높은 난이도: 기존 벤치마크보다 어려워, GPT-4o의 점수가 40% 미만일 정도로 도전적이다.
- 우수한 연구 UX: 질문과 답변이 간결하여 실행이 빠르고 채점 효율이 높다.
데이터셋의 품질을 위해 질문은 단일하고 논쟁의 여지가 없는 답변을 가져야 하며, 시간이 지나도 변하지 않는 사실이어야 한다. 검증 결과, 데이터셋의 고유 오류율은 약 **3%**로 추정된다.
채점에는 ChatGPT 분류기를 사용하며, 모델의 답변을 'Correct(정확)', 'Incorrect(부정확)', 'Not attempted(시도하지 않음)' 세 가지 등급으로 분류하여 평가한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.