Big Bench Audio 벤치마크 공개
Evaluating Audio Reasoning with Big Bench Audio
오디오 언어 모델의 추론 능력을 평가하는 새로운 데이터셋 Big Bench Audio가 공개되었다.
Artificial Analysis가 오디오 언어 모델의 추론 능력을 정밀하게 평가하기 위한 Big Bench Audio 데이터셋을 공개했다. 이 데이터셋은 고난도 추론 테스트인 Big Bench Hard의 질문들을 오디오 도메인으로 변환하여 구성되었다.
데이터셋은 논리적 추론(Formal Fallacies), 경로 탐색(Navigate), 사물 개수 세기(Object Counting), 불리언 논리(Web of Lies) 등 4개 카테고리의 총 1,000개 오디오 질문을 포함한다. 질문은 다양한 합성 음성을 사용하여 생성되었으며, 텍스트 기반 성능과 오디오 기반 성능의 차이를 측정하는 데 중점을 둔다.
주요 분석 결과, 모델의 모달리티 전환에 따른 성능 저하인 **'speech reasoning gap'**이 관찰되었다. GPT-4o의 경우 텍스트 기반 테스트에서는 **92%**의 높은 정확도를 기록했으나, Speech-to-Speech 환경에서는 **66%**로 성능이 급격히 떨어지는 모습을 보였다.
이 벤치마크는 Speech-to-Speech, Speech-to-Text, Text-to-Speech, Text-to-Text의 4가지 설정을 통해 모델이 음성 입출력 과정에서 추론 능력을 얼마나 유지하는지 다각도로 검증한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.