AI Briefing

서울대 연구자, 오디오 전용 LM 공개

snkii/Sori-1B: Audio-Grounded LM Trained From Scratch (No Text-Only Pretraining)

·2026.08.31 11:48

핵심 내용

서울대 연구자가 텍스트 사전학습 없이 오디오 데이터만으로 학습한 1B 파라미터 언어모델 Sori-1B를 공개했다.

자세히 보기

서울대 연구자가 텍스트 전용 사전학습이나 기존 LM 초기화 없이, 오디오와 텍스트가 짝을 이룬 데이터만으로 디코더를 처음부터 학습한 **1B 파라미터 오디오-언어모델 'Sori-1B'**를 공개했다. 이 모델은 텍스트 기반 사전학습 모델이 오디오가 없는 상태에서도 텍스트 편향으로 인해 성능을 유지하는 문제를 해결하고, 실제 오디오에 기반한 답변을 생성하도록 설계되었다.

모델 구조 및 학습 방식

  • 인코더: NVIDIA의 Audio Flamingo Next 인코더를 동결된 상태로 재사용하며, 이는 전체 파라미터의 **61.5%**를 차지한다.
  • 디코더 및 토크나이저: 디코더, 임베딩, 출력 헤드, 그리고 오디오 개념 범주 기반으로 구축된 커스텀 'auditory-ontology' 토크나이저는 모두 처음부터 학습되었다.
  • 학습 데이터 및 자원: 약 7.4천 시간, 4.75백만 개의 예제를 사용했으며, RTX 4090 3대로 학습을 진행했다.

성능 및 라이선스

Sori-1B는 객관식 문제(MCQ), 오픈 QA, 캡셔닝, 음성 인식(ASR) 모드를 지원한다. 연구팀은 기존 AF3 모델이 오디오를 침묵으로 대체해도 MMAU 점수의 **74%**가 유지되는 현상을 지적하며, Sori-1B가 오디오에 더 충실한 지식을 학습함을 시사했다. 다만, NVIDIA 인코더 재사용으로 인해 비상업/학술 전용 라이선스가 적용되며, 현재 저장소는 'coming soon' 상태로 가중치는 제한적으로 공개된다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.