서울대 연구자, 오디오 전용 LM 공개
snkii/Sori-1B: Audio-Grounded LM Trained From Scratch (No Text-Only Pretraining)
·2026.08.31 11:48
핵심 내용
서울대 연구자가 텍스트 사전학습 없이 오디오 데이터만으로 학습한 1B 파라미터 언어모델 Sori-1B를 공개했다.
자세히 보기
서울대 연구자가 텍스트 전용 사전학습이나 기존 LM 초기화 없이, 오디오와 텍스트가 짝을 이룬 데이터만으로 디코더를 처음부터 학습한 **1B 파라미터 오디오-언어모델 'Sori-1B'**를 공개했다. 이 모델은 텍스트 기반 사전학습 모델이 오디오가 없는 상태에서도 텍스트 편향으로 인해 성능을 유지하는 문제를 해결하고, 실제 오디오에 기반한 답변을 생성하도록 설계되었다.
모델 구조 및 학습 방식
- 인코더: NVIDIA의 Audio Flamingo Next 인코더를 동결된 상태로 재사용하며, 이는 전체 파라미터의 **61.5%**를 차지한다.
- 디코더 및 토크나이저: 디코더, 임베딩, 출력 헤드, 그리고 오디오 개념 범주 기반으로 구축된 커스텀 'auditory-ontology' 토크나이저는 모두 처음부터 학습되었다.
- 학습 데이터 및 자원: 약 7.4천 시간, 4.75백만 개의 예제를 사용했으며, RTX 4090 3대로 학습을 진행했다.
성능 및 라이선스
Sori-1B는 객관식 문제(MCQ), 오픈 QA, 캡셔닝, 음성 인식(ASR) 모드를 지원한다. 연구팀은 기존 AF3 모델이 오디오를 침묵으로 대체해도 MMAU 점수의 **74%**가 유지되는 현상을 지적하며, Sori-1B가 오디오에 더 충실한 지식을 학습함을 시사했다. 다만, NVIDIA 인코더 재사용으로 인해 비상업/학술 전용 라이선스가 적용되며, 현재 저장소는 'coming soon' 상태로 가중치는 제한적으로 공개된다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.