GigaChat 3.1 기반 오디오 네이티브 LLM 공개
ai-sage/GigaChat3.1-Audio-10B-A1.8B · Hugging Face
·2026.07.26 18:59
핵심 내용
GigaChat 3.1 Lightning을 기반으로 한 오디오 네이티브 LLM, GigaChat Audio 10B가 공개되었다.
자세히 보기
GigaChat 3.1 Lightning 텍스트 모델을 기반으로 구축된 오디오 네이티브 LLM인 GigaChat Audio 10B가 Hugging Face에 공개되었습니다.
이 모델은 Conformer 음성 인코더와 모달리티 어댑터를 사용하여 오디오 임베딩을 Mixture-of-Experts(MoE) 디코더에 직접 전달하며, 이를 통해 기존 텍스트 모델의 품질을 유지하면서 음성 이해 능력을 추가했습니다.
주요 기능 및 특징:
- 오디오 질의응답 및 분류: 음성 데이터를 직접 이해하고 질문에 답하거나 분류함
- Temporal Grounding: 긴 오디오 내 특정 이벤트의 위치를 찾거나 타임스탬프가 포함된 요약 수행
- 도구 사용(Tool-use) 및 텍스트 전용 작업 수행 가능
- TimeGround-1M 데이터셋: 긴 형식의 오디오와 시간 정렬된 주석이 쌍을 이루는 전용 데이터셋을 통해 학습됨
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.