AI Briefing

GigaChat 3.1 기반 오디오 네이티브 LLM 공개

ai-sage/GigaChat3.1-Audio-10B-A1.8B · Hugging Face

·2026.07.26 18:59

GigaChat 3.1 Lightning을 기반으로 한 오디오 네이티브 LLM, GigaChat Audio 10B가 공개되었다.

GigaChat 3.1 Lightning 텍스트 모델을 기반으로 구축된 오디오 네이티브 LLM인 GigaChat Audio 10B가 Hugging Face에 공개되었습니다.

이 모델은 Conformer 음성 인코더와 모달리티 어댑터를 사용하여 오디오 임베딩을 Mixture-of-Experts(MoE) 디코더에 직접 전달하며, 이를 통해 기존 텍스트 모델의 품질을 유지하면서 음성 이해 능력을 추가했습니다.

주요 기능 및 특징:

  • 오디오 질의응답 및 분류: 음성 데이터를 직접 이해하고 질문에 답하거나 분류함
  • Temporal Grounding: 긴 오디오 내 특정 이벤트의 위치를 찾거나 타임스탬프가 포함된 요약 수행
  • 도구 사용(Tool-use) 및 텍스트 전용 작업 수행 가능
  • TimeGround-1M 데이터셋: 긴 형식의 오디오와 시간 정렬된 주석이 쌍을 이루는 전용 데이터셋을 통해 학습됨

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.