AI Briefing

MOSS-Transcribe-Diarize 모델 공개

OpenMOSS-Team/MOSS-Transcribe-Diarize · Hugging Face

·2026.07.10 00:50

음성 전사, 화자 분리, 타임스탬프 생성을 한 번에 수행하는 0.9B 규모의 오디오 이해 모델이 공개되었습니다.

MOSS-Transcribe-Diarize 0.9B는 긴 분량의 멀티 스피커 오디오를 구조화된 텍스트로 변환하는 엔드 투 엔드(End-to-End) 오디오 이해 모델입니다.

기존 방식처럼 ASR(자동 음성 인식)과 화자 분리(Diarization) 시스템을 별도로 연결할 필요 없이, 단 한 번의 패스로 화자 식별([S01], [S02] 등), 타임스탬프, 텍스트 전사를 동시에 수행합니다. 회의, 팟캐스트, 인터뷰 등 복잡한 다중 화자 환경에 최적화되어 있습니다.

주요 특징 및 사양:

  • 통합 파이프라인: 음성 전사와 화자 분리를 결합하여 시간 축이 일치하는 일관된 결과물 생성
  • 프롬프트 제어: 사용자 정의 전사 지침, 특정 단어(Hotwords) 지정, 음향 이벤트 주석 생성 지원
  • 모델 구조: Qwen3-0.6B 스타일의 Causal Decoder와 Whisper-Medium 인코더를 결합한 구조
  • 출력 형식: [start][Sxx]text[end] 형태의 압축된 화자 인식 텍스트 생성
  • 추론 지원: GGUF 포맷을 통해 효율적인 로컬 추론 가능

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.