AI Briefing

FireRedAudio, 9B 통합 오디오 LLM 공개

FireRedAudio & FireRedTTS3 by FireRedTeam - Huggingface

·2026.08.22 01:05

핵심 내용

FireRedTeam이 이해와 생성을 분리한 9B 파라미터 통합 오디오 언어 모델 FireRedAudio를 공개했다.

자세히 보기

FireRedTeam이 FireRedAudio와 FireRedTTS3를 Hugging Face와 GitHub에 공개했다. FireRedAudio는 9B 파라미터 LLM을 기반으로 하며, 오디오 인코더(이해)와 RedAE 경로(생성)의 표현을 분리(decoupled)하는 설계로 ASR, 오디오 이해, 제로샷 TTS, 지시 기반 TTS, 음성 편집 등을 단일 모델로 수행한다.

1시간 분량의 오디오에 대해 정확한 시간 기반 정렬(temporal grounding)과 추론이 가능하며, MMAU, MMSU, Seed-TTS-Eval 등 주요 벤치마크에서 경쟁력 있는 성능을 보였다. FireRedTTS3는 의미적으로 풍부해진 음성 표현을 활용한 통합 음성 생성 및 편집 모델이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.