DramaBox, 음성 모델 공개
DramaBox - Most Expressive Voice model ever based on LTX 2.3
·2026.05.14 02:06
Resemble AI가 LTX 2.3 기반 음성합성 모델 DramaBox를 공개했다.
Resemble AI가 DramaBox를 공개했다.
이 모델은 LTX-2.3 3.3B audio-only 위에 얹은 IC-LoRA 튜닝으로, 프롬프트만으로 화자 정체성·감정·말투·웃음·한숨·멈춤·전환을 제어하는 프롬프트 기반 TTS다. 선택적으로 10초+ 음성 레퍼런스를 넣어 대상 음색을 복제하며, 텍스트 임베딩은 Gemma 3 12B를 사용한다.
- GitHub, Hugging Face 모델 카드, Hugging Face Space를 함께 공개했다.
- 추론 가중치는
dramabox-dit-v1.safetensors6.6GB, 오디오 컴포넌트는 1.9GB다. - warm server 기준 생성 시간은 약 2.5초, 피크 VRAM은 약 24GB로 제시됐다.
- 출력에는 기본적으로 Resemble Perth의 신경망 워터마크가 적용되며,
--no-watermark로 끌 수 있다. - 베이스 모델은 Lightricks/LTX-2.3이고, 라이선스는 LTX-2 Community License다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.