AI Briefing

DramaBox, 음성 모델 공개

DramaBox - Most Expressive Voice model ever based on LTX 2.3

·2026.05.14 02:06

Resemble AI가 LTX 2.3 기반 음성합성 모델 DramaBox를 공개했다.

Resemble AI가 DramaBox를 공개했다.

이 모델은 LTX-2.3 3.3B audio-only 위에 얹은 IC-LoRA 튜닝으로, 프롬프트만으로 화자 정체성·감정·말투·웃음·한숨·멈춤·전환을 제어하는 프롬프트 기반 TTS다. 선택적으로 10초+ 음성 레퍼런스를 넣어 대상 음색을 복제하며, 텍스트 임베딩은 Gemma 3 12B를 사용한다.

  • GitHub, Hugging Face 모델 카드, Hugging Face Space를 함께 공개했다.
  • 추론 가중치는 dramabox-dit-v1.safetensors 6.6GB, 오디오 컴포넌트는 1.9GB다.
  • warm server 기준 생성 시간은 약 2.5초, 피크 VRAM은 약 24GB로 제시됐다.
  • 출력에는 기본적으로 Resemble Perth신경망 워터마크가 적용되며, --no-watermark로 끌 수 있다.
  • 베이스 모델은 Lightricks/LTX-2.3이고, 라이선스는 LTX-2 Community License다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.