AI Briefing

DramaBox, 음성 모델 공개

DramaBox - Most Expressive Voice model ever based on LTX 2.3

·2026.05.14 02:06

핵심 내용

Resemble AI가 LTX 2.3 기반 음성합성 모델 DramaBox를 공개했다.

자세히 보기

Resemble AI가 DramaBox를 공개했다.

이 모델은 LTX-2.3 3.3B audio-only 위에 얹은 IC-LoRA 튜닝으로, 프롬프트만으로 화자 정체성·감정·말투·웃음·한숨·멈춤·전환을 제어하는 프롬프트 기반 TTS다. 선택적으로 10초+ 음성 레퍼런스를 넣어 대상 음색을 복제하며, 텍스트 임베딩은 Gemma 3 12B를 사용한다.

  • GitHub, Hugging Face 모델 카드, Hugging Face Space를 함께 공개했다.
  • 추론 가중치는 dramabox-dit-v1.safetensors 6.6GB, 오디오 컴포넌트는 1.9GB다.
  • warm server 기준 생성 시간은 약 2.5초, 피크 VRAM은 약 24GB로 제시됐다.
  • 출력에는 기본적으로 Resemble Perth의 신경망 워터마크가 적용되며, --no-watermark로 끌 수 있다.
  • 베이스 모델은 Lightricks/LTX-2.3이고, 라이선스는 LTX-2 Community License다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.