Scenema Audio, 8GB 지원
Scenema Audio Comes to ComfyUI, Runs on 8GB VRAM
·2026.08.06 03:27
핵심 내용
Scenema Audio가 8GB VRAM에서 구동되는 ComfyUI 네이티브 노드로 출시됐다.
자세히 보기
Scenema Audio가 ComfyUI용 네이티브 커스텀 노드로 출시됐다. 기존 API·Docker 스택 기반 모델을 양자화해 최소 8GB VRAM에서 실행할 수 있다.
텍스트로 말투와 감정을 지정하는 expressive TTS를 제공하며, 참조 음성을 사용한 zero-shot voice cloning도 지원한다.
[he laughs softly],[voice cracks]같은 인라인 지시어를 해당 발화 위치에서 수행- 억양·연령·감정 표현이 다른 12개 프리셋 음성 제공
- 생성 속도는 최대 2배 실시간
- 첫 실행 시 약 30GB 모델 가중치 다운로드 필요
- 텍스트 인코더로 gated Hugging Face 모델인 Gemma 3 12B 사용
ComfyUI Manager에서 노드를 검색해 설치하거나 GitHub에서 직접 설치할 수 있으며, 공식 워크플로가 ComfyUI의 Workflows 사이드바에 자동 추가된다. diffusion 기반 모델이라 일부 시드에서 반복이나 깨진 음성이 발생할 수 있어 여러 결과를 생성한 뒤 선별·편집하는 작업 흐름을 전제로 한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.