AI Briefing

Scenema Audio, 8GB 지원

Scenema Audio Comes to ComfyUI, Runs on 8GB VRAM

·2026.08.06 03:27

핵심 내용

Scenema Audio가 8GB VRAM에서 구동되는 ComfyUI 네이티브 노드로 출시됐다.

자세히 보기

Scenema Audio가 ComfyUI용 네이티브 커스텀 노드로 출시됐다. 기존 API·Docker 스택 기반 모델을 양자화해 최소 8GB VRAM에서 실행할 수 있다.

텍스트로 말투와 감정을 지정하는 expressive TTS를 제공하며, 참조 음성을 사용한 zero-shot voice cloning도 지원한다.

  • [he laughs softly], [voice cracks] 같은 인라인 지시어를 해당 발화 위치에서 수행
  • 억양·연령·감정 표현이 다른 12개 프리셋 음성 제공
  • 생성 속도는 최대 2배 실시간
  • 첫 실행 시 약 30GB 모델 가중치 다운로드 필요
  • 텍스트 인코더로 gated Hugging Face 모델인 Gemma 3 12B 사용

ComfyUI Manager에서 노드를 검색해 설치하거나 GitHub에서 직접 설치할 수 있으며, 공식 워크플로가 ComfyUI의 Workflows 사이드바에 자동 추가된다. diffusion 기반 모델이라 일부 시드에서 반복이나 깨진 음성이 발생할 수 있어 여러 결과를 생성한 뒤 선별·편집하는 작업 흐름을 전제로 한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.