AI Briefing

LTX-2.5: 컷 넘어도 캐릭터 유지하는 멀티샷 영상 생성

Lightricks/LTX-2.5

·2026.08.20 09:00

LTX-2.5는 텍스트, 이미지, 영상 입력을 받아 동기화된 영상과 오디오를 생성하는 오픈 월드 모델이다. 로컬 인프라에서 직접 실행하며, 생성 건당 과금이나 API 의존성 없이 완전한 제어와 커스터마이징이 가능하다. 연간 매출 1000만 달러 미만 기업은 커뮤니티 라이선스 하에 상업적 및 프로덕션 사용이 무료다.

이전 버전과 달리 단일 패스에서 여러 샷을 연결하는 네이티브 멀티샷 생성을 지원한다. 컷이 넘어가도 캐릭터 정체성, 환경, 조명, 목소리, 시각적 스타일을 유지한다. 또한 장면 복잡도에 따라 컴퓨트 할당을 동적으로 조절하는 디퓨전 피델리티 렌더링을 적용해 중요한 부분에는 상세한 디테일을, 나머지에는 효율적인 처리를 적용한다.

새로운 디퓨전 비디오 디코더는 VAE 재구성 단계를 대체하여 얼굴, 텍스처, 화면 내 텍스트의 선명도를 높이고 모션 아티팩트를 줄인다. 복잡한 프롬프트를 처리하도록 설계된 커스텀 Gemma 4 12B 텍스트 인코더와, 짧은 프롬프트를 풍부한 시네마틱 지시문으로 확장하는 프롬프트 엔핸서가 포함된다. 옵션으로 제공되는 듀레이션 프리딕터는 프롬프트 기반 클립 길이를 예측해 프레임 수를 자동 설정한다.

모델은 단일 파일이 아닌 컴포넌트별 .safetensors 파일로 구성된 스플릿 팩 형태로 배포된다. 디스틸드 DiT, 풀 DiT, 텍스트 인코더, 비디오/오디오 VAE, LoRA, 업스케일러 등 각 구성 요소를 개별 로드할 수 있다. Python 기반 ltx-pipelines, ComfyUI, Diffusers 세 가지 방식으로 사용 가능하며, 디스틸드 모델은 더 작은 체크포인트로 더 빠른 추론 속도를 제공한다.

HuggingFace
HuggingFace 모델

Lightricks/LTX-2.5

원문에 등록된 설명이 없습니다.

image-to-video

이 한국어 소개글은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 소개 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.