AI Briefing
추천

바이트댄스, 영상 생성·편집 통합 프레임워크 'Bernini' 오픈소스 공개

Bernini: Wan 렌더러에 MLLM 플래너를 더해 영상 생성과 편집 6개 작업을 하나로 묶은 영상 생성 프레임워크

·2026.09.17 11:30

핵심 내용

바이트댄스가 MLLM 플래너와 DiT 렌더러를 결합해 6가지 영상 생성·편집 작업을 수행하는 오픈소스 프레임워크 Bernini를 공개했다.

1 / 4

자세히 보기

바이트댄스(ByteDance)가 영상 생성 및 편집을 위한 새로운 프레임워크 Bernini를 공개했다. 이 프레임워크는 MLLM 플래너와 DiT 렌더러의 역할을 분리하여 설계되었으며, 플래너는 픽셀 대신 ViT 임베딩 공간에서 목표 의미 표현을 예측하고 렌더러가 이를 조건으로 영상을 생성한다.

핵심 기술 및 구조

  • 역할 분리: 플래너(Qwen2.5-VL-7B-Instruct)가 복잡한 지시를 분해하고 의미 임베딩을 생성하면, 렌더러(Wan2.2-T2V-A14B)가 VAE Latent Space에서 Flow Matching을 통해 영상을 생성한다.
  • SA-3D RoPE: 시각 입력 혼동을 줄이기 위해 세그먼트별 위상을 추가하고, Hybrid Attention Mask로 입력 간 가시성을 제어한다.
  • 지원 작업: 텍스트-이미지(t2i), 이미지-이미지(i2i), 텍스트-영상(t2v), 영상-영상(v2v), 참조 기반 편집(rv2v, r2v) 등 6가지 작업을 지원한다.

성능 및 벤치마크

자체 구축한 Arena 플랫폼의 블라인드 투표 결과, Bernini는 Bradley-Terry 점수 1044점으로 2위를 기록했으며, 1위 HappyHorse-1.0(1080점)과 36점 차이를 보였다. 특히 복잡한 지시 따르기 능력에서 폐쇄형 상용 모델 최상위 그룹에 도달했다고 평가받았다. 다만, VBench 기준으로는 경량화된 Bernini-R 1.3B 모델(84.69점)이 7+14B 계열보다 높은 점수를 기록하기도 했다.

배포 및 사용 환경

  • 모델 변형: 전체 파이프라인인 Bernini와 렌더러 단독 미세조정 버전인 Bernini-R 두 가지로 제공된다. Bernini-R은 설치와 실행이 더 단순하고 안정적이다.
  • 하드웨어 요구사항: H100 다중 GPU 환경 및 시퀀스 병렬 처리가 필수적이며, 소비자용 단일 GPU에서는 이미지 작업(--num_frames 1)만 제한적으로 지원된다.
  • 라이선스: 코드와 모델 가중치 모두 Apache 2.0 라이선스로 공개되어 상업적 활용 및 재학습이 가능하다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.