FLUX 3: 실세계 모델을 향한 멀티모달 플로우 모델
·2026.07.24 09:00
이미지, 비디오, 오디오를 통합 학습하여 세계의 물리적 법칙을 이해하는 멀티모달 모델 FLUX 3를 공개했다.
새롭게 공개된 FLUX 3는 이미지, 비디오, 오디오를 단일 아키텍처 내에서 통합 학습하는 멀티모달 파운데이션 모델이다. 단순히 개별 모달리티를 학습하는 것을 넘어, 사물의 움직임, 소리의 인과관계, 물리적 법칙 등 '세계의 표현(representation of the world)'을 학습하는 것을 목표로 한다.
FLUX 3는 Self-Flow 기술을 기반으로 구축되었으며, 이를 통해 멀티모달 생성(Generation)과 이해(Understanding)를 효율적으로 정렬(Alignment)한다. 기존의 Flow Matching (FM) 방식과 비교했을 때, 더 높은 생성 효율과 조작 작업(Manipulation tasks) 성공률을 보여준다.
주요 특징은 다음과 같다:
- 통합 아키텍처: 이미지의 공간 구조, 비디오의 시간적 역학, 오디오의 인과 관계를 하나의 모델에서 처리한다.
- 물리적 지능: 소리와 움직임, 과거와 미래의 관계를 결합하여 실제 물리 환경을 예측하고 이해하는 능력을 갖춘다.
- 확장성: 대규모 컴퓨팅과 데이터 자원을 투입하여 비디오, 이미지, 오디오를 동시에 학습시켰다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.