FLUX 3: 실세계 모델을 향한 멀티모달 플로우 모델
·2026.07.24 09:00
핵심 내용
이미지, 비디오, 오디오를 통합 학습하여 세계의 물리적 법칙을 이해하는 멀티모달 모델 FLUX 3를 공개했다.
1 / 2
자세히 보기
새롭게 공개된 FLUX 3는 이미지, 비디오, 오디오를 단일 아키텍처 내에서 통합 학습하는 멀티모달 파운데이션 모델이다. 단순히 개별 모달리티를 학습하는 것을 넘어, 사물의 움직임, 소리의 인과관계, 물리적 법칙 등 '세계의 표현(representation of the world)'을 학습하는 것을 목표로 한다.
FLUX 3는 Self-Flow 기술을 기반으로 구축되었으며, 이를 통해 멀티모달 생성(Generation)과 이해(Understanding)를 효율적으로 정렬(Alignment)한다. 기존의 Flow Matching (FM) 방식과 비교했을 때, 더 높은 생성 효율과 조작 작업(Manipulation tasks) 성공률을 보여준다.
주요 특징은 다음과 같다:
- 통합 아키텍처: 이미지의 공간 구조, 비디오의 시간적 역학, 오디오의 인과 관계를 하나의 모델에서 처리한다.
- 물리적 지능: 소리와 움직임, 과거와 미래의 관계를 결합하여 실제 물리 환경을 예측하고 이해하는 능력을 갖춘다.
- 확장성: 대규모 컴퓨팅과 데이터 자원을 투입하여 비디오, 이미지, 오디오를 동시에 학습시켰다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.