Mage (GitHub 저장소)
·2026.07.22 09:00
Microsoft가 4B 파라미터 규모의 경량 멀티모달 모델 패밀리 Mage를 공개했다.
Mage는 Microsoft가 공개한 4B 파라미터 고정 예산 기반의 경량 멀티모달 모델 패밀리로, 이미지·영상 이해와 이미지 생성·편집을 각각 담당하는 두 모델로 구성된다.
Mage-VL은 이미지·영상 이해 및 프로액티브 스트리밍을 위한 코덱 네이티브 비전-언어 모델로, 처음부터 4B 규모로 학습되었다. 코드와 체크포인트는 공개 예정이다.
Mage-Flow는 텍스트-이미지 생성 및 명령어 기반 이미지 편집을 위한 생성 모델로, Mage-VAE(경량 고충실도 잠재 토크나이저)와 Native-Resolution Multimodal Diffusion Transformer로 구성된다. Base, RL-aligned, 4-step Turbo 세 가지 변형을 제공한다.
주요 특징:
- 효율적인 토크나이저: Mage-VAE는 FLUX.2-VAE 대비 인코딩/디코딩 연산량을 각각 ~12×/~22× 절감
- 네이티브 해상도: 단일 체크포인트로 512~2048, 4:1 극단 종횡비까지 지원
- 학습 속도: 스텝당 학습 시간 ~1.93s → ~0.78s (~2.5× 향상)
- 추론 속도: A100 단일 GPU 기준 1024² 이미지 생성 0.59초, 편집 1.02초
- 경쟁 모델(Qwen-Image 20B, FLUX.2 32B 등)보다 훨씬 작은 규모에서 동등하거나 우월한 성능
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.