AI Briefing

네이버클라우드, 사전 학습 없이 이미지 생성 모델 학습 레시피 공개

·2026.09.29 09:00

핵심 내용

FLUX.2 VAE와 Muon 적용으로 학습 효율 높이고 한국어 지시 이해 강화

1 / 11

자세히 보기

네이버클라우드가 사전 학습 가중치 없이 대규모 이미지 생성 및 편집 모델을 처음부터 학습하는 과정을 공개했다. 제한된 자원 내에서 최적의 모델 구조, 데이터, 학습 목표를 설계하고 독립적으로 개선하기 위한 실험 방법론과 최종 레시피를 담고 있다.

핵심 기법 채택 및 성능 개선

실험은 작은 모델로 빠른 검증 후 대규모 학습에 적용하는 방식으로 진행되었으며, FLUX.2 VAE, Muon 최적화 알고리즘, Self-Flow 표현 정렬, Long Skip, VLM 다중 계층 텍스트 조건 등이 최종 구성으로 채택되었다.

  • VAE 교체: FLUX.1 VAE에서 FLUX.2 VAE로 교체 시 ImageNet 실험에서 FID가 10.95에서 10.19로 약 7% 개선되었고, FID 30 도달 시점이 87.5k 스텝에서 50k 스텝으로 단축되었다.
  • 최적화 알고리즘: AdamW 대신 Muon을 적용하면 행렬 가중치 갱신 방향이 조정되어 학습 효율이 크게 향상된다. 36시간 경과 시 FID가 AdamW의 10.19에서 Muon은 5.20으로 개선되었다.
  • 표현 정렬 및 구조: Self-Flow와 Long Skip을 적용해 후반 학습 구간에서 DINO-MMD 지표를 개선하고, VLM 다중 계층 활용으로 텍스트 렌더링 정확도를 높였다.

노이즈 이동 값 및 미채택 기법

학습과 생성 단계의 Noise Shift 값은 역할이 다르므로 각각 따로 최적화해야 한다. 생성 이동 값이 높을수록 FID가 낮아지는 경향을 보였다. 반면, JiT(x0-prediction), Register Token, 특정 정렬 방식 변형 등은 VAE 잠재 공간 조합에서 품질 개선 효과가 미미하거나 연산 비용 대비 이점이 부족해 채택하지 않았다.

서비스 적용 및 향후 방향

최종 레시피는 복잡한 서술형 프롬프트 준수와 한국어 및 영어 텍스트 렌더링, 이미지 편집 가능성을 확인했다. 네이버클라우드는 이를 업무 문서, 발표 자료, 광고 소재 제작 등 자사 서비스 연동에 적용할 계획이다. 특히 기업 및 공공기관 환경에서 요구되는 지시 정확 이해, 유지/변경 부분 구분, 반복 요청 시 품질 일관성을 확보하는 것이 핵심 목표다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.