AI Briefing

Tuna-2 (GitHub 저장소)

·2026.05.05 09:00

핵심 내용

Tuna-2는 비전 인코더를 제거한 픽셀 임베딩 방식으로 Tuna-R와 원본 Tuna를 앞섰다.

1 / 2

자세히 보기

Tuna-2는 멀티모달 이해와 생성을 목표로 한 Tuna 계열에서 시각 인코딩 단계를 하나씩 덜어내며 구조를 단순화했다.

  • VAE를 제거해 Tuna-R를 만들었고, 여기서는 representation encoder만으로 픽셀 공간에서 통합 멀티모달 처리를 수행한다.
  • Tuna-2는 representation encoder까지 우회해 원시 이미지에 직접 patch embedding을 적용한다.
  • 그 결과 Tuna-2는 다양한 멀티모달 벤치마크에서 Tuna-R와 원본 Tuna를 모두 앞섰다.

추론은 scripts/launch/predict.sh 하나로 처리하며 t2i와 edit 태스크를 지원한다. 변형은 none_encoder(Tuna-2), siglip_pixel(Tuna-R), vae(Tuna)로 나뉘고, 크기는 7B와 2B를 제공한다. 다만 2B는 vae 변형에서만 사용할 수 있다.

해상도는 512급과 1024급 조합을 지원하며, 512x512, 448x576, 576x448, 384x672, 672x384와 그에 대응하는 1024x1024, 896x1152, 1152x896, 768x1344, 1344x768 구성을 제공한다.

비디오 생성 모델은 조직 정책상 공개되지 않았지만, 학습과 추론 코드는 함께 제공된다. 전체 production-trained weights 대신 LLM 백본과 diffusion head(flow head)의 일부 레이어만 제거하고 비전 인코더, projection, embedding 등 나머지 구성은 그대로 유지한 foundation checkpoint를 먼저 배포하며, 자체 데이터로 짧게 fine-tuning하면 빠르게 복원할 수 있게 설계했다. 완전 복원된 가중치도 추후 공개할 계획이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.