SenseNova, 통합 이미지 모델 U1.5-8B 출시
SenseNova-U1.5-8B-MoT is initialized from Qwen3 LLM weights and trades wins with Qwen-Image 20B
·2026.09.27 01:46
핵심 내용
SenseNova가 Qwen3 기반의 통합 이미지 모델 U1.5-8B를 공개해 특정 벤치마크에서 경쟁력을 입증했다.
자세히 보기
SenseNova가 텍스트-이미지 생성, 편집, 이미지 이해를 통합한 SenseNova-U1.5-8B-MoT를 공개했습니다. 이 모델은 Qwen3 LLM 가중치에서 초기화되었으며, 별도의 비전 인코더나 VAE 없이 픽셀 공간에서 이미지를 토큰으로 처리합니다.
아키텍처 및 성능
단일 백본을 사용하며 어텐션은 공유하되, 태스크별로 투영, 정규화, 피드포워드 레이어를 분리했습니다. 프롬프트 강화 없이 Qwen-Image 20B와 비교한 벤치마크 결과는 다음과 같습니다:
- 우위: Qwen-Image-Bench(영어 및 중국어)와 IGenBench(인포그래픽)에서 Qwen-Image 20B를 능가했습니다.
- 열세: DPG-Bench, OneIG-ZH, 다양성 지표에서는 Qwen-Image 20B보다 낮은 점수를 기록했습니다.
- 이해 능력: Thinking 모드에서 Qwen3-VL-8B를 19개 벤치마크 중 14개에서 앞섰습니다.
배포 및 한계
모델은 Apache-2.0 라이선스로 배포되며 ComfyUI v0.35.0에서 네이티브로 지원합니다. 공식 GGUF는 아직 없지만, 커뮤니티에서 Q8 GGUF 버전(21.2 GB)이 제공됩니다. 작은 얼굴, 손, 사지 처리 시 불안정성과 밀집된 텍스트 또는 한영 혼합 텍스트에서 오류가 발생하는 것이 알려진 한계입니다. 기술 보고서에는 VRAM 또는 속도 지표가 포함되어 있지 않습니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.