AI Briefing

SenseNova-Vision, 다중 비전 작업 통합 모델 공개

탐지·분할·깊이 추정을 하나의 모델로 출력하는 SenseNova-Vision 모델

·2026.09.17 09:51

핵심 내용

SenseNova-Vision이 작업별 헤드 없이 탐지, 분할, 깊이 추정을 하나의 생성 모델로 통합해 공개했다.

1 / 2

자세히 보기

SenseNova-Vision은 객체 탐지, 분할, 깊이 추정 등 다양한 컴퓨터 비전 작업을 별도의 출력 헤드(head) 없이 하나의 생성 모델로 처리하는 프레임워크를 공개했다. BAGEL-7B-MoT 기반의 이 모델은 텍스트와 이미지를 생성하는 기존 경로를 활용하여, 구조화된 텍스트 기록과 공간에 정렬된 시각 지도를 동시에 학습한다.

통합 접근 방식

기존 모델과 달리 작업별 전용 모듈을 추가하지 않고, 텍스트 정답은 다음 토큰 예측, 시각 정답은 VAE 잠재 공간에서의 rectified-flow 학습을 통해 통합한다. 이를 통해 객체 탐지, OCR, 깊이 맵, 분할 마스크 등 다양한 형태의 출력을 단일 모델로 생성할 수 있다.

성능 및 한계

벤치마크 결과, SenseNova-Vision은 ReasonSeg와 Interactive Box 항목에서 전문 모델인 X-SAM보다 우수한 성능을 보였으나, RefCOCO와 Interactive Point에서는 다소 뒤처졌다. 이는 모든 전문 모델을 대체하기보다는 여러 출력 형태를 통합한 접근으로 해석된다. 또한, 프롬프트 민감도와 기하 예측 정확도 한계가 명시되어 있어 실제 적용 시 출력 안정성 확인이 필요하다.

실행 환경 및 라이선스

모델 가중치는 Hugging Face에서 다운로드 가능하며, 추론에는 PyTorch 2.5.1+, CUDA 12.4 환경이 요구된다. BF16 기준 A800 80GB GPU 1장에서 검증되었으며, 전체 벤치마크에는 8x80GB GPU 이상을 권장한다. 코드는 Apache-2.0, 모델 가중치는 CC BY-NC 4.0 라이선스를 따른다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.