AI Briefing

통합 비전 모델 SenseNova-Vision 공개

SenseNova-Vision: a 7B open model that does segmentation, depth, detection, OCR, and 3D reconstruction with no task-specific heads

·2026.08.14 00:07

핵심 내용

별도의 헤드 없이 다양한 비전 작업을 수행하는 7B 규모의 오픈 모델 SenseNova-Vision이 공개되었습니다.

자세히 보기

SenseNova-Vision은 별도의 태스크 전용 헤드(task-specific heads) 없이 자연어 지시만으로 다양한 컴퓨터 비전 작업을 수행하는 7B 규모의 MoT(Mixture of Tasks) 모델입니다.

이 모델은 모든 비전 작업을 단일 생성 문제로 처리하는 것이 핵심입니다. 사용자가 자연어 명령이나 시각적 힌트를 제공하면, 모델은 텍스트와 이미지를 모두 출력할 수 있습니다.

주요 기능 및 특징:

  • 다양한 태스크 지원: 객체 탐지, 키포인트, OCR, 각종 세그멘테이션(Binary, Instance, Semantic), 깊이 및 표면 법선 추정 등을 수행합니다.
  • 3D 및 카메라 추정: 멀티뷰 3D 재구성과 카메라 포즈 추정 기능을 갖추고 있어, COLMAP과 같은 전문 도구 없이도 프롬프트만으로 구현이 가능합니다.
  • 학습 데이터: 다양한 CV 주석을 기반으로 구축된 5,000만 개의 지시어-응답 쌍을 통해 학습되었습니다.
  • 라이선스 및 접근성: Apache 2.0 라이선스로 공개되었으며, Hugging Face에서 가중치를 확인할 수 있습니다.

다만, 웹 데모를 원활하게 구동하기 위해서는 80GB 이상의 고성능 GPU가 필요하며, 모델의 성능을 온전히 테스트하기 위해서는 더 높은 사양의 하드웨어가 요구될 수 있습니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.