Vision Banana 범용 비전 모델
·2026.04.27 09:00
핵심 내용
Vision Banana가 이미지 생성 사전학습만으로 SOTA 비전 성능을 입증했다.
자세히 보기
Vision Banana는 이미지 생성 모델 **Nano Banana Pro(NBP)**를 원래 학습 데이터와 소량의 비전 태스크 데이터로 instruction-tuning해 만든 범용 비전 모델이다. 비전 과제의 출력 공간을 RGB 이미지로 파라미터화해, 인식 문제를 생성 문제로 다시 정의했다.
이 방식으로 모델은 2D와 3D 이해 전반에서 강한 성능을 냈다. 특히
- 세분화에서는 Segment Anything Model 3를 능가하거나 비견했고,
- metric depth estimation에서는 Depth Anything 계열을 능가하거나 비견했다.
핵심은 가벼운 instruction-tuning만으로도 원래의 이미지 생성 능력을 유지한 채 이해 능력을 붙였다는 점이다. 저자들은 이미지 생성 사전학습이 LLM의 pretraining처럼 범용 시각 표현을 만들고, 이미지 생성이 시각 과제를 묶는 통합 인터페이스가 될 수 있다고 본다. 그 결과 생성형 비전 사전학습이 향후 foundational vision model의 중심축이 될 수 있음을 보여준다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.