2.4B 오픈 비전 모델 공개
CohereLabs/North-Micro-Vision-Instruct · Hugging Face
·2026.08.13 01:50
핵심 내용
CohereLabs가 Apache 2.0 기반 2.4B 비전·언어 모델을 공개했다.
자세히 보기
CohereLabs가 2.4B 파라미터 규모의 오픈 웨이트 비전·언어 모델 North Micro Vision Instruct를 공개했다.
모델은 이미지의 종횡비와 세부 정보를 보존하는 native-resolution 처리를 지원하며, 다음 작업을 대상으로 한다.
- 시각 질의응답(VQA)과 이미지 캡션
- 시각적 grounding 및 공간 이해
- OCR, 차트·문서 이해와 구조화 정보 추출
- 다국어·다중 이미지 이해
전체 구성은 2B 파라미터 언어 모델과 400M 파라미터 비전 인코더로 이뤄졌다. 텍스트와 이미지가 섞인 입력을 처리하며, 영어·한국어·중국어·일본어 등 여러 언어를 지원한다.
언어 모델의 컨텍스트 윈도우는 128K 토큰이지만, 멀티모달 입력에서 검증된 범위는 최대 8K 토큰이다. 가중치는 Apache 2.0 라이선스로 제공돼 프로토타이핑과 태스크 특화 파인튜닝, 경량 멀티모달 애플리케이션 개발에 활용할 수 있다.
다만 대형 범용 챗봇의 대체재가 아닌 커스터마이징용 기반 모델이며, 별도의 reasoning 모델이 아니어서 수학과 코드 생성 능력에는 한계가 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.