NeoMME, 단일 인코더 공개
NeoMME: an efficient Multimodal-native and Multilingual Encoder
·2026.09.03 22:13
핵심 내용
비전 타워 없이 텍스트와 이미지를 단일 Transformer로 처리하는 다국어 멀티모달 인코더 NeoMME가 공개됐다.
1 / 8
자세히 보기
아키텍처 및 특징
NeoMME는 사전 학습된 비전 타워나 인과적 언어 모델(LM)을 사용하지 않고, 텍스트 토큰과 원본 이미지 패치를 단일 양방향 Transformer로 처리하는 260M 및 800M 파라미터 규모의 멀티모달 인코더다. 전체 모델을 마스크된 이산 디퓨전(masked discrete-diffusion) 목적 함수로 처음부터 학습했다.
- 네이티브 멀티모달 입력: 텍스트는 분해된 토큰 임베딩을, 이미지는 32x32 패치로 나누어 작은 MLP로 투영하여 동일한 Transformer 인코더로 입력한다.
- 동적 이미지 해상도: 이미지의 종횡비와 크기를 유지하여 정보 밀도에 따라 토큰 수를 조절한다.
- 긴 컨텍스트: 16,384 토큰의 컨텍스트 길이를 지원하며, 슬라이딩 윈도우 어텐션과 글로벌 어텐션을 교대로 사용하는 현대적 인코더 스택을 적용했다.
성능 및 효율성
ColPali의 페이지 이미지 방식을 활용해 시각 문서 검색용으로 파인튜닝한 NeoMME-Retriever는 단일 순방향 패스에서 밀집 및 후기 상호작용(late-interaction) 임베딩을 반환한다.
- 처리 속도: NVIDIA L40S GPU에서 2048x2048 이미지 입력 기준, 260M 모델은 초당 약 51페이지를 인코딩하여 ColModernVBERT 대비 약 2배의 처리량을 보인다.
- 저장 공간 최적화: 계층적 토큰 풀링과 비대칭 양자화를 통해 후기 상호작용 인덱스 저장 공간을 페이지당 약 1.5MB에서 6kB로 255배 줄였으며, nDCG@10 기준 성능의 95% 이상을 유지했다.
- 벤치마크: ViDoRe v3에서 nDCG@10과 모델 크기 기준으로 파레토 프론티어에 위치한다.
배포
모델 체크포인트는 Apache 2.0 라이선스로 공개되었으며, Hugging Face Transformers에서 사용 가능하다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.