구글, 온디바이스용 오픈 멀티모달 임베딩 모델 EmbeddingGemma 2 공개
핵심 내용
구글이 740M 파라미터의 오픈 멀티모달 온디바이스 임베딩 모델 EmbeddingGemma 2를 공개했다.
자세히 보기
구글이 온디바이스 추론을 위한 오픈 멀티모달 임베딩 모델 EmbeddingGemma 2를 공개했다. Gemma 4 아키텍처 기반의 Apache 2.0 라이선스 모델로, 텍스트, 이미지, 오디오, 비디오를 통합 임베딩 공간으로 매핑한다. 740M 파라미터 규모로, 음성 메모로 특정 영상 클립을 찾거나 텍스트로 오디오를 검색하는 등 프라이버시 중심의 온디바이스 작업에 최적화됐다.
모델은 모듈형으로 설계되어 텍스트 전용 작업에는 270M 파라미터만 필요하며, 비전(170M)과 오디오(300M) 인코더를 선택적으로 추가해 멀티모달을 지원한다. 10억 파라미터 미만 멀티모달 임베더 중 최고 성능을 기록했으며, MTEB Code에서 9.92점 향상된 78.68점을 달성했다. **Matryoshka Representation Learning (MRL)**을 적용해 벡터 차원을 768에서 512, 256, 128로 줄여 최대 6배의 저장 공간을 절감할 수 있다. Google Pixel 11 Pro 기준 양자화된 가중치는 텍스트 전용 시 약 191MB, 전체 모델 사용 시 567MB의 RAM을 차지한다.
EmbeddingGemma 2는 전작 대비 4배 커진 8K 토큰 컨텍스트 윈도우를 지원하며, 온디바이스에서 최대 5.5분의 오디오, 29장의 이미지, 58프레임의 비디오를 처리한다. Gemma 4와 텍스트 토크나이저 및 오디오 인코더를 공유해 온디바이스 RAG 파이프라인 구축이 용이하다. 모델은 Hugging Face와 Kaggle에서 제공되며, MediaPipe, LiteRT, WebGPU, Ollama, LMStudio 등 주요 도구와 호환된다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.