AI Briefing

Google, EmbeddingGemma 2 공개

Google, 텍스트 전용이던 EmbeddingGemma를 이미지, 영상, 음성까지 넓힌 EmbeddingGemma 2 공개

·2026.10.07 15:00

핵심 내용

텍스트·이미지·영상·음성을 768차원 공간에 통합하며 코드 검색 성능을 대폭 개선했다.

1 / 5

자세히 보기

Google DeepMind가 텍스트, 코드, 이미지, 영상, 음성을 하나의 768차원 벡터 공간에 통합하는 EmbeddingGemma 2를 공개했다. 기존 텍스트 전용 모델(270M)에 비전 인코더(170M)와 오디오 인코더(300M)를 모듈식으로 결합한 구조로, 필요에 따라 특정 모달리티만 로드하여 리소스를 절약할 수 있다.

성능 및 아키텍처

전작 대비 컨텍스트 윈도우가 2K에서 8K 토큰으로 확장되었으며, 코드 검색 벤치마크(MTEB Code)에서 9.92점 상승(68.76 → 78.68)을 기록했다. 다국어 텍스트 성능은 전작과 유사한 수준을 유지했다. 차원을 128로 줄여도 텍스트와 코드 검색 성능은 90% 이상 유지되지만, 멀티모달 검색 성능은 급락하므로 텍스트 위주 사용이 권장된다.

배포 및 온디바이스 최적화

Apache 2.0 라이선스로 상업적 이용이 가능하며, Hugging Face Transformers, PyTorch, TensorFlow, JAX 등을 지원한다. LiteRT와 MediaPipe를 통해 온디바이스 실행을 최적화했으며, 양자화 기준 텍스트 전용 모델은 191MB, 전체 멀티모달 모델은 567MB의 메모리를 사용한다. Pixel 11 Pro TPU 기준 텍스트 임베딩 지연 시간은 8.3ms로 빠르다.

주의 사항

float16 정밀도는 활성값 범위 초과로 품질 저하를 유발할 수 있어 bfloat16 또는 float32 사용이 권장된다. 사전 학습 데이터 기준일은 2025년 1월이며, Gemma 금지 사용 정책(Prohibited Use Policy)을 준수해야 한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.