AI Briefing

Google, 멀티모달 지원하는 Gemma 3 공개

Welcome Gemma 3: Google's all new multimodal, multilingual, long context open LLM

·2025.03.12 09:00

Google이 멀티모달과 128k 컨텍스트를 지원하는 새로운 오픈 모델 Gemma 3를 출시했다.

Google이 새로운 오픈 웨이트 모델 시리즈인 Gemma 3를 공개했다. 모델은 1B, 4B, 12B, 27B 파라미터 크기로 제공되며, 사전 학습(Pre-trained) 및 지시 미세 조정(Instruction-tuned) 버전이 모두 포함된다.

주요 특징은 다음과 같다:

  • 멀티모달 기능: 4B, 12B, 27B 모델은 텍스트와 이미지를 모두 처리할 수 있는 멀티모달 기능을 갖췄다 (1B는 텍스트 전용).
  • 확장된 컨텍스트: 1B 모델은 32k, 그 외 모델은 최대 128k 토큰의 컨텍스트 창을 지원한다.
  • 강력한 다국어 지원: 4B 이상의 모델은 영어 외 140개 이상의 언어를 지원한다.

기술적으로는 RoPE(Rotary Positional Embeddings)의 베이스 주파수를 1M으로 상향하여 긴 컨텍스트를 효율적으로 처리하며, SigLIP 이미지 인코더를 통해 시각 정보를 처리한다. 특히 Gemma-3-27B-IT는 벤치마크에서 Gemini 1.5-Pro를 능가하는 성능을 기록했다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.