AI Briefing

Google, 멀티모달 지원하는 Gemma 3 공개

Welcome Gemma 3: Google's all new multimodal, multilingual, long context open LLM

·2025.03.12 09:00

핵심 내용

Google이 멀티모달과 128k 컨텍스트를 지원하는 새로운 오픈 모델 Gemma 3를 출시했다.

자세히 보기

Google이 새로운 오픈 웨이트 모델 시리즈인 Gemma 3를 공개했다. 모델은 1B, 4B, 12B, 27B 파라미터 크기로 제공되며, 사전 학습(Pre-trained) 및 지시 미세 조정(Instruction-tuned) 버전이 모두 포함된다.

주요 특징은 다음과 같다:

  • 멀티모달 기능: 4B, 12B, 27B 모델은 텍스트와 이미지를 모두 처리할 수 있는 멀티모달 기능을 갖췄다 (1B는 텍스트 전용).
  • 확장된 컨텍스트: 1B 모델은 32k, 그 외 모델은 최대 128k 토큰의 컨텍스트 창을 지원한다.
  • 강력한 다국어 지원: 4B 이상의 모델은 영어 외 140개 이상의 언어를 지원한다.

기술적으로는 RoPE(Rotary Positional Embeddings)의 베이스 주파수를 1M으로 상향하여 긴 컨텍스트를 효율적으로 처리하며, SigLIP 이미지 인코더를 통해 시각 정보를 처리한다. 특히 Gemma-3-27B-IT는 벤치마크에서 Gemini 1.5-Pro를 능가하는 성능을 기록했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.