AI Briefing

작고 센 Gemma4

Welcome Gemma 4: Frontier multimodal intelligence on device

·2026.04.02 09:00

핵심 내용

Gemma 4가 멀티모달·오디오·온디바이스 지원과 128K/256K 컨텍스트로 공개됐다.

1 / 2

자세히 보기

Google DeepMind의 Gemma 4가 Hugging Face에 공개됐다.

  • 4개 크기로 제공된다: E2B(2.3B effective), E4B(4.5B effective), 31B dense, 26B A4B MoE(4B active / 26B total).
  • 모두 base와 instruction-tuned(IT) 체크포인트가 있고, 컨텍스트 길이는 128K 또는 256K다.
  • 이미지, 텍스트, 오디오 입력을 지원하며, E2B/E4B는 오디오까지 처리한다.
  • 이미지 인코더는 가변 종횡비와 토큰 예산 조절을 지원해 속도·메모리·품질 사이에서 선택지를 넓혔다.
  • 아키텍처는 local sliding-window + global attention, dual RoPE, PLE(Per-Layer Embeddings), shared KV cache를 핵심으로 한다.
  • 비전은 다양한 토큰 예산(70~1120)으로 인코딩할 수 있고, 오디오는 USM-style conformer 기반이다.
  • 비공개 사전 체크포인트 기준으로 31B dense는 LMArena 1452, 26B MoE는 1441의 추정 텍스트 점수를 기록했다고 밝힌다.

배포 범위도 넓다. transformers, llama.cpp, MLX, WebGPU, Rust, transformers.js, Mistral.rs 등으로 바로 연동할 수 있고, 로컬 에이전트·온디바이스 추론·양자화 활용을 염두에 둔 설계다.

멀티모달 데모에서는 OCR, 음성 인식, 객체 탐지, 포인팅, GUI 탐지, 함수 호출, 코드 생성/수정, 비디오 이해까지 예시를 보여준다. 이미지에서 bounding box를 JSON 형태로 바로 출력하는 식의 사용 사례도 제시한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.