7/8 통과한 Gemma
Gemma 4 31B passed 7/8 real-world production tests — including ones I designed to make it fail. Full prompts + outputs.
·2026.04.15 07:19
핵심 내용
Gemma 4 31B가 실전용 테스트 8개 중 7개를 통과했다.
자세히 보기
Gemma 4를 실제 업무용 프롬프트 8개에 돌려 본 결과, 31B Dense와 26B A4B MoE가 꽤 강한 실전 성능을 보였다.
특히 31B Dense는 작성자가 일부러 실패하도록 설계한 테스트까지 포함해 8개 중 7개를 통과했고, 그래서 처음으로 간단~중간 난도의 생산성 작업에 넣어볼 만한 무료 로컬 LLM에 가까워졌다고 평가했다.
테스트는 벤치마크가 아니라 실제 업무에서 쓸 만한 프롬프트로 구성됐고, 아래 내용이 함께 공개됐다.
- 8개 프롬프트 원문
- 긴 테스트의 모델 전체 출력
- 무료 AI Studio 키로 돌릴 수 있는 단일 HTML 데모 앱 소스
검증도 추가로 붙였다.
- 결과는 Gemini 3.1 Pro와 Claude Opus 4.6가 각각 독립적으로 확인
- 다만 작성자는 이번 테스트를 로컬이 아니라 GCP 호스팅 Gemma 4의 Genai API로 실행했다고 명시
- 지인에게는 31B 로컬 실행 결과도 비슷했다는 코멘트가 있음
핵심은, 공개된 프롬프트와 출력까지 포함한 재현 가능한 실전 평가라는 점이다. 모델 성능 자체뿐 아니라, 지금 시점에 open-weight 모델을 실제 업무에 넣을 수 있는지를 가늠하게 해주는 사례다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.