Google, 차세대 오픈 LLM Gemma 2 공개
Welcome Gemma 2 - Google’s new open LLM
·2024.06.27 09:00
Google이 성능과 효율성을 대폭 개선한 차세대 오픈 LLM Gemma 2를 공개했다.
Google이 차세대 오픈 LLM인 Gemma 2를 출시했다. 이번 모델은 9B와 27B 파라미터 규모로 제공되며, 각각 사전 학습된 Base 모델과 지시 이행에 최적화된 Instruction-tuned 모델로 구성된다.
Gemma 2는 이전 세대 대비 약 2배 많은 데이터를 학습했다. 27B 모델은 13조(13T) 토큰, 9B 모델은 8조(8T) 토큰의 웹 데이터, 코드, 수학 데이터를 활용했다.
주요 기술적 혁신 사항은 다음과 같다:
- Sliding window attention: 슬라이딩 윈도우와 풀-쿼드라틱 어텐션을 교차 적용하여 생성 품질 향상.
- Logit soft-capping: 로짓(logits)이 과도하게 커지는 것을 방지하여 학습 안정성 확보.
- Knowledge Distillation: 대형 모델의 지식을 작은 모델(9B)로 전수하여 성능 극대화.
- Model Merging: 여러 모델을 결합하여 성능을 개선하는 기법 적용.
Gemma 2는 허깅페이스(Hugging Face) 생태계와 긴밀히 통합되어, Transformers 라이브러리를 통한 사용은 물론 TRL을 이용한 미세 조정 및 Google Cloud와의 연동을 지원한다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.