Google, 차세대 오픈 LLM Gemma 2 공개
Welcome Gemma 2 - Google’s new open LLM
·2024.06.27 09:00
핵심 내용
Google이 성능과 효율성을 대폭 개선한 차세대 오픈 LLM Gemma 2를 공개했다.
자세히 보기
Google이 차세대 오픈 LLM인 Gemma 2를 출시했다. 이번 모델은 9B와 27B 파라미터 규모로 제공되며, 각각 사전 학습된 Base 모델과 지시 이행에 최적화된 Instruction-tuned 모델로 구성된다.
Gemma 2는 이전 세대 대비 약 2배 많은 데이터를 학습했다. 27B 모델은 13조(13T) 토큰, 9B 모델은 8조(8T) 토큰의 웹 데이터, 코드, 수학 데이터를 활용했다.
주요 기술적 혁신 사항은 다음과 같다:
- Sliding window attention: 슬라이딩 윈도우와 풀-쿼드라틱 어텐션을 교차 적용하여 생성 품질 향상.
- Logit soft-capping: 로짓(logits)이 과도하게 커지는 것을 방지하여 학습 안정성 확보.
- Knowledge Distillation: 대형 모델의 지식을 작은 모델(9B)로 전수하여 성능 극대화.
- Model Merging: 여러 모델을 결합하여 성능을 개선하는 기법 적용.
Gemma 2는 허깅페이스(Hugging Face) 생태계와 긴밀히 통합되어, Transformers 라이브러리를 통한 사용은 물론 TRL을 이용한 미세 조정 및 Google Cloud와의 연동을 지원한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.