AI Briefing

StarCoder2 및 The Stack v2 공개

StarCoder2 and The Stack v2

·2024.02.28 09:00

핵심 내용

BigCode가 차세대 오픈 소스 코드 LLM인 StarCoder2와 대규모 코드 데이터셋 The Stack v2를 공개했다.

1 / 2

자세히 보기

BigCode가 차세대 오픈 소스 코드 LLM 제품군인 StarCoder2와 대규모 코드 데이터셋인 The Stack v2를 공개했다.

StarCoder2는 3B, 7B, 15B의 세 가지 파라미터 규모로 제공된다. 특히 StarCoder2-15B는 600개 이상의 프로그래밍 언어와 4조 개 이상의 토큰을 학습하여, 동일 체급에서 최고 수준의 성능을 보이며 33B 이상의 모델과 대등한 성능을 기록했다.

모델별 학습 주체는 다음과 같다:

  • StarCoder2-3B: ServiceNow
  • StarCoder2-7B: Hugging Face
  • StarCoder2-15B: NVIDIA (NVIDIA NeMo 활용)

기술적으로는 Grouped Query Attention, 16,384 토큰의 컨텍스트 윈도우(4,096 토큰 슬라이딩 윈도우 적용), Fill-in-the-Middle 학습 방식을 채택했다.

데이터셋인 The Stack v2는 Software Heritage 아카이브를 기반으로 하며, 중복 제거 후 32.1TB에 달하는 방대한 규모를 자랑한다. 이전 버전(v1) 대비 개선된 언어 및 라이선스 감지, 필터링 알고리즘이 적용되었으며, 저장소 단위로 데이터를 그룹화하여 모델이 코드의 문맥을 더 효과적으로 학습할 수 있도록 설계되었다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.