AI Briefing

StarCoder2 및 The Stack v2 공개

StarCoder2 and The Stack v2

·2024.02.28 09:00

BigCode가 차세대 오픈 소스 코드 LLM인 StarCoder2와 대규모 코드 데이터셋 The Stack v2를 공개했다.

BigCode가 차세대 오픈 소스 코드 LLM 제품군인 StarCoder2와 대규모 코드 데이터셋인 The Stack v2를 공개했다.

StarCoder2는 3B, 7B, 15B의 세 가지 파라미터 규모로 제공된다. 특히 StarCoder2-15B는 600개 이상의 프로그래밍 언어와 4조 개 이상의 토큰을 학습하여, 동일 체급에서 최고 수준의 성능을 보이며 33B 이상의 모델과 대등한 성능을 기록했다.

모델별 학습 주체는 다음과 같다:

  • StarCoder2-3B: ServiceNow
  • StarCoder2-7B: Hugging Face
  • StarCoder2-15B: NVIDIA (NVIDIA NeMo 활용)

기술적으로는 Grouped Query Attention, 16,384 토큰의 컨텍스트 윈도우(4,096 토큰 슬라이딩 윈도우 적용), Fill-in-the-Middle 학습 방식을 채택했다.

데이터셋인 The Stack v2는 Software Heritage 아카이브를 기반으로 하며, 중복 제거 후 32.1TB에 달하는 방대한 규모를 자랑한다. 이전 버전(v1) 대비 개선된 언어 및 라이선스 감지, 필터링 알고리즘이 적용되었으며, 저장소 단위로 데이터를 그룹화하여 모델이 코드의 문맥을 더 효과적으로 학습할 수 있도록 설계되었다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.