나만의 코딩 어시스턴트 학습 가이드
Personal Copilot: Train Your Own Coding Assistant
·2023.10.27 09:00
핵심 내용
Hugging Face의 공개 저장소를 활용해 특정 코드베이스에 최적화된 개인용 코딩 어시스턴트를 구축하는 방법과 HugCoder를 소개한다.
1 / 2
자세히 보기
Hugging Face는 특정 기업이나 개인의 코드베이스에 최적화된 **개인용 코딩 어시스턴트(Personal Copilot)**를 구축하는 방법론과 이를 위해 학습된 HugCoder 모델을 공개했다.
데이터 수집 및 처리 과정
- 병렬 다운로드: GitHub API의 속도 제한 문제를 해결하기 위해
multiprocessing을 사용하여 모든 공개 저장소를 로컬로 병렬 클론했다. - 데이터 필터링: 이미지, 프레젠테이션 등 비코드 파일을 제외하고, Jupyter Notebook은 코드 셀만 추출했다.
.git,__pycache__등 불필요한 경로도 제거했다. - 효율적 저장: 메모리 사용량을 최적화하기 위해 feather 포맷을 사용하여 데이터를 직렬화했다.
데이터셋 구성
transformers,diffusers,peft등 Hugging Face의 상위 10개 공개 저장소를 기반으로 데이터셋을 구축했다.- 사용자는 이 워크플로우를 응용하여 자신의 독점적인 코드베이스를 학습시킨 맞춤형 코딩 모델을 만들 수 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.