CodeQwen1.5와 함께하는 코딩
Qwen이 3조 개의 코드 토큰으로 학습된 오픈소스 코드 특화 LLM, CodeQwen1.5-7B를 공개했다.
기존 GitHub Copilot과 같은 독점 LLM 기반 코딩 어시스턴트는 비용, 개인정보 보호, 보안 및 저작권 침해 가능성이라는 과제를 안고 있다. 이에 대한 투명하고 접근 가능한 대안으로 Qwen은 오픈소스 코드 LLM인 CodeQwen1.5-7B를 선보였다.
CodeQwen1.5-7B는 Qwen1.5 언어 모델을 기반으로 하며, 약 3조 개의 코드 관련 토큰을 사전 학습했다. 총 92개의 프로그래밍 언어를 지원하며, 최대 64K 토큰의 긴 컨텍스트를 처리할 수 있는 능력을 갖췄다.
성능 면에서 CodeQwen1.5는 기본적인 코드 생성, 긴 컨텍스트 모델링, 코드 편집 및 SQL 분야에서 뛰어난 역량을 보여준다. 특히 HumanEval 및 MBPP 벤치마크에서 7B 파라미터 규모임에도 불구하고 더 큰 모델들을 능가하는 성과를 거두었으며, LiveCodeBench에서도 최상위권 오픈소스 모델로 이름을 올렸다.
또한 Python뿐만 아니라 MultiPL-E에서 다루는 Python, C++, Java, PHP, TypeScript, C#, Bash, JavaScript 등 8가지 주요 언어에 대해 탁월한 프로그래밍 능력을 입증했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.