AI Briefing

CodeQwen1.5와 함께하는 코딩

·2024.04.16 14:33

핵심 내용

Qwen이 3조 개의 코드 토큰으로 학습된 오픈소스 코드 특화 LLM, CodeQwen1.5-7B를 공개했다.

1 / 2

자세히 보기

기존 GitHub Copilot과 같은 독점 LLM 기반 코딩 어시스턴트는 비용, 개인정보 보호, 보안 및 저작권 침해 가능성이라는 과제를 안고 있다. 이에 대한 투명하고 접근 가능한 대안으로 Qwen은 오픈소스 코드 LLM인 CodeQwen1.5-7B를 선보였다.

CodeQwen1.5-7B는 Qwen1.5 언어 모델을 기반으로 하며, 약 3조 개의 코드 관련 토큰을 사전 학습했다. 총 92개의 프로그래밍 언어를 지원하며, 최대 64K 토큰의 긴 컨텍스트를 처리할 수 있는 능력을 갖췄다.

성능 면에서 CodeQwen1.5는 기본적인 코드 생성, 긴 컨텍스트 모델링, 코드 편집 및 SQL 분야에서 뛰어난 역량을 보여준다. 특히 HumanEval 및 MBPP 벤치마크에서 7B 파라미터 규모임에도 불구하고 더 큰 모델들을 능가하는 성과를 거두었으며, LiveCodeBench에서도 최상위권 오픈소스 모델로 이름을 올렸다.

또한 Python뿐만 아니라 MultiPL-E에서 다루는 Python, C++, Java, PHP, TypeScript, C#, Bash, JavaScript 등 8가지 주요 언어에 대해 탁월한 프로그래밍 능력을 입증했다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.