Ornith-1.5-35B-A3B-GGUF: 35B MoE, 활성 파라미터 3B의 초경량 추론
ornith-ai/Ornith-1.5-35B-A3B-GGUF
프로젝트 소개
Ornith-1.5-35B-A3B는 총 350억개의 파라미터를 가진 MoE(Mixture of Experts) 아키텍처를 채택했다. 입력마다 전체 모델이 아닌 일부 전문가만 활성화되어, 실제 추론 시 사용되는 활성 파라미터는 30억개 수준으로 유지된다. 이는 대형 모델의 성능을 유지하면서 추론 비용을 크게 낮추는 설계다.
GGUF 포맷으로 제공되어 llama.cpp, Ollama, LM Studio 등 로컬 추론 환경에서 바로 실행할 수 있다. Q4_K_M부터 Q8_0까지 다양한 양자화 옵션이 준비되어 있어, 사용자의 하드웨어 사양에 따라 메모리 사용량을 조절할 수 있다. BF16 원본 파일도 함께 제공된다.
채팅 템플릿에 도구 호출(tool calling)과 추론(reasoning) 기능이 내장되어 있다. 시스템 프롬프트에서 함수 호출 형식을 정의하고, 어시스턴트 응답에 사고 과정을 포함하도록 처리한다. vLLM, SGLang 등 서버형 추론 엔진에서도 OpenAI 호환 API로 바로 연동 가능하다.
MIT 라이선스로 공개되어 상용 프로젝트에도 자유롭게 활용할 수 있다. GPU 메모리가 제한된 환경에서 대화형 AI나 에이전트 기반 작업을 구동해야 할 때, 높은 효율성을 요구하는 로컬 LLM 배포 시나리오에 적합하다.
ornith-ai/Ornith-1.5-35B-A3B-GGUF
원문에 등록된 설명이 없습니다.
text-generation
이 한국어 소개글은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

