Qwopus3.8-27B-Flash-GGUF: 27B 멀티모달 모델, 추론 속도 12.8% 높이고 비용은 낮추다
Jackrong/Qwopus3.8-27B-Flash-GGUF
프로젝트 소개
Qwen3.8-27B 기반의 파인튜닝 모델로, 에이전트 작업 시 반복되는 추론 루프의 지연 시간을 줄이는 데 초점을 맞췄다. 텍스트와 이미지를 함께 처리하는 멀티모달 기능을 유지하면서, 토큰 생성 속도를 기존 대비 12.8% 향상시켜 장시간 실행되는 에이전트 워크플로우의 효율성을 높인다.

MTP(Multi-Token Prediction) 초안 수용률이 80.7%로 높아 추론 과정에서의 불필요한 계산을 최소화한다. RTX 5090 환경에서 소프트웨어 엔지니어링 벤치마크 14개 중 13개를 26분 만에 완료하며, 복잡한 코딩 및 도구 호출 작업을 빠르게 처리한다. 다만 MMLU-Pro 정확도는 베이스 모델 대비 1.45%포인트 낮아져, 정밀도보다 속도 우선의 트레이드오프를 택했다.
llama.cpp, vLLM 등 주요 추론 엔진과 호환되는 GGUF 포맷으로 제공되어 로컬 GPU 환경에서 가볍게 구동할 수 있다. Apache 2.0 라이선스를 적용해 상업적 활용이 가능하며, 제한된 리소스로도 안정적으로 에이전트를 운영해야 하는 개발자에게 적합하다. 현재 일부 Python 코드 생성 시 들여쓰기 오류가 발견되어 재학습이 예정되어 있어, 최신 버전 확인이 필요하다.
Jackrong/Qwopus3.8-27B-Flash-GGUF
원문에 등록된 설명이 없습니다.
image-text-to-text
이 한국어 소개글은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.