Victoria와 Maple 오픈 웨이트 Qwen 파인튜닝 모델 공개
Two open-weights releases: Victoria (Qwen3.8-Flash-Next with 44% of experts cut, 70% Terminal-Bench 2.1, GGUF included) and Maple (a Canada-first fine-tune)
·2026.09.30 14:18
핵심 내용
Qwen3.8-Flash-Next 기반 오픈 웨이트 파인튜닝 모델 Victoria와 Maple이 공개됐다.
자세히 보기
코딩 및 에이전트용 Victoria와 캐나다 규제 맥락용 Maple 등 Qwen3.8-Flash-Next의 오픈 웨이트 파인튜닝 모델 2종이 공개됐다.
Victoria: 코딩 및 에이전트
Victoria는 REAP 기법을 적용해 전문가(expert)의 **44%**를 제거(레이어당 512개에서 288개로 감소)하고 4-bit (NVFP4) 정밀도로 재학습했다. 주요 성능 지표는 다음과 같다:
- Terminal-Bench 2.1: 70.0% (3회 평균), 이전 NVFP4 빌드의 62.5% 대비 향상.
- HumanEval: 159/164.
- 추론 속도: Dell B300에서 드래프트 헤드 사용 시 단일 스트림 기준 280 tok/s, 미사용 시 135 tok/s.
- 크기: 드래프트 헤드를 포함한 가중치 48.0 GiB. 별도 95.4 GiB n-gram table은 이 수치에 포함되지 않는다. GGUF Q4_K_M 버전은 49.17 GiB이며, Terminal-Bench에서 75.3% (단일 실행), HumanEval에서 93.2% (5회 평균)를 기록했다.
Maple: 캐나다 맥락
Maple은 기본 모델이 미국 맥락으로 편향되는 경향을 해결하기 위해 세금, 혜택, 규제에 대해 캐나다 답변을 기본값으로 하도록 파인튜닝됐다. 검색 기능을 활성화한 600개의 검증 질문 기준:
- 캐나다 공식 출처 인용: **6.0%**에서 **62.9%**로 증가.
- 완전 정답: **6.6%**에서 **21.8%**로 증가.
- 무응답: **47.2%**에서 **23.7%**로 감소.
- 코딩 성능: HumanEval에서 157/164로 여전히 강함.
기술 노트
- llama.cpp 호환성: GGUF에는 메인라인 llama.cpp가 아직 지원하지 않는 드래프트 헤드가 포함되어 오류가 발생한다. 현재는 rmonsurate/llama.cpp 포크의 qwen4exp-mtp 브랜치를 직접 빌드해야 한다.
- 평가 방법: Maple의 채점은 AI 판정 패널이 수행했으며, 인간 검토는 아직 이루어지지 않았다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.