AI Briefing

Victoria와 Maple 오픈 웨이트 Qwen 파인튜닝 모델 공개

Two open-weights releases: Victoria (Qwen3.8-Flash-Next with 44% of experts cut, 70% Terminal-Bench 2.1, GGUF included) and Maple (a Canada-first fine-tune)

·2026.09.30 14:18

핵심 내용

Qwen3.8-Flash-Next 기반 오픈 웨이트 파인튜닝 모델 Victoria와 Maple이 공개됐다.

자세히 보기

코딩 및 에이전트용 Victoria와 캐나다 규제 맥락용 Maple 등 Qwen3.8-Flash-Next의 오픈 웨이트 파인튜닝 모델 2종이 공개됐다.

Victoria: 코딩 및 에이전트

Victoria는 REAP 기법을 적용해 전문가(expert)의 **44%**를 제거(레이어당 512개에서 288개로 감소)하고 4-bit (NVFP4) 정밀도로 재학습했다. 주요 성능 지표는 다음과 같다:

  • Terminal-Bench 2.1: 70.0% (3회 평균), 이전 NVFP4 빌드의 62.5% 대비 향상.
  • HumanEval: 159/164.
  • 추론 속도: Dell B300에서 드래프트 헤드 사용 시 단일 스트림 기준 280 tok/s, 미사용 시 135 tok/s.
  • 크기: 드래프트 헤드를 포함한 가중치 48.0 GiB. 별도 95.4 GiB n-gram table은 이 수치에 포함되지 않는다. GGUF Q4_K_M 버전은 49.17 GiB이며, Terminal-Bench에서 75.3% (단일 실행), HumanEval에서 93.2% (5회 평균)를 기록했다.

Maple: 캐나다 맥락

Maple은 기본 모델이 미국 맥락으로 편향되는 경향을 해결하기 위해 세금, 혜택, 규제에 대해 캐나다 답변을 기본값으로 하도록 파인튜닝됐다. 검색 기능을 활성화한 600개의 검증 질문 기준:

  • 캐나다 공식 출처 인용: **6.0%**에서 **62.9%**로 증가.
  • 완전 정답: **6.6%**에서 **21.8%**로 증가.
  • 무응답: **47.2%**에서 **23.7%**로 감소.
  • 코딩 성능: HumanEval에서 157/164로 여전히 강함.

기술 노트

  • llama.cpp 호환성: GGUF에는 메인라인 llama.cpp가 아직 지원하지 않는 드래프트 헤드가 포함되어 오류가 발생한다. 현재는 rmonsurate/llama.cpp 포크의 qwen4exp-mtp 브랜치를 직접 빌드해야 한다.
  • 평가 방법: Maple의 채점은 AI 판정 패널이 수행했으며, 인간 검토는 아직 이루어지지 않았다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.