AI Briefing

ik_llama.cpp, Qwen3.8 MTP 지원 병합

Qwen3.8-Flash-Next MTP merged in ik_llama.cpp (integrated head or separate -md file)... 45 → 90 tok/s on a 5090 + 128GB, works down to a 12GB 4070

·2026.09.04 01:30

핵심 내용

ik_llama.cpp가 Qwen3.8-Flash-Next의 MTP 기능을 공식 병합하여 RTX 5090 환경에서 추론 속도가 약 2배 빨라졌다.

자세히 보기

ik_llama.cpp 메인 브랜치에 Qwen3.8-Flash-Next 모델의 MTP(Multi-Token Prediction) 지원이 공식 병합되었다. 이는 기존에 비공식 포크로만 존재하던 기능을 정식으로 도입한 것으로, 별도의 패치나 포크 없이 사용 가능하다.

성능 개선 효과

MTP 헤드(2.6B 파라미터)를 로드하면 모델이 숨겨진 상태(hidden state)에서 다음 토큰을 초안(draft)으로 생성한 후 검증하는 방식으로 동작한다. 이를 통해 출력 결과는 원본 모델과 동일하게 유지되면서 추론 속도가 크게 향상된다.

  • RTX 5090 + 128GB DDR5: 코딩 작업 기준 초당 토큰 생성 속도가 45에서 90으로 약 2배 증가했다.
  • RTX Pro 6000: 코딩 및 추출 작업에서 속도가 85에서 113, 82에서 109로 향상되었다.
  • RTX 4070 (12GB): 코딩 작업에서 9.5에서 12.5로 개선되었으나, 스토리 생성 작업에서는 이득이 미미하거나 부정적일 수 있다.

주의 사항 및 한계

  • 작업 유형별 차이: 코딩 작업에서는 초안 수용률(draft acceptance)이 93-99%로 높지만, 산문(prose) 생성에서는 60-65% 수준으로 낮아 속도 개선 효과가 제한적이다.
  • 설정 옵션: 현재는 단일 슬롯(-np 1)에서만 지원되며, --jinja 템플릿 사용 시 사고 모드(reasoning)가 활성화되어 산문처럼 취급되므로 수용률이 떨어질 수 있다.
  • 하드웨어 호환성: 일부 저사양 카드나 특정 미세 조정 모델 조합에서는 오히려 성능이 저하될 수 있어 하드웨어 및 모델 조합에 따른 테스트가 필요하다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.