AI Briefing

Qwen3.8 27B, R9700용 3비트 가중치로 캐시 용량 확대 및 에이전트 속도 향상

·2026.10.04 22:12

핵심 내용

Qwen3.8 27B의 3비트 가중치로 R9700에서 캐시 용량을 늘려 에이전트 속도를 높였다.

자세히 보기

Qwen3.8 27B의 AMD Radeon AI PRO R9700(32 GB VRAM)용 신규 릴리스가 혼합 정밀도 3비트 가중치를 도입했다. 이 구성은 요청당 262,144개 토큰의 컨텍스트와 569,878개 토큰의 재사용 가능한 프리픽스 캐시를 지원하며, 멀티 에이전트 시나리오에서 첫 토큰까지의 시간을 최대 12배 단축하고 전체 세션 완료 속도를 비캐시 모드 대비 6.1배 높인다.

양자화 세부 사항

전체 모델이 3비트로 양자화된 것은 아니다. MLP, 어텐션, Gated DeltaNet 순환 투영 등 27B 파라미터 중 24.3B에 해당하는 대형 투영 행렬만 3비트로 양자화된다.

  • 방법: 이상치를 분산시키기 위해 행렬을 회전시킨 후 약 293K 토큰으로 GPTQ 보정을 수행했다.
  • 활성값: 토큰 생성 시 FP8 활성값을 사용하며, 프롬프트 읽기 시 회전된 행렬에서 4비트 활성값(W3A4)을 사용한다.
  • 기타 구성 요소: 임베딩, 출력 헤드, 정규화 계층은 MXFP4 정밀도를 유지한다.
  • 저장 용량: 3비트 가중치는 기존 MXFP4 다운로드에 추가되는 9.55 GB 분량이다.

성능 및 정확도

이전 MXFP4 릴리스와 비교할 때, 3비트 모드는 지식 회상과 속도/캐시 용량 간 트레이드오프를 제공한다.

  • 속도: 디코딩 속도는 이전 릴리스와 통계적 오차 범위 내다(단일 스트림 약 156 tok/s, 8개 요청 집계 약 428 tok/s).
  • 캐시: KV 캐시 용량이 569,878개 토큰으로 증가했다(MXFP4의 174,634개 대비).
  • 정확도:
    • GSM8K: 95.45 (MXFP4는 95.68)
    • HumanEval: 92.68 (MXFP4는 95.12)
    • MMLU-Pro: 59.93 (MXFP4는 62.57)
    • MMLU-Pro의 2.9포인트 하락은 통계적 오차를 벗어난 유일한 지표로, 낮은 정밀도가 지식 회상 작업에 미치는 영향을 반영한다.

에이전트 워크플로우 영향

신규 **--mode long-kv4**는 프리픽스 캐시를 활용해 멀티턴 에이전트 세션의 지연 시간을 대폭 줄인다.

  • 20턴 대화: 전체 세션 시간이 1,237초에서 204초로 감소(6.1배 빨라짐).
  • 첫 토큰 평균 대기 시간: 63.6초에서 7.8초로 감소(8배 빨라짐).
  • 멀티 에이전트 저장소 공유: 100K 토큰 저장소를 공유하는 3개 에이전트의 전체 세션 시간이 5.9배 단축된다.
  • 캐시된 검색: 이전에 읽은 258K 토큰 문서에 대한 새로운 질문 응답 시간이 134초에서 2.7초로 단축된다.

가용성 및 요구 사항

  • 구현: 플러그인(paiton-vllm-plugin)을 사용한 표준 vLLM에서 실행된다.
  • 시스템 RAM: 임베딩 테이블을 고정하기 위해 16 GB의 시스템 RAM이 필요하다. RAM이 13.5 GiB 미만이면 테이블이 GPU에 남아 캐시가 451,879개 토큰으로 줄어든다.
  • 512K 모드: 옵트인 방식의 --mode long-512k는 요청당 컨텍스트를 524,288개 토큰으로 확장하지만, 전체 시스템 RAM이 필요하며 콜드 리드가 느리다(500K 토큰에 약 6분 소요).
  • 제한 사항: 코딩 모드와 512K 모드에서는 아직 비전 지원이 불가능하다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.