AI Briefing

Qwen4Exp, N-gram 아키텍처 분석

N-gram vs Experts explained

·2026.08.27 11:00

핵심 내용

Qwen4Exp는 N-gram을 활용해 25%의 가중치를 SSD로 오프로딩하여 추론 속도를 유지한다.

자세히 보기

Qwen4Exp 아키텍처는 파라미터 오프로딩 방식을 Mixture of Experts(MoE) 대신 N-gram 테이블에 의존한다. MoE는 라우터가 숨겨진 상태를 검사하여 필요한 피드포워드 블록을 선택하는 산술 작업에 집중하는 반면, N-gram은 토큰 해시로 주소를 생성하여 짧은 구문의 벡터를 저장하는 기억 작업을 수행한다.

N-gram 테이블은 토큰이 존재하는 즉시 주소를 가지며, 전체 테이블을 곱셈하지 않고 수 KB 수준의 행만 수집하여 스트림에 접어 넣는다. 이를 통해 176B 모델이 RAM 125B와 SSD 51B로 구성되며, 토큰당 약 6B만 활성화되어 125B-A6B 모델과 유사한 속도로 176B의 학습된 파라미터를 활용할 수 있다.

기술적 한계 및 최적화

  • 오프로딩 한계: 총 파라미터의 20~25% 정도를 N-gram 테이블에 할당하는 것이 최적이며, 이를 초과하면 이점이 사라진다.
  • 저장소: RAM 대신 SSD에 N-gram 테이블을 저장하는 것이 가장 큰 이점을 제공한다.
  • 역할 분담: MoE는 추론(reasoning), N-gram은 회상(recalling)을 담당하며, 회상만으로는 품질이 저하되므로 두 방식의 결합이 필수적이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.