Qwen3.5-4B, 모델 그래프팅으로 프롬프트 처리 속도 최대 3.7배 향상
Model grafting: turning Qwen3.5-4B into a causal encoder-decoder after the fact
·2026.09.22 10:43
핵심 내용
기존 모델을 인과적 인코더-디코더 구조로 변환하는 모델 그래프팅 기법을 적용해 Qwen3.5-4B의 프롬프트 처리 속도를 최대 3.7배 높였다.
자세히 보기
DeepSeek-V4.1-Flash가 처음부터 학습한 인과적 인코더-디코더 구조를 기존 모델에 사후 적용하는 모델 그래프팅(Model Grafting) 기법이 공개되었다. 이 방법은 특정 깊이에서 모델을 절단하여 하위 레이어가 프롬프트를 읽고, 상위 레이어가 인코더의 잔차 스트림을 접두사 KV로 사용하도록 identity-init 어댑터를 통해 연결한 후, 수정되지 않은 부모 모델로부터 자기 증류(self-distillation) 방식으로 복구하는 과정을 거친다. 디코딩 부분은 원래 구조를 유지한다.
이 기법을 Qwen3.5-4B에 적용한 두 가지 변형 모델이 Hugging Face에 공개되었다.
- graft8 변형: 128K 프롬프트 길이에서 약 3.7배의 속도 향상을 달성했으나, 일부 정확도 손실이 발생했다.
- graft16 변형: 부모 모델과 유사한 성능을 유지하면서 프롬프트 처리 속도를 2.0배 향상시켰으며, 정확도 손실은 최소한으로 억제되었다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.