추천
Qwen 팀, 헤드 단위 하이브리드 Attention 'HydraHead' 공개
HydraHead: From Head-Level Functional Heterogeneity to Specialized Attention Hybridization (from the Qwen team)
·2026.06.30 21:56
핵심 내용
Qwen 팀이 어텐션 헤드 단위로 FA와 LA를 결합해 긴 문맥 처리 성능을 높인 HydraHead 아키텍처를 발표했다.
자세히 보기
기존의 레이어 단위 하이브리드 어텐션 방식과 달리, HydraHead는 어텐션 헤드(Head) 수준에서 **Full Attention(FA)**과 **Linear Attention(LA)**을 혼합하는 새로운 아키텍처를 제안한다.
주요 혁신 사항은 다음과 같다:
- 해석 가능성 기반 헤드 선택: 정보 검색에 중요한 역할을 하는 헤드를 식별하여 해당 헤드에만 FA를 유지하는 전략을 사용한다.
- 스케일 정규화 융합 모듈: FA와 LA 헤드 출력 간의 분포 차이를 조정하여 두 신호를 효과적으로 결합한다.
- 효율적인 학습 파이프라인: 파라미터 재사용 및 증류(Distillation)를 포함한 3단계 전이 파이프라인을 통해 최소한의 학습 오버헤드로 고성능 모델을 구현한다.
실험 결과, HydraHead는 15B 토큰만 학습하고도 512K 문맥 길이에서 베이스라인 대비 69% 이상의 성능 향상을 달성했으며, 이는 유사한 규모의 Qwen3.5 모델 성능에 근접하는 수치이다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.