AI Briefing

추천Qwen 팀, 헤드 단위 하이브리드 Attention 'HydraHead' 공개

HydraHead: From Head-Level Functional Heterogeneity to Specialized Attention Hybridization (from the Qwen team)

·2026.06.30 21:56

Qwen 팀이 어텐션 헤드 단위로 FA와 LA를 결합해 긴 문맥 처리 성능을 높인 HydraHead 아키텍처를 발표했다.

기존의 레이어 단위 하이브리드 어텐션 방식과 달리, HydraHead는 어텐션 헤드(Head) 수준에서 **Full Attention(FA)**과 **Linear Attention(LA)**을 혼합하는 새로운 아키텍처를 제안한다.

주요 혁신 사항은 다음과 같다:

  • 해석 가능성 기반 헤드 선택: 정보 검색에 중요한 역할을 하는 헤드를 식별하여 해당 헤드에만 FA를 유지하는 전략을 사용한다.
  • 스케일 정규화 융합 모듈: FA와 LA 헤드 출력 간의 분포 차이를 조정하여 두 신호를 효과적으로 결합한다.
  • 효율적인 학습 파이프라인: 파라미터 재사용 및 증류(Distillation)를 포함한 3단계 전이 파이프라인을 통해 최소한의 학습 오버헤드로 고성능 모델을 구현한다.

실험 결과, HydraHead는 15B 토큰만 학습하고도 512K 문맥 길이에서 베이스라인 대비 69% 이상의 성능 향상을 달성했으며, 이는 유사한 규모의 Qwen3.5 모델 성능에 근접하는 수치이다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.