Qwen, FlashQLA 공개
Qwen Introduced FlashQLA
·2026.04.29 21:18
핵심 내용
Qwen이 TileLang 기반 FlashQLA로 linear attention을 최대 3배까지 가속했다.
자세히 보기
Qwen이 FlashQLA를 공개했다. TileLang 위에 구축한 고성능 linear attention kernel로, forward 2~3배, backward 2배 속도를 내세운다.
개인 기기에서 동작하는 agentic AI용으로 설계됐으며, 핵심 아이디어는 세 가지다.
- gate-driven automatic intra-card CP
- hardware-friendly algebraic reformulation
- TileLang fused warp-specialized kernels
자동 intra-device CP로 SM utilization을 끌어올렸고, 특히 TP 구성, 소형 모델, long-context workload에서 효과가 컸다.
또한 전체 GDN 흐름을 하나의 완전 fuse kernel로 묶지 않고, CP 효율과 backward 효율을 위해 두 개의 kernel로 분리했다. 대형 batch에서는 추가 메모리 I/O 비용이 생기지만, edge device와 long-context 환경에서는 더 나은 실사용 성능을 보인다고 설명했다.
가장 까다로운 구간은 backward pass였으며, 16-stage warp-specialized pipeline을 극한의 on-chip memory 제약 아래 구현해 kernel-level 2배+ 속도 향상을 달성했다고 밝혔다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.