AI Briefing

Qwen, FlashQLA 공개

Qwen Introduced FlashQLA

·2026.04.29 21:18

Qwen이 TileLang 기반 FlashQLA로 linear attention을 최대 3배까지 가속했다.

Qwen이 FlashQLA를 공개했다. TileLang 위에 구축한 고성능 linear attention kernel로, forward 2~3배, backward 2배 속도를 내세운다.

개인 기기에서 동작하는 agentic AI용으로 설계됐으며, 핵심 아이디어는 세 가지다.

  • gate-driven automatic intra-card CP
  • hardware-friendly algebraic reformulation
  • TileLang fused warp-specialized kernels

자동 intra-device CP로 SM utilization을 끌어올렸고, 특히 TP 구성, 소형 모델, long-context workload에서 효과가 컸다.

또한 전체 GDN 흐름을 하나의 완전 fuse kernel로 묶지 않고, CP 효율backward 효율을 위해 두 개의 kernel로 분리했다. 대형 batch에서는 추가 메모리 I/O 비용이 생기지만, edge device와 long-context 환경에서는 더 나은 실사용 성능을 보인다고 설명했다.

가장 까다로운 구간은 backward pass였으며, 16-stage warp-specialized pipeline을 극한의 on-chip memory 제약 아래 구현해 kernel-level 2배+ 속도 향상을 달성했다고 밝혔다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.