AI Briefing

Qwen, FlashQLA 공개

Qwen Introduced FlashQLA

·2026.04.29 21:18

핵심 내용

Qwen이 TileLang 기반 FlashQLA로 linear attention을 최대 3배까지 가속했다.

자세히 보기

Qwen이 FlashQLA를 공개했다. TileLang 위에 구축한 고성능 linear attention kernel로, forward 2~3배, backward 2배 속도를 내세운다.

개인 기기에서 동작하는 agentic AI용으로 설계됐으며, 핵심 아이디어는 세 가지다.

  • gate-driven automatic intra-card CP
  • hardware-friendly algebraic reformulation
  • TileLang fused warp-specialized kernels

자동 intra-device CP로 SM utilization을 끌어올렸고, 특히 TP 구성, 소형 모델, long-context workload에서 효과가 컸다.

또한 전체 GDN 흐름을 하나의 완전 fuse kernel로 묶지 않고, CP 효율과 backward 효율을 위해 두 개의 kernel로 분리했다. 대형 batch에서는 추가 메모리 I/O 비용이 생기지만, edge device와 long-context 환경에서는 더 나은 실사용 성능을 보인다고 설명했다.

가장 까다로운 구간은 backward pass였으며, 16-stage warp-specialized pipeline을 극한의 on-chip memory 제약 아래 구현해 kernel-level 2배+ 속도 향상을 달성했다고 밝혔다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.