AI Briefing

Diff-Transformer V2 공개

Differential Transformer V2

·2026.01.20 12:20

KV 헤드 수를 유지하며 쿼리 헤드를 확장해 추론 효율을 높인 Differential Transformer V2가 공개되었습니다.

Differential Transformer V2는 기존 V1의 구조적 한계를 개선하여 추론 효율성과 연산 성능을 동시에 높인 새로운 아키텍처입니다.

주요 개선 사항:

  • 디코딩 속도 최적화: 쿼리 헤드(Query heads)의 수는 두 배로 늘리되, KV 헤드(Key-Value heads)의 수는 유지합니다. 이는 LLM 디코딩의 병목인 메모리 대역폭 부하를 늘리지 않으면서 연산 강도(Arithmetic intensity)를 높이는 설계입니다.
  • 커스텀 커널 불필요: 헤드 차원을 정렬하여 설계했기 때문에, 별도의 커스텀 어텐션 커널 없이 표준 FlashAttention을 그대로 사용할 수 있어 구현이 용이합니다.
  • Softmax Magnitude Constraint 해결: V1에서 발생했던 컨텍스트 RMS(Root Mean Square)의 불균형 문제를 수학적 설계를 통해 해결하여, 모델이 더 안정적인 어텐션 분포를 학습할 수 있도록 했습니다.

성능 및 활용:

  • 프리트레이닝 단계에서의 처리량(Throughput) 감소는 미미한 수준입니다.
  • 긴 시퀀스 프리필링(Prefilling) 시 YOCO와 같은 기술과 결합하면 선형 시간 복잡도로 효율을 극대화할 수 있습니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.