Diff-Transformer V2 공개
Differential Transformer V2
·2026.01.20 12:20
핵심 내용
KV 헤드 수를 유지하며 쿼리 헤드를 확장해 추론 효율을 높인 Differential Transformer V2가 공개되었습니다.
자세히 보기
Differential Transformer V2는 기존 V1의 구조적 한계를 개선하여 추론 효율성과 연산 성능을 동시에 높인 새로운 아키텍처입니다.
주요 개선 사항:
- 디코딩 속도 최적화: 쿼리 헤드(Query heads)의 수는 두 배로 늘리되, KV 헤드(Key-Value heads)의 수는 유지합니다. 이는 LLM 디코딩의 병목인 메모리 대역폭 부하를 늘리지 않으면서 연산 강도(Arithmetic intensity)를 높이는 설계입니다.
- 커스텀 커널 불필요: 헤드 차원을 정렬하여 설계했기 때문에, 별도의 커스텀 어텐션 커널 없이 표준 FlashAttention을 그대로 사용할 수 있어 구현이 용이합니다.
- Softmax Magnitude Constraint 해결: V1에서 발생했던 컨텍스트 RMS(Root Mean Square)의 불균형 문제를 수학적 설계를 통해 해결하여, 모델이 더 안정적인 어텐션 분포를 학습할 수 있도록 했습니다.
성능 및 활용:
- 프리트레이닝 단계에서의 처리량(Throughput) 감소는 미미한 수준입니다.
- 긴 시퀀스 프리필링(Prefilling) 시 YOCO와 같은 기술과 결합하면 선형 시간 복잡도로 효율을 극대화할 수 있습니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.