긴 오디오 인코딩을 위한 분절형 어텐션 디코딩
·2026.07.06 09:00
AED 모델이 긴 오디오를 처리할 때 발생하는 위치 정보 상실 문제를 해결하기 위한 네 가지 개선 방안을 제안한다.
기존의 Attention-based Encoder-Decoder (AED) 모델은 짧은 단위로 분절된 음성 데이터를 학습할 때, 세그먼트 경계 너머의 문맥을 이용해 절대적 프레임 위치를 암시적으로 학습한다. 그러나 실제 긴 오디오(Long-form)를 디코딩할 때는 이러한 문맥 정보가 사라져, Cross-attention 과정에서 키(Key)와 값(Value)의 Permutation Invariance(치환 불변성) 특성 때문에 음성 인코딩의 순서를 놓치는 문제가 발생한다.
이 문제를 해결하기 위해 본 연구에서는 네 가지 핵심적인 수정 사항을 제안한다:
- **명시적 절대 위치 인코딩(Explicit Absolute Positional Encodings)**을 각 디코딩 세그먼트의 Cross-attention에 주입
- 암시적 위치 인코딩을 제거하기 위해 확장된 오디오 문맥을 사용하는 Long-form Training 수행
- 다양한 분절 방식에 대응하기 위한 Segment Concatenation 적용
- AED 디코딩 세그먼트와 학습 세그먼트를 일치시키기 위한 Semantic Segmentation 도입
이러한 개선을 통해 연속적인 오디오 인코딩과 분절된 오디오 인코딩 사이의 정확도 격차를 줄였으며, 어텐션 디코더를 이용한 자기회귀(Auto-regressive) 방식의 사용을 가능하게 했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.