신경 비디오 압축을 위한 강화학습 기반 비트레이트 제어
핵심 내용
강화학습으로 NVC의 비트레이트 제어를 순차 의사결정 문제로 재정의해 성능과 효율을 동시에 끌어올렸다.
자세히 보기
기존 **neural video compression(NVC)**의 rate control은 주로 R-λ나 R-D-λ 같은 모델로 비트레이트와 왜곡의 관계를 근사했다. 하지만 이런 방식은 윈도우 단위의 temporal stationarity를 가정하고, 국소 최적화에 의존해 전역적인 맥락을 충분히 반영하지 못한다.
저자들은 NVC의 rate control을 sequential decision-making 문제로 다시 정의한다. 이렇게 하면 윈도우 길이에 따른 복잡도 증가를 피하고, 프레임 간 전역 정보를 활용하며, 별도의 2단계 절차 없이 코드 파라미터를 직접 결정할 수 있다.
이를 위해 Actor-Critic RL framework를 설계했다. 현재 프레임 x_t와 이전 프레임의 복원 결과를 함께 입력해 spatial-temporal embedding을 만들고, 타깃 비트레이트와 이전 코드 파라미터도 함께 임베딩해 상태를 구성한다. 추론 단계에서는 Actor만 사용해 greedy하게 action을 선택하므로, 기존의 비트레이트 할당 후 파라미터 산출이라는 2단계 방식보다 단순하고 빠르다.
해상도 차이가 생기는 경우에는 reference frame을 현재 프레임 해상도에 맞게 resample하고, 복원 프레임은 bicubic upsampling으로 원래 해상도에 되돌린다. 이 joint λ-m action policy는 낮은 해상도를 활용해 계산량을 줄이면서도 rate control 정확도를 유지하도록 설계됐다.
실험은 DVC, DCVC, DCVC-DC 세 가지 대표 NVC 모델에서 진행했다. 비교 대상은 **Chen et al. (2023)**의 hyperbolic model과 **Zhang et al. (2023)**의 neural network 기반 방법이며, 원 논문의 실험 데이터와 일부 자체 구현 결과를 함께 사용했다.
결과는 전반적으로 우수했다. 평균 -15.96% BD-Rate 개선, 1.30% rate error, 19.7% encoding time savings를 기록했고, 특히 복잡한 inter-frame reference mechanism을 쓰는 DCVC-DC에서도 평균 -13.98% BD-Rate gain과 1.13% rate error를 달성했다.
복잡도 측면에서도 이점이 분명하다.
- 네트워크 파라미터와 KMACs per pixel을 줄여 연산 비용을 낮춤
- 인코딩 시간은 19.7%, 디코딩 시간은 26.5% 감소
- 전역 참조를 유지하면서도 선형 복잡도로 동작해 실시간 NVC 적용 가능성을 높임
결론적으로, NVC rate control을 강화학습 기반 순차 의사결정으로 바꾸면 기존 모델 기반 접근의 한계를 넘으면서 성능과 속도를 동시에 개선할 수 있다. 앞으로는 코딩 모델과 rate control 모듈을 함께 최적화해 더 유연하고 강한 R-D 성능을 노릴 수 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.