LG AI Research: 3D Human Pose and Shape Estimation 연구
·2026.07.16 09:00
공간-시간적 관계를 효율적으로 모델링하여 복잡한 환경에서도 강건한 3D 인체 포즈 및 형상 추정 기술을 개발했다.
비디오 기반 3D Human Pose and Shape Estimation은 이미지와 영상으로부터 사람의 메쉬(Mesh)를 재구성하는 기술로, 컴퓨터 그래픽스와 헬스케어 등 다양한 산업에서 활용도가 높습니다.
기존 비디오 기반 방식은 공간 정보를 압축(Global Average Pooling)하여 시간적 관계를 모델링했으나, 이 과정에서 공간 정보가 손실되어 재구성 오차가 증가하는 한계가 있었습니다. 이를 해결하기 위해 본 연구에서는 Spatio-temporal Attention의 복잡성을 낮추면서도 성능을 높인 새로운 프레임워크를 제안합니다.
핵심 기술은 다음과 같습니다:
- Spatial Alignment Module (SAM): 인접한 프레임의 피처를 중심 피처에 공간적으로 정렬(Warping)하여, 카메라 움직임이나 빠른 움직임에도 정보 손실을 방지합니다.
- Space2Batch: 공간 차원을 배치(Batch)로 처리하여 시간적 상관관계를 분해함으로써, Attention의 복잡도를 $O(dw^2h^2T^2)$에서 $O(dwhT^2)$로 획기적으로 줄였습니다.
- Uncertainty-guided Attention Re-weighting: 모션 블러나 가려짐(Occlusion)이 발생하는 프레임의 오류가 전체 시퀀스로 전파되는 것을 막아 모델의 강건성을 높였습니다.
이러한 기법을 통해 주요 벤치마크 데이터셋에서 SOTA(State-of-the-Art) 성능을 달성하였으며, 해당 성과는 WACV 2024에서 발표되었습니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.