LG AI Research: 3D 인간 포즈 및 형상 추정 연구
·2026.07.16 09:00
LG AI Research가 비디오 내 복잡한 시공간 관계를 효율적으로 처리하여 3D 인간의 포즈와 형상을 정밀하게 추정하는 프레임워크를 제안했다.
기존의 단일 프레임 기반 3D 인간 포즈 및 형상 추정은 모션 블러나 폐쇄(occlusion) 상황에서 성능이 불안정하다는 단점이 있다. 이를 해결하기 위해 기존 비디오 기반 방식들은 시공간적 관계를 모델링하는 과정에서 Global Average Pooling을 사용해 공간 정보를 압축해 왔으나, 이 과정에서 재구성 오류가 발생하는 문제가 있었다.
본 연구에서는 시공간적 차원을 모두 고려하면서도 복잡도를 효율적으로 관리하는 새로운 프레임워크를 제안한다. 주요 핵심 기술은 다음과 같다:
- Spatial Alignment Module (SAM): 인접한 프레임 간의 공간적 불일치를 해결하기 위해 아핀 변환(Affine Transformation)을 사용하여 인접 특징을 중앙 특징에 맞게 정렬한다.
- Space2Batch: 공간적 관계와 시간적 관계를 분해하여 시공간적 어텐션(Spatio-temporal attention)의 복잡도를 획기적으로 낮춘다.
- Uncertainty-guided Attention Re-weighting: 모션 블러나 복잡한 배경 등 어려운 환경에서도 모델의 강건성(Robustness)을 높인다.
이 모델은 SMPL 파라메트릭 모델을 사용하여 형상과 포즈 파라미터를 추정하며, 주요 벤치마크 데이터셋에서 SOTA(State-of-the-Art) 성능을 달성하여 WACV 2024에서 상세 결과를 발표했다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.