RayRoPE: Multi-View Attention을 위한 투영 레이(Ray) 위치 인코딩
·2026.07.20 09:00
다중 뷰 트랜스포머를 위해 SE(3) 불변성과 기하학적 적응성을 갖춘 RayRoPE 위치 인코딩 방식을 제안한다.
다중 뷰 트랜스포머(Multi-view Transformers)는 포즈(pose)가 지정된 일련의 입력 이미지로부터 토큰을 처리한다. 기존의 절대적(absolute) 또는 상대적(relative) 위치 인코딩 방식은 패치를 고유하게 인코딩하면서도 SE(3)-invariant attention을 구현하고, 장면의 기하학적 구조에 적응하는 데 한계가 있다.
이를 해결하기 위해 제안된 RayRoPE는 패치 위치를 관련 **Ray(광선)**를 기반으로 표현한다. 특히 단순히 방향만을 사용하는 대신, 광선을 따라 예측된 **Point(점)**를 활용하여 기존 방식의 공백을 메운다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.