RayRoPE: Multi-View Attention을 위한 투영 레이(Ray) 위치 인코딩
·2026.07.20 09:00
핵심 내용
다중 뷰 트랜스포머를 위해 SE(3) 불변성과 기하학적 적응성을 갖춘 RayRoPE 위치 인코딩 방식을 제안한다.
자세히 보기
다중 뷰 트랜스포머(Multi-view Transformers)는 포즈(pose)가 지정된 일련의 입력 이미지로부터 토큰을 처리한다. 기존의 절대적(absolute) 또는 상대적(relative) 위치 인코딩 방식은 패치를 고유하게 인코딩하면서도 SE(3)-invariant attention을 구현하고, 장면의 기하학적 구조에 적응하는 데 한계가 있다.
이를 해결하기 위해 제안된 RayRoPE는 패치 위치를 관련 **Ray(광선)**를 기반으로 표현한다. 특히 단순히 방향만을 사용하는 대신, 광선을 따라 예측된 **Point(점)**를 활용하여 기존 방식의 공백을 메운다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.