비디오 내 다수 피사체에 대한 동작 바인딩 (6분 읽기)
ActionParty는 비디오 생성 모델이 여러 피사체에 각각 다른 동작을 정확히 할당하지 못하는 '동작 바인딩' 문제를 해결한다.
기존 비디오 생성 모델은 여러 피사체에 서로 다른 동작을 정확히 할당하는 동작 바인딩(Action Binding) 문제에 취약하다. 예를 들어, "빨간 삼각형은 오른쪽으로, 파란 사각형은 위로 이동한다"는 명령을 입력하면 동작이 서로 뒤바뀌거나 무시되는 현상이 빈번하게 발생한다.
ActionParty는 이를 해결하기 위해 각 피사체의 상태를 지속적으로 캡처하는 **피사체 상태 토큰(Subject State Tokens)**과 **공간 편향 메커니즘(Spatial Biasing Mechanism)**을 도입했다. 이를 통해 전역적인 비디오 프레임 렌더링과 개별 피사체의 동작 업데이트를 분리하여 정교한 제어를 가능하게 했다.
이 모델은 **Diffusion Transformer(DiT)**를 기반으로 작동하는 생성형 게임 엔진이다. 비디오 프레임을 디노이징하는 동시에 피사체의 좌표를 예측하며, 어텐션 마스킹(Attention Masking)을 통해 동작과 피사체 간의 대응 관계를 명확히 유지한다.
Melting Pot 벤치마크 결과, ActionParty는 46개의 다양한 환경에서 최대 7명의 플레이어를 동시에 제어할 수 있음을 입증했다. 이는 동작 수행 정확도와 피사체 정체성 유지 측면에서 기존 모델 대비 뛰어난 성능을 보여준다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.