AI Briefing

시각적으로 정합된 상호작용형 계획을 위한 벤치마크 AsgardBench

·2026.03.27 04:02

핵심 내용

AsgardBench는 이미지 관찰로 계획을 고쳐 쓰는 embodied AI 능력을 검증한다.

1 / 2

자세히 보기

AsgardBench는 embodied AI 에이전트가 작업을 수행하는 동안 시각 정보를 바탕으로 계획을 얼마나 잘 수정하는지 평가하는 벤치마크다. 단순히 과제를 완수하는지보다, 눈으로 본 상태 변화에 맞춰 다음 행동을 다시 짜는 능력에 초점을 맞춘다.

AI2-THOR 위에서 구축된 이 벤치마크는 에이전트를 물체 근처의 상호작용 가능한 위치에 배치하고, find, pickup, put, clean, toggle_on/off 같은 제한된 행동만 허용한다. 매 턴 에이전트는 완주를 위한 전체 계획을 제안하지만, 실제로는 첫 번째 단계만 실행되며 그 뒤 새 이미지와 성공/실패 신호를 받아 계획을 다시 세워야 한다.

핵심은 탐색이나 조작의 난도가 아니라, 관찰한 상태를 이용해 계획을 즉시 갱신하는지에 있다. 예를 들어 같은 ‘컵을 씻으라’는 지시라도 컵이 이미 깨끗한지, 더러운지, 커피가 들어 있는지에 따라 필요한 행동 순서는 달라진다. 싱크대가 다른 물건으로 가득 찬 경우도 마찬가지로, 같은 지시가 서로 다른 실행 경로를 요구한다.

평가 결과는 시각 grounding의 중요성을 분명히 보여준다.

  • 여러 모델에서 이미지 입력은 텍스트만 받은 조건보다 성공률을 크게 끌어올렸다.
  • 일부 이전 벤치마크와 달리, 단순한 실패 설명만으로는 충분하지 않았고 시각 정보가 성능 차이를 만든다.
  • 가장 강한 vision-capable 모델도 텍스트-only 에이전트보다 더 잘 수행해, 이 과제가 텍스트만으로는 대체되지 않는 perception-based reasoning을 요구함을 드러냈다.

실패 양상도 반복적으로 관찰됐다. 에이전트는 실행 불가능한 행동을 시도하거나, 같은 행동을 루프처럼 반복하거나, clean/dirty, on/off 같은 미묘한 시각 단서를 잘못 해석했다. 또한 여러 단계에 걸쳐 현재 작업 진행 상황을 놓치는 경우가 많았고, 이는 더 정교한 상태 추적과 계획 수정 능력이 필요하다는 뜻이다.

AsgardBench는 피드백 수준을 없음 / 최소 / 상세로 바꿔 보며 성능 차이를 분리해 볼 수 있는 진단 도구이기도 하다. 저자들은 앞으로 더 강한 시각 이해, 더 안정적인 상태 기억, 그리고 중간에 계획을 고치는 학습 방식이 embodied agent의 다음 과제가 될 것이라고 본다. 벤치마크는 오픈 소스로 공개되어 있으며 GitHub에서 확인할 수 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.