Anthropic, Embody 벤치마크 공개
LLM의 로봇 제어 능력은 무엇이 좌우하는가: Anthropic의 Embody 벤치마크 분석
·2026.07.16 06:30
Anthropic이 LLM의 물리적 로봇 제어 능력을 측정하는 Embody 벤치마크를 통해 모델과 인터페이스의 상관관계를 분석했다.
Anthropic은 언어 모델이 물리 세계에서 로봇을 얼마나 잘 제어할 수 있는지 측정하기 위해 Embody 벤치마크를 공개했습니다. 이 연구는 모델의 지능뿐만 아니라 **로봇의 몸체(Body)**와 **제어 인터페이스(Interface)**가 성능에 미치는 영향을 체계적으로 분석합니다.
연구팀은 네 가지 수준의 제어 인터페이스를 정의하여 실험을 진행했습니다:
- 직접 제어(Direct Control): 관절 토크 등 저수준 동작을 직접 지시
- 프로그래밍 제어(Programmatic Control): Python 코드를 작성하여 제어
- 정책 제어(Policy Control): 사전 학습된 정책에 고수준 명령 전달
- 강화 학습 감독(RL Supervision): 보상 함수 등을 설계하여 정책을 훈련
실험 결과, 모델의 성능은 단순히 모델의 크기뿐만 아니라 어떤 인터페이스를 통해 로봇과 연결되었는가에 따라 크게 달라지는 것으로 나타났습니다. 특히 Claude Mythos Preview가 가장 높은 성능을 보였으며, 모델 세대가 거듭될수록 물리적 역량이 향상되고 있음이 확인되었습니다. 또한, 모델의 추론 속도와 로봇의 실시간 제어 주기 사이의 격차를 해결하는 것이 실제 로봇 적용의 핵심 과제임을 시사합니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.