장기적 터미널 작업 수행 능력을 테스트하는 에이전트 벤치마크 (GitHub Repo)
·2026.07.14 09:00
LLM 에이전트가 컨테이너화된 터미널 환경에서 수백 단계의 복잡한 작업을 수행할 수 있는지 측정하는 LHTB 벤치마크가 공개되었습니다.
**Long-Horizon Terminal-Bench (LHTB)**는 LLM 에이전트가 컨테이너화된 터미널 환경에서 **수백 단계(hundreds of steps)**에 걸쳐 유용한 작업을 지속할 수 있는지를 측정하는 46개 태스크 규모의 벤치마크입니다.
단일 결과물만 생성하고 종료되는 기존의 단기 코딩 벤치마크와 달리, LHTB는 에이전트를 상태가 유지되는(stateful) 환경에 투입합니다. 평가는 에이전트의 자기 보고 방식이 아닌, **숨겨진 재빌드 기반 검증기(hidden, rebuild-from-artifact verifiers)**를 통해 엄격하게 이루어집니다.
주요 태스크 범위는 다음과 같습니다:
- 인터랙티브 게임 및 퍼즐
- 멀티모달 분석
- 소프트웨어 및 리버스 엔지니어링
- 과학적 컴퓨팅 및 연구 재현
- 보안, 성능, 지구 및 에너지 시스템
- 전문적인 APEX 스타일 워크플로우
2026년 7월 기준 테스트 결과, Grok 4.5가 가장 높은 평균 보상을 기록했으나, 가장 강력한 모델조차 엄격한 기준을 적용했을 때 태스크의 약 **28%**만을 해결했습니다. 특히 모든 모델이 중간값(median) 태스크를 해결하지 못할 정도로 LHTB는 아직 정복되지 않은 영역임을 보여줍니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.