에이전트 도구 사용 능력 벤치마킹
·2023.12.20 15:28
LangChain이 LLM 에이전트의 도구 사용 및 함수 호출 성능을 측정하는 4가지 새로운 테스트 환경을 공개했다.
LLM 에이전트 구축과 평가의 어려움을 해결하기 위해 LangChain이 4가지 새로운 테스트 환경을 출시했습니다. 이번 벤치마크는 에이전트 워크플로우의 필수 조건인 계획 수립(Planning), 작업 분해(Task Decomposition), 함수 호출(Function Calling) 능력을 측정하는 데 중점을 둡니다.
주요 테스트 환경은 다음과 같습니다:
- Typewriter (Single/26 tools): 도구를 순차적으로 호출하여 단어 입력
- Relational Data: 3개의 테이블 정보를 바탕으로 질문에 답변
- Multiverse Math: 변경된 수학 규칙을 적용하여 도구로 문제 해결
벤치마크 결과, 모든 모델은 작업 단계가 길어질수록 실패 확률이 높아지는 경향을 보였습니다. GPT-4는 관계형 데이터 작업에서 가장 높은 점수를 기록했으나, Multiverse Math에서는 사전 학습된 편향(Pre-trained bias)으로 인해 GPT-3.5보다 낮은 성능을 보이는 '역스케일링(Inverse scaling)' 현상이 관찰되었습니다.
또한, Claude-2.1은 대부분의 작업에서 GPT-4와 유사한 성능을 보였으나 관계형 데이터 작업에서는 다소 뒤처졌습니다. 오픈소스 모델인 Mistral 7b 변형 모델은 단일 호출은 정확하지만, 2개 이상의 함수를 조합(Composition)하는 데 어려움을 겪는 것으로 나타났습니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.