AI agent skills, 벤치마크 성능의 절반도 현실에서 못 낸다
핵심 내용
최신 AI agent도 현실적 스킬 활용에서는 벤치마크 대비 성능이 크게 떨어진다.
자세히 보기
UC Santa Barbara, MIT CSAIL, MIT-IBM Watson AI Lab 연구팀이 AI agent의 skill 활용 능력을 현실 조건에 가깝게 다시 평가했다.
기존 SKILLSBENCH는 agent에게 맞는 skill을 미리 제공하는 이상적인 설정이라 실제보다 성능이 부풀려질 수 있었다. 이를 보완하기 위해 연구팀은 오픈소스에서 수집한 34,198개 skill을 바탕으로 더 현실적인 6단계 시나리오를 구성했다.
- skill을 직접 제공
- agent가 스스로 skill 선택
- 관련 없는 skill을 섞음
- 대규모 skill pool에서 검색
- 맞춤형 skill이 아예 없는 경우
최신 모델인 Claude Opus 4.6, Kimi K2.5, Qwen3.5-397B를 테스트한 결과, 이상적인 조건과 현실 조건 사이의 격차가 컸다.
- Claude Opus 4.6
- skill 직접 제공: 55.4% 통과율
- 현실 조건(대규모 검색 + 선택): 40.1%
- 맞춤형 skill 없음: 38.4%
- skill 미사용 기준선 **35.4%**와는 3%p 차이뿐
약한 모델에서는 skill을 넣었을 때 오히려 성능이 기준선 아래로 떨어지는 역효과도 나타났다.
성능 저하의 주요 원인은 다음과 같다.
- skill 선별 실패: Claude가 맞춤형 skill을 제대로 불러오는 비율이 49% 수준
- 검색 정확도 한계: 상위 5개 중 관련 skill 회수율(Recall@5)이 최대 **65.5%**에 그침
- 적응 능력 부족: 유사 skill을 상황에 맞게 충분히 변형해 쓰지 못함
개선 시도도 있었다. 과제별로 skill을 정제·생성하면 Claude 성능이 **40.1% → 48.2%**로 올라갔지만, 초기 검색 결과에 어느 정도 관련성이 있어야 효과가 있었다.
결론적으로 현재 AI agent skill은 벤치마크에서 과장된 성능을 보이기 쉽고, 실제 환경에서는 효과가 제한적이다. 특히 약한 모델에서는 skill이 도움이 되기보다 방해가 될 수 있으며, 더 나은 검색 기법과 오프라인 skill 정제 전략, 모델 역량에 맞는 skill 생태계 설계가 필요하다는 점을 강조한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.