AI Briefing

AI agent skills, 벤치마크 성능의 절반도 현실에서 못 낸다

·2026.04.16 11:07

핵심 내용

최신 AI agent도 현실적 스킬 활용에서는 벤치마크 대비 성능이 크게 떨어진다.

자세히 보기

UC Santa Barbara, MIT CSAIL, MIT-IBM Watson AI Lab 연구팀이 AI agent의 skill 활용 능력을 현실 조건에 가깝게 다시 평가했다.

기존 SKILLSBENCH는 agent에게 맞는 skill을 미리 제공하는 이상적인 설정이라 실제보다 성능이 부풀려질 수 있었다. 이를 보완하기 위해 연구팀은 오픈소스에서 수집한 34,198개 skill을 바탕으로 더 현실적인 6단계 시나리오를 구성했다.

  • skill을 직접 제공
  • agent가 스스로 skill 선택
  • 관련 없는 skill을 섞음
  • 대규모 skill pool에서 검색
  • 맞춤형 skill이 아예 없는 경우

최신 모델인 Claude Opus 4.6, Kimi K2.5, Qwen3.5-397B를 테스트한 결과, 이상적인 조건과 현실 조건 사이의 격차가 컸다.

  • Claude Opus 4.6
    • skill 직접 제공: 55.4% 통과율
    • 현실 조건(대규모 검색 + 선택): 40.1%
    • 맞춤형 skill 없음: 38.4%
    • skill 미사용 기준선 **35.4%**와는 3%p 차이뿐

약한 모델에서는 skill을 넣었을 때 오히려 성능이 기준선 아래로 떨어지는 역효과도 나타났다.

성능 저하의 주요 원인은 다음과 같다.

  • skill 선별 실패: Claude가 맞춤형 skill을 제대로 불러오는 비율이 49% 수준
  • 검색 정확도 한계: 상위 5개 중 관련 skill 회수율(Recall@5)이 최대 **65.5%**에 그침
  • 적응 능력 부족: 유사 skill을 상황에 맞게 충분히 변형해 쓰지 못함

개선 시도도 있었다. 과제별로 skill을 정제·생성하면 Claude 성능이 **40.1% → 48.2%**로 올라갔지만, 초기 검색 결과에 어느 정도 관련성이 있어야 효과가 있었다.

결론적으로 현재 AI agent skill은 벤치마크에서 과장된 성능을 보이기 쉽고, 실제 환경에서는 효과가 제한적이다. 특히 약한 모델에서는 skill이 도움이 되기보다 방해가 될 수 있으며, 더 나은 검색 기법과 오프라인 skill 정제 전략, 모델 역량에 맞는 skill 생태계 설계가 필요하다는 점을 강조한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.