AI Briefing

Legal Agent Benchmark(LAB) 초기 결과 분석

·2026.05.26 09:00

핵심 내용

최신 프론티어 모델들도 복잡한 법률 업무를 완벽히 수행하는 비율은 10% 미만인 것으로 나타났다.

1 / 2

자세히 보기

**Legal Agent Benchmark(LAB)**는 복잡한 법률 업무를 수행하는 에이전트의 성능을 평가하기 위한 오픈 소스 벤치마크다. 모든 요구 기준을 충족해야 통과로 인정하는 엄격한 all-pass 표준을 적용해 분석한 결과, 세 가지 주요 트렌드가 확인되었다.

첫째, 프론티어 모델의 법률 업무 수행 능력은 아직 초기 단계다. 평가된 모델들이 업무를 처음부터 끝까지 완벽하게 완수하는 비율은 전체의 10% 미만에 불과했다.

둘째, 모델의 지능은 법률 전문 분야에 따라 불균형하게 분포되어 있다. 특정 분야에서는 뛰어난 성능을 보이지만 다른 분야에서는 그렇지 못한 jagged intelligence 현상이 나타나며, 법률 실무 영역별로 선두 모델이 달라진다.

셋째, 최상위 성능을 내기 위해서는 높은 비용과 시간이 소모된다. 벤치마크 상위권 모델을 운영할 경우 작업당 약 50달러의 비용과 **20분 이상의 지연 시간(latency)**이 발생한다.

주요 모델별 all-pass 성적은 다음과 같다:

  • Claude Opus 4.7: 7.1%
  • Sonnet 4.6: 5.4%
  • Opus 4.6: 4.2%
  • GPT-5.5: 2.1%
  • Gemini 3.5 Flash: 0.8%

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.