AI Briefing

smevals: 소형·대형 모델 평가 프레임워크

·2026.08.03 09:00

smevals는 소형·대형 모델과 실행 하니스를 평가하는 프레임워크를 제공한다.

smevals는 소형 및 대형 모델의 특정 능력을 평가하기 위한 프레임워크다. 텍스트-투-SQL, 이미지 생성, 사양 준수 여부 검증처럼 고수준 작업을 Eval로 정의하고, 각 Eval은 개별 문제인 Task의 모음으로 구성된다.

모델과 시스템 프롬프트, 파라미터, 도구 설정 등 실행 환경은 Config로 관리한다. Config를 사용해 Task를 실행한 결과는 불변 기록인 Run으로 저장되며, 동일한 Task와 Config를 여러 번 실행해 비결정적 결과를 확인할 수 있다. smevals run -n 5를 사용하면 각 Task를 최대 5회 실행한다.

실행 프로그램이 네트워크 오류 등으로 0이 아닌 상태로 종료되면 해당 Run은 실패한 Run으로 분류된다. 실패한 Run은 디버깅을 위해 디스크에 남지만 채점과 보고서에서 제외되며, 반복 실행 횟수에도 포함되지 않는다.

Run에는 Grader를 적용해 Grade를 생성한다. Grader는 순서대로 실행되는 Check들의 조합이며, Check는 텍스트 포함 여부 같은 단순 검증부터 SVG 렌더링 후 LLM이 이미지를 평가하는 작업까지 지원한다.

  • Checker: 각 Check를 수행하는 이름 있는 연산 또는 재사용 가능한 CLI 프로그램
  • 필수 Check: 실패하면 이후 Check 실행을 중단
  • 공유 작업 디렉터리: 앞선 Checker가 생성한 렌더링 이미지 등의 파일을 후속 Check가 사용
  • Grade: Check별 결과와 전체 성공·실패 여부, 수치 점수 및 해석용 메모를 기록

설치는 uv tool install smevals 또는 pip install smevals로 진행할 수 있으며, uvx smevals --help로도 실행할 수 있다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.