GLM-5.3-Flash, Jev와 동등한 의사결정 성능과 비전 기능 제공… 비용은 더 높아
·2026.09.27 00:49
핵심 내용
GLM-5.3-Flash가 Jev와 동등한 성능과 비전 기능을 제공하지만 비용은 더 높다.
자세히 보기
Privatemode가 GLM-5.3-Flash를 Jev, Laya 같은 전문 의사결정 모델과 대등한 수준으로 만드는 기술과 벤치마크를 공개했다. vLLM 엔드포인트에서 /completions와 echo를 활용해 토큰화 데이터를 추출, 토큰 오라클 마스킹과 재정규화를 수행해 분류 작업에 필요한 정확한 확률 분포를 얻는 방식이다.
벤치마크 결과
의도 라우팅, 감정 분석, 법률 분류 등 29개 공개 레이블 데이터셋에서 GLM-5.3-Flash는 Jev와 통계적으로 동등한 성능을 보였다.
- 정확도: Jev가 0.7%p 앞섰으나 통계적 유의성은 없음 (p = 0.64).
- 비교: 더 작은 Laya (421M 파라미터)보다는 중위값 기준 13~15%p 높음.
- 옵션 수 영향: 모델 선택보다 옵션 수가 정확도에 더 큰 영향을 미침. TREC 데이터셋(옵션 6개→42개)에서 모든 모델의 정확도가 떨어졌지만 GLM-5.3-Flash는 경쟁력을 유지함.
비용 및 지연 시간
- 비용: 100만 건 의사결정 기준 Jev는 약 EUR 16, GLM-5.3-Flash는 EUR 62. 다만 옵션이 약 21개 미만인 작업에서는 GLM-5.3-Flash가 더 적은 토큰을 사용함.
- 지연 시간: 위치에 따라 다름. 독일에서는 GLM-5.3-Flash가 180 ms로 Jev(264 ms)보다 빠름. 미국에서는 Jev가 164 ms로 GLM-5.3-Flash(299 ms)보다 빠름.
기능 및 한계
- 멀티모달: Jev와 Laya와 달리 GLM-5.3-Flash는 인보이스, 스크린샷 등 비전 입력을 지원하며, 스캔된 비즈니스 문서(RVL-CDIP)에서 70.2% 정확도를 기록함.
- 긴 옵션 목록: 엔드포인트는 요청당 최대 128개 옵션만 반환. 128개를 초과하면 두 번의 요청과 병합이 필요해 지연 시간이 719 ms로 증가함.
- 추론 모드: 추론 모드를 활성화하면 정확도가 향상됨(예: 2개 옵션에서 89.9% vs 85.5%). 하지만 비용이 100만 건당 약 EUR 350으로 급증함.
- 보안: 엔드 투 엔드 암호화와 TEE 기반 처리를 사용함.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.