AI Briefing

GLM-5.3-Flash, 파인튜닝 없이 Jev와 동등한 분류 성능 달성

·2026.09.27 22:37

핵심 내용

GLM-5.3-Flash가 파인튜닝 없이 Jev와 동등한 분류 성능을 달성했으나 비용과 지연은 더 높다.

자세히 보기

Privatemode 연구진이 GLM-5.3-Flash가 파인튜닝 없이도 특화된 Jev 모델과 동등한 성능을 내는 System One 의사결정 모델로 기능할 수 있음을 입증했다. 텍스트 생성 대신 단일 순방향 패스에서 logit 확률을 추출하는 방식으로, 범용 LLM이 유사한 정확도를 달성하면서도 멀티모달 입력을 지원한다.

벤치마크 성능 및 방법론

연구진은 29개 공개 데이터셋에서 GLM-5.3-Flash, Jev, Laya(421M 파라미터)를 비교 평가했다. GLM-5.3-Flash와 Jev 간에는 통계적 동등성이 확인됐다.

  • 정확도: 중위값 격차는 0.7%p(Jev 우위, p=0.64, 통계적 유의성 없음). 28개 텍스트 데이터셋 중 각 모델이 10개에서 우위를 점했다.
  • Laya 비교: Laya는 중위값 격차 13~15%p(p<0.001)로 유의미하게 낮은 성능을 보였다.
  • 옵션 수 민감도: 모델 선택보다 옵션 수가 정확도에 더 큰 영향을 미친다. TREC 데이터셋(옵션 6→42개)에서 Jev는 92.1%에서 85.6%로, GLM은 91.2%에서 79.6%로 하락했다.

기술 구현

이 접근법은 vLLM과 Privatemode 인프라를 활용해 생성 과정을 우회한다.

  • Logit 추출: logprob_token_ids를 사용해 특정 옵션 토큰의 확률을 가져오며, top_logprobs의 노이즈를 피한다.
  • 제약 조건: allowed_token_ids로 출력 어휘를 제한한다. 토큰 ID는 /completions 에코 요청을 통해 동적으로 가져온다.
  • 확장성 한계: GLM-5.3-Flash는 단일 토큰으로 표현 가능한 최대 191개 옵션을 지원한다. CLINC150(151개 옵션) 같은 데이터셋에서는 두 요청을 병합해 **87.5%**의 정확도를 달성, Jev의 78.4%를 넘어서지만 지연 시간은 719ms(Jev 249ms)로 증가한다.

비용, 지연 시간 및 멀티모달 기능

  • 비용: Jev는 백만 건당 EUR 16으로 GLM의 EUR 62보다 비용 효율적이다. GLM에서 추론 기능을 활성화하면 비용이 백만 건당 EUR 350으로 상승한다.
  • 지연 시간: 지역에 따라 다르다. 독일에서는 GLM(180ms)이 Jev(264ms)보다 빠르며, 미국에서는 Jev(164ms)가 GLM(299ms)보다 빠르다.
  • 멀티모달: GLM-5.3-Flash는 이미지 입력을 지원해 RVL-CDIP(스캔 문서)에서 **70.2%**의 정확도를 달성했다. Jev와 Laya는 이 작업을 수행할 수 없다.
  • 토큰 오버헤드: GLM은 옵션이 21개 미만일 때는 Jev보다 토큰 사용량이 적지만, 더 큰 세트에서는 Jev의 고정 오버헤드 구조보다 더 많은 토큰을 사용한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.