GLM-5.3-Flash, 파인튜닝 없이 Jev와 동등한 분류 성능 달성
·2026.09.27 22:37
핵심 내용
GLM-5.3-Flash가 파인튜닝 없이 Jev와 동등한 분류 성능을 달성했으나 비용과 지연은 더 높다.
자세히 보기
Privatemode 연구진이 GLM-5.3-Flash가 파인튜닝 없이도 특화된 Jev 모델과 동등한 성능을 내는 System One 의사결정 모델로 기능할 수 있음을 입증했다. 텍스트 생성 대신 단일 순방향 패스에서 logit 확률을 추출하는 방식으로, 범용 LLM이 유사한 정확도를 달성하면서도 멀티모달 입력을 지원한다.
벤치마크 성능 및 방법론
연구진은 29개 공개 데이터셋에서 GLM-5.3-Flash, Jev, Laya(421M 파라미터)를 비교 평가했다. GLM-5.3-Flash와 Jev 간에는 통계적 동등성이 확인됐다.
- 정확도: 중위값 격차는 0.7%p(Jev 우위, p=0.64, 통계적 유의성 없음). 28개 텍스트 데이터셋 중 각 모델이 10개에서 우위를 점했다.
- Laya 비교: Laya는 중위값 격차 13~15%p(p<0.001)로 유의미하게 낮은 성능을 보였다.
- 옵션 수 민감도: 모델 선택보다 옵션 수가 정확도에 더 큰 영향을 미친다. TREC 데이터셋(옵션 6→42개)에서 Jev는 92.1%에서 85.6%로, GLM은 91.2%에서 79.6%로 하락했다.
기술 구현
이 접근법은 vLLM과 Privatemode 인프라를 활용해 생성 과정을 우회한다.
- Logit 추출:
logprob_token_ids를 사용해 특정 옵션 토큰의 확률을 가져오며,top_logprobs의 노이즈를 피한다. - 제약 조건:
allowed_token_ids로 출력 어휘를 제한한다. 토큰 ID는/completions에코 요청을 통해 동적으로 가져온다. - 확장성 한계: GLM-5.3-Flash는 단일 토큰으로 표현 가능한 최대 191개 옵션을 지원한다. CLINC150(151개 옵션) 같은 데이터셋에서는 두 요청을 병합해 **87.5%**의 정확도를 달성, Jev의 78.4%를 넘어서지만 지연 시간은 719ms(Jev 249ms)로 증가한다.
비용, 지연 시간 및 멀티모달 기능
- 비용: Jev는 백만 건당 EUR 16으로 GLM의 EUR 62보다 비용 효율적이다. GLM에서 추론 기능을 활성화하면 비용이 백만 건당 EUR 350으로 상승한다.
- 지연 시간: 지역에 따라 다르다. 독일에서는 GLM(180ms)이 Jev(264ms)보다 빠르며, 미국에서는 Jev(164ms)가 GLM(299ms)보다 빠르다.
- 멀티모달: GLM-5.3-Flash는 이미지 입력을 지원해 RVL-CDIP(스캔 문서)에서 **70.2%**의 정확도를 달성했다. Jev와 Laya는 이 작업을 수행할 수 없다.
- 토큰 오버헤드: GLM은 옵션이 21개 미만일 때는 Jev보다 토큰 사용량이 적지만, 더 큰 세트에서는 Jev의 고정 오버헤드 구조보다 더 많은 토큰을 사용한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.