ZTC 기술, HF 리더보드서 TypeSafe JEV 제치고 1위
허깅페이스 리더보드에서 JEV를 5위로 밀어내고 1위를 차지한 한국의 ZTC 기술 분석
핵심 내용
27B 모델 단일 순전파로 판정 수행, 정확도 0.743 기록
자세히 보기
한국 ZTC(Zero-Token Classification) 기술이 허깅페이스 공식 Typed Decisions 리더보드에서 TypeSafe JEV를 제치고 1위를 차지했다. 이 기술은 토큰 생성 없이 백본 모델의 마지막 은닉 상태를 판독 헤드(readout head)로 처리해 점수를 산출한다.
핵심 성과 및 성능
Darwin-27B-ZTC 모델은 2026년 10월 지정된 LocalLLaMA/typed-decisions 벤치마크에서 정확도 0.743, KL 0.204, Brier 0.097의 지표를 기록하며 오류 0건으로 1위에 올랐다. 형식별 정확도는 noul 0.845, choice 0.732, score 0.675이다. 경쟁 모델인 Liquid AI d1(0.742)과 TypeSafe Jev 1.13(0.727)보다 높은 점수다.
또한 영어 벤치 137개로 구성된 S1MB(System One Mosaic Benchmark)에서도 Darwin-27B-ZTC-v2가 Borda 점수 89.58, Task Avg 66.46으로 1위를 기록했다. 특히 Score 형식에서 2위 대비 5.38점 높은 성능을 보이며 세 형식 모두에서 우위를 점했다.
기술적 특징 및 구현
ZTC는 질문당 순전파 1회로 판정을 완료하여 B200 기준 중간 지연 약 50ms를 달성했다. 파싱 실패가 구조적으로 없으며, 보정된 확신도(ECE, Brier, KL)를 직접 제공한다. 구현은 autojev(MIT) 기반이며, 추론 코드와 서버 코드가 공개되었다.
검증 및 배포
측정 과정에서는 Uniform 기준값 재현을 통해 지표 정의를 검증하고, 입력 한도 초과 시 임의 절단 대신 한도를 상향 조정(8,192 -> 32,768 토큰)하여 공정성을 확보했다. 모델 가중치와 코드는 Hugging Face 및 공개 저장소를 통해 공개되었으며, Decision Index 0.3 리더보드에도 제출된 상태다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.