Toss, 공개 리더보드와 실제 업무 성능 괴리 해소 위한 'Toss Benchmark' 구축
핵심 내용
Toss가 공개 벤치마크와 실제 서비스 성능의 차이를 분석하고 도메인 특화 평가 기준인 Toss Benchmark를 구축했다.
자세히 보기
Toss LLM Modeling 팀이 실제 업무 환경에 적합한 모델을 선별하기 위해 Toss Benchmark를 구축했다. 기존 공개 리더보드의 점수는 영어 강점이나 Reasoning 모드 고득점에 치우쳐, 한국어 정책 이해나 빠른 응답이 필요한 운영 환경의 성능과 괴리가 있었다.
한국어 및 추론 설정에 따른 순위 역전
프롬프트 언어를 영어에서 한국어로 변경하거나 Reasoning 기능을 끄는 경우 모델 간 순위가 크게 변동했다. 수학 및 코딩 평가에서 영어 원문 대비 한국어 번역 시 순위가 뒤집히는 현상이 발생했으며, Reasoning Off 시 성능 하락 폭은 모델별로 상이했다. 특히 GLM-5.1은 Reasoning Off 시 30.6점 하락한 반면, gemma-4-26B-A4B-it은 6.0점 하락에 그쳐 운영 환경에서의 안정성 차이가 드러났다.
도메인 특화 평가: Toss IFBench와 Knowledge
실제 업무 처리 능력을 평가하기 위해 Toss IFBench(정책 준수)와 Toss Knowledge(도메인 지식)를 도입했다. Toss IFBench 결과, 형식 준수와 판단 유연성은 별개의 능력으로 나타났으며, Toss Knowledge는 커머스 도메인의 브랜드, 용어, 상품 스펙 등을 4지선다 문항으로 측정한다.
벤치마크와 실제 운영 태스크의 상관관계
11개 모델을 대상으로 분석한 결과, Toss IFBench의 형식 지시 점수와 실제 운영 태스크 성능 간에는 높은 양의 상관관계(Pearson +0.87)가 존재했다. 또한 Toss Knowledge 점수가 높을수록 상품 분류, 그룹화, 검수 등 커머스 세부 태스크의 성능도 높게 나타났다. Toss는 이 데이터를 사내 GenAI Portal의 모델 추천 근거 및 Toss Foundation 모델 개발의 학습 전후 개선 확인 기준으로 활용할 계획이다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.