AI Briefing

vLLM, rope_scaling 덮어쓰기로 모델 36% 설정 불일치 발생

vLLM에 rope_scaling을 실행 때 넘기면 인기 모델 180개 중 64개의 RoPE 밑이 조용히 바뀝니다 — 측정과 검사 라이브러리(entail)

·2026.09.25 17:08

핵심 내용

vLLM의 rope_scaling 덮어쓰기 버그로 GSM8K 점수가 최대 28% 하락하는 현상을 검증하고 방지하는 오픈소스 도구 entail을 공개했다.

자세히 보기

vLLM 0.30에서 실행 시 rope_scaling을 덮어쓰는 경우, Hugging Face 인기 텍스트 생성 모델 300개 중 rope_scaling이 적용되는 180개 모델 중 **64개(36%)**가 경고 없이 다른 RoPE 밑(base)으로 실행되는 문제가 발견되었다. 이는 Transformers v5에서 rope_parameters 구조 변경으로 rope_theta가 사라진 후, vLLM이 모델 파일에 기본값이 없을 때 10000으로 고정되기 때문이다.

성능 저하 및 검증

RTX 4070 Ti 환경에서 Llama-3.2-3B-Instruct의 GSM8K 점수가 379에서 273으로(약 28% 하락), Qwen3-4B-Instruct-2507은 YaRN 적용 시 183에서 175로 하락하는 등 실제 성능 저하가 확인되었다. Gemma 2의 soft-capping 누락 등 유사한 설정 불일치도 다수 존재하나, 기존 평가 지표로는 감지하기 어려운 수준이다.

entail 라이브러리 공개

이러한 설정 불일치를 방지하기 위해 모델 파일의 선언과 엔진의 실제 실행 값을 대조하고 필요 시 수정하는 오픈소스 라이브러리 entail을 공개했다. pip install entail-ai로 설치 가능하며, 38개 모델과 102회 실행 테스트에서 출력 일치율 100%, 적재 비용 증가 0.7~0.9%, 오탐지 0건을 달성했다. 현재 vLLM과 SGLang 상류에 관련 이슈가 보고된 상태이다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.