AI Briefing

Apriel-H1: 추론 효율 2.1배 향상

Apriel-H1: The Surprising Key to Distilling Efficient Reasoning Models

·2025.11.19 14:19

고품질 추론 데이터를 활용해 15B 추론 모델을 성능 저하 없이 2.1배 빠른 Mamba 하이브리드로 증류했다.

ServiceNow AI는 기존 15B 추론 모델을 처음부터 다시 학습시키지 않고도 효율성을 극대화할 수 있는 Apriel-H1 모델군을 공개했다. 이 모델은 Mamba 하이브리드 구조를 채택하여 처리량(throughput)을 최대 2.1배 향상시키면서도 추론 성능 저하를 최소화했다.

핵심적인 기술적 통찰은 증류(distillation) 시 사용하는 데이터의 종류에 있다. 일반적인 사전 학습(pretraining) 데이터를 사용하는 대신, 교사 모델(teacher model)의 **SFT(Supervised Fine-Tuning) 데이터셋에서 추출한 고품질 추론 트레이스(reasoning traces)**를 사용해야 한다. 이는 어텐션 메커니즘이 가진 복잡한 다단계 추론 패턴과 장거리 의존성을 Mamba의 선형 재귀 구조로 효과적으로 전이하기 위함이다.

주요 방법론 및 특징은 다음과 같다:

  • 데이터 매칭: 모델이 구축하려는 기능이 아닌, 보존하려는 기능(추론 능력)에 맞춰 증류 데이터를 선택해야 한다.
  • Reverse KL Divergence: 교사 모델의 높은 확신도를 학생 모델이 따르도록 하기 위해 Forward KL 대신 Reverse KL divergence를 사용하여 학습 효율을 높였다.
  • 성능: MATH500 및 MTBench 성능은 오히려 소폭 향상되었으며, GSM8k나 GPQA 등 일부 벤치마크에서 미세한 하락이 있었으나 전체적인 추론 품질은 안정적으로 유지되었다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.