AI Briefing

LLM 추론 토큰 2~3배 압축 기술 공개

[Study/Models] Flint: Compressing Reasoning Without Breaking It

·2026.07.13 21:05

추론 과정 중 계산/검증 구간만 남기고 서술을 압축하여 성능을 유지하며 토큰을 절감하는 기술을 제안함.

Qwen3.5-4B 및 Gemma-4-12B 모델을 대상으로 Self-distilled reasoning traces를 활용한 압축 학습을 진행한 결과, 기존 모델 대비 2~3배 적은 토큰을 사용하면서도 성능은 유지하거나 오히려 향상됨을 확인했습니다.

주요 연구 결과는 다음과 같습니다:

  • Section-aware Compression: 추론 과정 전체를 압축하는 대신, 계산(Compute) 및 검증(Verification) 구간은 유지하고 그 사이의 서술/전환 문구만 압축하는 방식이 효과적임. 이 방식은 GSM8K 벤치마크에서 미압축 SFT 대비 +0.15의 성능 향상을 보임.
  • Termination Anchor: 모델은 계산 구간을 단순한 작업 기억 장치뿐만 아니라, 추론을 종료하는 **앵커(Anchor)**로 인식함.
  • Prompt Dependency: 압축 학습된 모델은 'Step by step'과 같은 시스템 프롬프트에 대해 효율성 트리거로 작동하며, 프롬프트 없이 학습한 후 서비스 시에 프롬프트를 사용하는 방식이 가장 효과적임.

연구 결과와 모델, 코드는 모두 공개되어 있습니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.