AI Briefing

간단한 Self-Distillation으로 LLM 코드 생성 성능 향상

·2026.07.16 09:00

LLM이 자신의 출력만으로 검증기나 별도 학습 없이 코드 생성 능력을 크게 향상시킬 수 있다.

**Simple Self-Distillation(SSD)**라는 간단한 방법으로 LLM의 코드 생성 성능을 대폭 개선할 수 있다. 별도의 검증기, 교사 모델, 강화학습이 필요하지 않다.

방법은 단순하다. 특정 온도(temperature)와 절단(truncation) 설정으로 모델에서 샘플링한 솔루션들을 모아 표준 지도학습으로 미세조정하면 된다. Qwen3-30B-Instruct의 경우 LiveCodeBench v6에서 42.4%에서 55.3%로 pass@1 성능이 향상됐으며, 특히 더 어려운 문제에서 개선 효과가 크다.

이 방법은 Qwen과 Llama 모델의 4B, 8B, 30B 크기 전반에서 작동하며, instruct 버전과 thinking 버전 모두에 적용된다. SSD는 LLM 디코딩의 정밀도-탐색(precision-exploration) 간의 충돌을 해결함으로써 작동한다. 정밀도가 중요한 부분에서는 방해 요소를 억제하면서도 탐색이 필요한 부분에서는 유용한 다양성을 보존한다.

이는 LLM 코드 생성 능력 향상을 위한 새로운 사후훈련(post-training) 방향을 제시한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.