AI Briefing

SLM 역전승

SFT + DPO on open-sourced SLMs

·2026.04.18 00:01

핵심 내용

3B·7B 오픈소스 SLM을 SFT+DPO로 특화해 상용 모델보다 높은 점수를 냈다.

자세히 보기

Dharma-AI가 3B와 7B 오픈소스 SLM을 SFT + DPO로 특화했다.

비교 대상은 GPT-5.4, Gemini 3.1 Pro, Claude Opus 4.6, Google Document API와 오픈소스 대안인 OlmOCR, Deepseek-OCR, GLMOCR, Qwen3였다.

결과는 7B 0.925, 3B 0.911로, 제시된 비교 대상들보다 높은 성능 점수였다.

  • DPO는 거절 예시를 활용해 퇴화성 출력(degenerate outputs)을 줄였고, 실패율을 최대 87.6% 낮췄다.
  • AWQ 적용 시 페이지당 추론 비용이 약 22% 줄었고, 품질 저하는 거의 없었다.

논문, 모델, 데이터셋이 함께 공개돼 있어 재현 실험과 후속 특화 연구에 참고할 만하다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.