AI Briefing

올리브영, NLL 지표 기반 정렬 학습으로 AI Pick 추천 카드 품질·형식 동시 개선

·2026.09.18 17:46

핵심 내용

올리브영이 NLL 지표를 활용해 AI Pick 추천 카드의 자연스러움과 형식 준수율을 동시에 개선하는 정렬 학습 방식을 공개했다.

1 / 6

자세히 보기

올리브영 데이터 사이언티스트 안일호가 AI Pick 추천 카드 생성 모델의 고도화 과정을 공유했다. 기존 SFT(Supervised Fine-Tuning) 방식은 형식 준수, 자연스러움, 문맥 적합성을 동시에 만족시키기 어려웠으며, 특히 글자 수 제한과 자연스러운 표현 사이의 트레이드오프가 존재했다.

측정 불가능한 품질의 수치화

자연스러움과 문맥 적합성을 측정하기 위해 LLM-as-a-judge나 사람 평가 대신 Polyglot-Ko-1.3B 모델의 NLL(Negative Log-Likelihood)을 프록시 지표로 활용했다. NLL 값이 낮을수록 품질이 우수하며, 형식은 정규식 기반 검증기로, 품질은 NLL로 분리해 평가했다. 이를 통해 사람 라벨 없이 선호 데이터(chosen/rejected pair)를 자동 구성할 수 있었다.

DPO와 GRPO를 통한 형식-품질 균형

DPO(Direct Preference Optimization) 학습으로 자연스러움(NLL)은 개선되었으나 형식 통과율이 급락하는 문제가 발생했다. 이를 해결하기 위해 과제별 다른 전략을 적용했다.

  • WHO 카드(개인화): GPT-OSS-120B가 생성한 near-miss 오류 데이터를 섞는 formatmix 기법을 적용해 형식 통과율을 13.2%p 회복하면서도 품질 저하를 최소화했다.
  • TPO 카드(시의성): 형식 필드가 많아 DPO 단독으로는 형식 유지가 어려웠다. DPO로 품질을 확보한 후, 형식 위반에 대한 차등 감점 보상(shaped reward)을 사용하는 GRPO(Group Relative Policy Optimization)로 형식 통과율을 24.7%p 추가 회복했다.

NLL 프록시의 유효성 검증

약 2,000건의 블라인드 사람 평가와 비교한 결과, 1.3B 파라미터의 NLL 모델이 Gemini 2.5 Pro나 GPT-OSS-120B 같은 대형 모델보다 사람 평가와 더 높은 정합성(Kendall tau-b 0.145, AUROC 0.694)을 보였다. 이는 NLL이 순환 논리가 아닌 실제 품질 신호로 유효함을 입증한다.

운영 시사점

추론 시점의 재시도(retry)나 재정렬(rerank)만으로는 품질 내재화를 대체할 수 없으며, 연산 비용도 약 5배 증가한다. 따라서 정렬 학습으로 품질을 높이고, 남은 형식 오류는 검증기 기반 재시도로 처리하는 하이브리드 구성이 최적의 균형점이다. 형식 검증기와 NLL 지표는 모델 버전 비교 및 배포 전 검증에 재사용 가능한 공통 자산으로 활용될 수 있다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.