올리브영, NLL 지표 기반 정렬 학습으로 AI Pick 추천 카드 품질·형식 동시 개선
핵심 내용
올리브영이 NLL 지표를 활용해 AI Pick 추천 카드의 자연스러움과 형식 준수율을 동시에 개선하는 정렬 학습 방식을 공개했다.
자세히 보기
올리브영 데이터 사이언티스트 안일호가 AI Pick 추천 카드 생성 모델의 고도화 과정을 공유했다. 기존 SFT(Supervised Fine-Tuning) 방식은 형식 준수, 자연스러움, 문맥 적합성을 동시에 만족시키기 어려웠으며, 특히 글자 수 제한과 자연스러운 표현 사이의 트레이드오프가 존재했다.
측정 불가능한 품질의 수치화
자연스러움과 문맥 적합성을 측정하기 위해 LLM-as-a-judge나 사람 평가 대신 Polyglot-Ko-1.3B 모델의 NLL(Negative Log-Likelihood)을 프록시 지표로 활용했다. NLL 값이 낮을수록 품질이 우수하며, 형식은 정규식 기반 검증기로, 품질은 NLL로 분리해 평가했다. 이를 통해 사람 라벨 없이 선호 데이터(chosen/rejected pair)를 자동 구성할 수 있었다.
DPO와 GRPO를 통한 형식-품질 균형
DPO(Direct Preference Optimization) 학습으로 자연스러움(NLL)은 개선되었으나 형식 통과율이 급락하는 문제가 발생했다. 이를 해결하기 위해 과제별 다른 전략을 적용했다.
- WHO 카드(개인화): GPT-OSS-120B가 생성한 near-miss 오류 데이터를 섞는 formatmix 기법을 적용해 형식 통과율을 13.2%p 회복하면서도 품질 저하를 최소화했다.
- TPO 카드(시의성): 형식 필드가 많아 DPO 단독으로는 형식 유지가 어려웠다. DPO로 품질을 확보한 후, 형식 위반에 대한 차등 감점 보상(shaped reward)을 사용하는 GRPO(Group Relative Policy Optimization)로 형식 통과율을 24.7%p 추가 회복했다.
NLL 프록시의 유효성 검증
약 2,000건의 블라인드 사람 평가와 비교한 결과, 1.3B 파라미터의 NLL 모델이 Gemini 2.5 Pro나 GPT-OSS-120B 같은 대형 모델보다 사람 평가와 더 높은 정합성(Kendall tau-b 0.145, AUROC 0.694)을 보였다. 이는 NLL이 순환 논리가 아닌 실제 품질 신호로 유효함을 입증한다.
운영 시사점
추론 시점의 재시도(retry)나 재정렬(rerank)만으로는 품질 내재화를 대체할 수 없으며, 연산 비용도 약 5배 증가한다. 따라서 정렬 학습으로 품질을 높이고, 남은 형식 오류는 검증기 기반 재시도로 처리하는 하이브리드 구성이 최적의 균형점이다. 형식 검증기와 NLL 지표는 모델 버전 비교 및 배포 전 검증에 재사용 가능한 공통 자산으로 활용될 수 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.