Apple, 검색 증류 기반 Rubric-Reward로 오픈도메인 QA 정렬 개선
·2026.08.27 09:00
핵심 내용
Apple이 검색 증류 기반 Rubric-Reward로 오픈도메인 QA 정렬을 개선해 성능을 높였다.
자세히 보기
Apple은 오픈도메인 질의응답(QA)에서 고품질 답변을 생성하기 위해 Rubric-Reward 프레임워크를 도입했다. 기존에는 답변 품질의 여러 측면을 단일 스칼라 객체함수로 포착하기 어려워 효과적인 보상 신호를 설계하는 것이 어려웠다.
새 프레임워크는 검색된 증거에 기반한 쿼리별 Rubric을 생성하고, 이를 여러 품질 차원으로 분해하여 후학습(post-training) 단계에서 세밀한 감독을 제공한다. Rubric을 검색 증거에 조건부 적용하면 사실적 근거가 강화되고, 품질별 차원으로 분해하면 응집력, 조직성, 질의 요구사항 준수도가 향상된다.
평가 결과, 이 접근법은 지시 튜닝된 베이스라인 대비 6.5%, 플랫 Rubric 변형 대비 4% 향상된 성능을 보였다. 구성, 근거, 지시 준수 등 세 가지 평가 축에서 일관된 개선 효과가 확인되었다. 이러한 결과는 지향적이고 다차원적인 Rubric이 복잡한 오픈도메인 QA에서 더 효과적인 보상 감독을 제공함을 보여준다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.