LLM-as-a-Judge로 Netflix 쇼 시놉시스 평가하기
핵심 내용
Netflix는 LLM judge와 agents로 시놉시스 품질을 인간 기준에 맞게 자동 평가했다.
자세히 보기
Netflix는 수십만 개의 쇼 시놉시스를 규모 있게 검증하기 위해 LLM-as-a-Judge 접근법을 도입했다. 목표는 창작팀이 정의한 품질 기준을 자동으로 판정하면서도, 실제 회원 반응과 연결되는 신호까지 함께 잡아내는 것이다.
시놉시스 품질은 두 축으로 나뉜다.
- Creative Quality: 내부 작성 가이드와 루브릭에 맞는지 평가
- Member Implicit Feedback: Take Fraction과 Abandonment Rate로 회원 반응을 측정
크리에이티브 품질 기준을 만들기 위해 먼저 약 1,000개의 다양한 시놉시스를 세 명의 전문가가 반복 평가했고, 여러 차례의 calibration으로 기준을 다듬었다. 그 과정에서 binary score를 쓰고, 과거 예시를 참조하게 하며, 흔한 오류의 검색 가능한 taxonomy를 유지하는 방식이 합의도를 높이는 데 효과적이었다. 이후 약 8번의 calibration round를 거쳐 작성자 합의는 약 **80%**까지 올라갔고, 최종적으로 약 600개의 golden set이 만들어졌다.
이후 평가 시스템은 기준별로 분리된 judge를 사용했다. 하나의 프롬프트로 모든 기준을 처리하면 성능이 떨어졌고, 각 기준에 맞는 메타데이터와 가이드를 넣은 뒤 zero-shot chain-of-thought로 설명을 생성하고 마지막에 binary 결정을 내리는 방식이 더 좋았다. 또한 **APO(Automatic Prompt Optimization)**로 약 300샘플 dev set에서 프롬프트를 다듬었다.
추론 품질을 높이기 위해 두 가지 방법도 썼다.
- Tiered rationales: 길게 추론하되, 최종 답변 전에는 짧게 요약
- Consensus scoring: 여러 번 샘플링한 결과를 평균 내어 최종 판정
예를 들어 tone 기준에서는 tiered rationales가 **86.55%**에서 **87.85%**로 정확도를 끌어올렸다. 5x consensus도 tone과 clarity에서는 분명한 개선을 보였지만, precision처럼 짧은 rationale에선 효과가 거의 없었다. reasoning model도 더 높은 성능을 보였지만, 최종 시스템에는 비용 문제로 제외됐다.
사실성(factuality) 검증에는 Agents-as-a-Judge를 적용했다. 시놉시스의 오류를 다음 네 가지로 나눠 좁게 평가했다.
- 잘못된 plot information
- 잘못된 metadata
- 잘못된 on- or off-screen talent
- 잘못된 award information
핵심은 한 번에 너무 많은 문맥과 기준을 넣지 않는 것이었다. 각 에이전트가 하나의 좁은 사실성 문제만 맡을 때 정확도가 더 안정적이었고, 이렇게 얻은 점수는 핵심 스트리밍 지표와도 상관관계를 보여 주었다. 결과적으로 Netflix는 이 시스템으로 공개 전 수주 또는 수개월 전에 문제 있는 시놉시스를 찾아 수정할 수 있게 됐다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.