AI Briefing

카카오, CodeBuddy 성능 평가에 LLM as a Judge 도입…편향 완화 방안 제시

·2025.03.07 00:00

핵심 내용

카카오 CodeBuddy가 LLM as a Judge를 활용해 성능 평가를 수행하며, 프롬프트 구조 개선과 위치 편향 완화를 통해 평가 신뢰도를 높이는 방안을 제시했습니다.

자세히 보기

카카오의 AI 코딩 어시스턴트 CodeBuddy는 복잡한 PR 코드 리뷰 및 성능 평가를 위해 LLM as a Judge 기법을 도입했습니다. 이 과정에서 자기 편향, 장황 편향, 위치 편향 등 LLM 평가자가 가질 수 있는 문제점을 분석했습니다. 특히 평가 프롬프트에서 System Message와 User Message를 명확히 구분하지 않을 경우 응답 간 차이를 반영하지 못해 80% 이상의 높은 동률(Tie)이 발생하여 변별력이 떨어지는 현상을 확인했습니다. 반면, 이를 명확히 구분할 경우 높은 변별력을 확보할 수 있었습니다. 또한, 코드 개선(Improve) 태스크에서는 후보 응답의 배치 순서에 따라 승률이 최대 28%까지 달라지는 위치 편향이 두드러지게 나타났습니다. 이에 따라 카카오는 다중 평가자 활용, 반복 평가를 통한 평균화, 프롬프트 내 평가 기준 명확화 등의 전략을 통해 평가의 신뢰성을 높이는 방안을 제시했습니다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.