프롬프트 형식에 따른 LLM 평가 변동성
Improving Prompt Consistency with Structured Generations
·2024.04.30 09:00
핵심 내용
프롬프트의 미세한 형식 변화가 LLM 벤치마크 점수와 모델 순위에 큰 영향을 미친다는 연구 결과가 발표되었다.
1 / 2
자세히 보기
Hugging Face의 Leaderboards and Evals 연구팀은 LLM 벤치마크 성능이 프롬프트의 미세한 형식 변화에 매우 민감하게 반응한다는 실험 결과를 공개했다.
동일한 양의 정보를 입력하더라도 질문의 태그, 선택지 제시 방식(A, B, C, D 또는 1, 2, 3, 4), 로그 확률 계산 방식 등에 따라 모델의 성능이 크게 달라진다. MMLU 벤치마크를 활용한 실험 결과, 모델별로 약 10점 이상의 성능 차이가 발생했으며, 심지어 모델 간의 순위(Ranking)가 뒤바뀌는 현상도 관찰되었다.
이러한 현상은 모델의 실제 성능을 객관적으로 비교하는 데 큰 장애물이 된다. 이를 해결하기 위해 Hugging Face는 Dottxt와 협력하여 프롬프트 형식에 관계없이 일관된 출력을 유도하는 Structured Generations 방안을 연구하고 있다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.