LLM의 언어적 확신도 교정 기술
Making LLMs tell you how confident they really are through probe-targeted fine tuning.[R]
·2026.05.29 14:15
프로브 타겟 미세 조정을 통해 LLM의 내부 확신도와 언어적 표현 사이의 간극을 줄이는 연구가 발표되었다.
LLM은 내부 상태(hidden states)를 통해 정답 여부를 높은 정확도(0.76–0.88 AUROC)로 인지하고 있음에도, 실제 답변 시에는 모든 질문에 대해 99%의 확신도를 보이는 경향이 있음. 이는 모델이 내부적으로는 정답 여부를 알지만 이를 언어로 표현하지 못하는 '텍스트 병목 현상' 때문임.
연구진은 **프로브 타겟 미세 조정(Probe-targeted fine-tuning, LoRA)**을 통해 이 문제를 해결함. 모델의 내부 프로브 출력을 미세 조정의 타겟으로 사용하여, 모델이 이미 내부적으로 인지하고 있는 확신도를 말로 표현하도록 학습시킴.
주요 연구 결과:
- 범용성: 7B에서 70B 규모에 이르는 8개 모델(4개 제품군)에서 효과를 검증함.
- 인과성 증명: Activation patching을 통해 특정 위치의 은닉 상태를 교체할 경우 확신도가 변화하는 인과적 관계를 확인함.
- 병목 현상 발견: 70B 모델의 경우, 소프트맥스 분포에는 유효한 메타인지 신호가 존재하지만 텍스트 출력(argmax) 단계에서 99% 확신에 고착되는 현상이 관찰됨.
연구 코드는 GitHub에, 논문은 Zenodo에 공개되어 있음.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.