LLM의 언어적 확신도 교정 기술
Making LLMs tell you how confident they really are through probe-targeted fine tuning.[R]
·2026.05.29 14:15
핵심 내용
프로브 타겟 미세 조정을 통해 LLM의 내부 확신도와 언어적 표현 사이의 간극을 줄이는 연구가 발표되었다.
자세히 보기
LLM은 내부 상태(hidden states)를 통해 정답 여부를 높은 정확도(0.76–0.88 AUROC)로 인지하고 있음에도, 실제 답변 시에는 모든 질문에 대해 99%의 확신도를 보이는 경향이 있음. 이는 모델이 내부적으로는 정답 여부를 알지만 이를 언어로 표현하지 못하는 '텍스트 병목 현상' 때문임.
연구진은 **프로브 타겟 미세 조정(Probe-targeted fine-tuning, LoRA)**을 통해 이 문제를 해결함. 모델의 내부 프로브 출력을 미세 조정의 타겟으로 사용하여, 모델이 이미 내부적으로 인지하고 있는 확신도를 말로 표현하도록 학습시킴.
주요 연구 결과:
- 범용성: 7B에서 70B 규모에 이르는 8개 모델(4개 제품군)에서 효과를 검증함.
- 인과성 증명: Activation patching을 통해 특정 위치의 은닉 상태를 교체할 경우 확신도가 변화하는 인과적 관계를 확인함.
- 병목 현상 발견: 70B 모델의 경우, 소프트맥스 분포에는 유효한 메타인지 신호가 존재하지만 텍스트 출력(argmax) 단계에서 99% 확신에 고착되는 현상이 관찰됨.
연구 코드는 GitHub에, 논문은 Zenodo에 공개되어 있음.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.