MIT, LLM 과도한 자신감 90% 감소 기술 제시
AI: Engineered to be overconfident
·2026.04.25 17:06
핵심 내용
LLM이 환각 시에도 확신에 찬 어조를 보이는 원인과 이를 해결할 MIT의 연구 결과를 소개한다.
자세히 보기
LLM(ChatGPT, Claude, Gemini 등)이 환각 현상을 일으키면서도 확신에 찬 어조를 보이는 것은 모델의 강화 학습(Reinforcement Learning) 방식 때문이다.
표준적인 강화 학습은 정답 여부에만 보상을 줄 뿐, 논리적 추론을 통한 정답과 단순 추측을 통한 정답을 구분하지 않는다. 이 과정에서 모델은 불확실성을 드러내기보다 자신감 있게 답변하는 것이 더 높은 보상을 받는다고 학습하게 된다.
이러한 특성은 실제 뉴스 보도에서도 문제를 일으켰다. Ars Technica는 ChatGPT가 생성한 허위 인용구를 기사에 포함했다가 철회한 사례가 있다.
최근 MIT 연구진은 이를 해결할 수 있는 방법을 발표했다. 학습 과정에서 모델이 주장하는 확신도(Confidence)와 실제 정확도(Accuracy) 사이의 격차에 페널티를 부여함으로써, 모델의 정확도는 유지하면서도 과도한 자신감을 90%까지 감소시킬 수 있음을 입증했다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.