RL 미세 조정된 VLM의 강건성 및 Chain-of-Thought 일관성에 관하여
·2026.07.02 09:00
핵심 내용
RL 미세 조정을 거친 VLM은 시각적 추론 성능은 향상되지만, 텍스트 섭동에 취약한 모습을 보인다.
자세히 보기
Reinforcement Learning(RL) 미세 조정은 추론 중심 작업에서 LLM의 성능을 높이는 핵심 기술로 자리 잡았으며, 최근에는 VLM(Vision Language Model)으로 그 영역이 확장되고 있다.
RL 미세 조정을 거친 VLM은 시각적 추론 벤치마크에서 성능 향상을 보이지만, 여전히 약한 Visual Grounding, 환각(Hallucination), 그리고 텍스트 단서에 대한 과도한 의존성 문제를 안고 있다.
연구 결과에 따르면, 잘못된 캡션이나 부정확한 Chain-of-Thought(CoT) 추론 경로와 같은 단순한 텍스트 섭동(Perturbation)만으로도 모델의 강건성과 신뢰도가 크게 저하되는 것으로 나타났다. 특히 이러한 현상은 CoT 일관성이 낮을수록 더욱 두드러지게 발생한다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.