AI Briefing

RL 미세 조정된 VLM의 강건성 및 Chain-of-Thought 일관성에 관하여

·2026.07.02 09:00

RL 미세 조정을 거친 VLM은 시각적 추론 성능은 향상되지만, 텍스트 섭동에 취약한 모습을 보인다.

Reinforcement Learning(RL) 미세 조정은 추론 중심 작업에서 LLM의 성능을 높이는 핵심 기술로 자리 잡았으며, 최근에는 VLM(Vision Language Model)으로 그 영역이 확장되고 있다.

RL 미세 조정을 거친 VLM은 시각적 추론 벤치마크에서 성능 향상을 보이지만, 여전히 약한 Visual Grounding, 환각(Hallucination), 그리고 텍스트 단서에 대한 과도한 의존성 문제를 안고 있다.

연구 결과에 따르면, 잘못된 캡션이나 부정확한 Chain-of-Thought(CoT) 추론 경로와 같은 단순한 텍스트 섭동(Perturbation)만으로도 모델의 강건성과 신뢰도가 크게 저하되는 것으로 나타났다. 특히 이러한 현상은 CoT 일관성이 낮을수록 더욱 두드러지게 발생한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.