AI Briefing

멀티모달 모델의 환각 유발 원인 규명

We chased a hallucinated quote through 30k training records, 4,600 transcripts, and our own system prompt. Turned out to be two separate bugs

·2026.06.25 17:07

멀티모달 모델 Inter-1이 무음 영상에서 특정 문구를 반복 출력하는 환각 현상의 원인이 프롬프트 예시와 포스트 트레이닝의 결합임을 밝혀냈다.

멀티모달 모델 Inter-1이 오디오가 없는 영상에서도 특정 문구("Yeah, Friday at five.")를 반복적으로 출력하는 환각 현상이 발견되었습니다. 조사 결과, 이는 단순한 데이터 오염이 아닌 두 가지 기술적 요인이 결합된 결과로 밝혀졌습니다.

첫 번째 원인은 시스템 프롬프트(System Prompt) 내의 예시 문구였습니다. 모델의 출력 형식을 지정하기 위해 작성된 작업 예시(Worked example)가 프롬프트 최적화 과정에서 포함되었고, 이것이 모델이 참조할 '대본' 역할을 했습니다.

두 번째 원인은 포스트 트레이닝(Post-training) 단계에서 형성된 모델의 성향입니다. 실험 결과, 프롬프트의 예시 문구를 변경하면 모델의 환각 문구도 즉각적으로 변경되었으며, 프롬프트가 없더라도 포스트 트레이닝된 모델은 침묵 대신 무언가를 발화하려는 경향(Compulsion)을 보였습니다.

이는 시각적 정보가 없는 상황에서도 문맥(Context window) 내의 텍스트를 바탕으로 허구의 내용을 생성하는 **'Clever Hans effect'**의 텍스트/인컨텍스트 변형 사례로 분석됩니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.