당신의 Logits는 무엇을 알고 있을까? (답은 놀라울 수 있다!)
·2026.04.20 09:00
최종 **logits**만으로도 이미지 쿼리의 불필요한 정보가 새어 나올 수 있다.
Vision-language model을 테스트베드로 삼아, 내부 표현이 압축되며 어떤 정보가 남는지 서로 비교했다. 기준은 풍부한 정보가 담긴 residual stream, tuned lens로 얻은 저차원 투영, 그리고 모델 답변에 가장 큰 영향을 주는 최종 top-k logits였다.
핵심 결과는, 접근하기 쉬운 top logit values만으로도 이미지 기반 쿼리 안의 task-irrelevant information이 유출될 수 있다는 점이다. 일부 경우에는 이런 logits가, residual stream 전체를 직접 투영한 값만큼 많은 정보를 드러냈다.
즉, 모델이 생성하는 최종 출력만 봐도 사용자가 원래 볼 수 없다고 생각했던 내부 정보가 드러날 수 있다. 이는 모델 내부를 probing하는 방식이 단순한 해석을 넘어 정보 유출 위험으로 이어질 수 있음을 보여준다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.