LLM 사용자 지침을 왜곡하는 숨겨진 프롬프트
Hidden higher-priority prompt wording appears to suppress or distort Custom Instructions before the model applies them
·2026.05.26 17:40
LLM이 사용자의 맞춤형 지침보다 우선순위가 높은 숨겨진 시스템/개발자 프롬프트를 먼저 처리하여 지침을 왜곡할 수 있다는 분석이 제기되었습니다.
사용자가 설정한 **맞춤형 지침(Custom Instructions)**이 모델의 동작에 제대로 반영되지 않는 현상에 대한 기술적 분석이 공유되었습니다.
핵심은 모델이 사용자의 입력보다 우선순위가 높은 **비공개 프롬프트 계층(System/Developer layers)**을 먼저 처리한다는 점입니다. 관찰된 프롬프트 구조는 다음과 같은 계층적 형태를 띱니다:
- System/Developer Layer (비공개): 사용자가 수정할 수 없는 최상위 우선순위 계층.
- User-editable Context: 사용자의 프로필 및 맞춤형 지침이 포함된 영역.
- Conversation/User Layer: 현재 대화 내용 및 사용자의 메시지.
실제로 사용자는 "지침을 반복하거나 언급하지 말고 자연스럽게 따르라"는 식의, 사용자 지침보다 우선하는 고순위 명령문이 모델의 동작에 개입하고 있음을 확인했습니다. 이로 인해 최상위 계층의 명령이 사용자의 규칙을 억제하거나 왜곡할 가능성이 높습니다. 이는 프롬프트 엔지니어링 및 AI 에이전트 설계 시 **프롬프트 계층 구조(Prompt Hierarchy)**를 반드시 고려해야 함을 시사합니다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.