프론티어 LLM의 지시 계층 구조 개선
상충하는 지시 사이에서 우선순위를 올바르게 판단하도록 돕는 강화 학습 데이터셋 IH-Challenge를 공개했다.
AI 시스템은 시스템 메시지, 개발자 가이드, 사용자 요청, 온라인 데이터 등 다양한 출처로부터 지시를 받는다. 이들 사이의 우선순위가 무너지면 보안 정책 위반이나 프롬프트 인젝션 공격과 같은 심각한 안전성 문제가 발생한다.
이를 해결하기 위해 System > Developer > User > Tool 순의 명확한 **지시 계층 구조(Instruction Hierarchy)**를 확립하는 것이 필수적이다. 모델은 상위 계층의 제약 조건이 충돌하지 않는 한 하위 계층의 지시를 따라야 한다.
새롭게 설계된 IH-Challenge는 강화 학습(RL)을 위한 데이터셋으로, 기존 학습 방식의 세 가지 함정을 극복하도록 설계되었다. 지시 사항을 단순화하여 모델의 이해도를 높이고, 파이썬 스크립트로 객관적인 채점이 가능하게 했으며, 모델이 안전성을 위해 무분별하게 답변을 거부하는 과도한 거절(over-refusal) 편법을 배우지 않도록 방지한다.
이 방식을 통해 학습된 내부 모델인 GPT-5 Mini-R은 지시 계층 벤치마크에서 성능이 향상되었으며, 프롬프트 인젝션 공격에 대한 강력한 내성을 보여주었다. 또한, 모델의 전반적인 유용성을 유지하면서도 안전 지침에 더 민감하게 반응하는 결과를 얻었다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.