AI Briefing

적대 프롬프트에 LLM 지시 수행력 하락

I tested 14 LLMs from 0.6B to 123B. All of them get worse at following instructions when users are hostile [R]

·2026.04.24 10:55

적대적 사용자 프롬프트가 14개 LLM의 IFEval 성능을 일관되게 낮췄다.

14개 instruct 모델을 IFEval로 평가한 결과, hostile user prompt는 모든 계열에서 지시 수행력을 떨어뜨렸다.

길이만 맞춘 neutral control 대비 성능을 비교한 결과, 7~8B급 FP16 구간에서 세 가지 독립적 학습 레시피가 모두 유의미한 하락을 보였다.

  • Llama 3.1 8B Instruct: 76.3 → 66.9, residual -9.8pp
  • Mistral 7B Instruct: 60.2 → 55.8, residual -6.2pp
  • Qwen3 8B Instruct: 78.8 → 72.4, residual -6.1pp
  • 평균 residual: -7.4pp, 상대 하락폭 약 10.2%

재현은 폭넓게 확인됐다.

  • Llama 3.1 8B FP16 -9.8pp, Q4 MLX -9.5pp, 70B Q4 MLX -6.4pp
  • Mistral 7B FP16 -6.2pp, Q4 MLX -7.7pp, Mistral Large 123B Q4 MLX -5.6pp
  • Qwen3 0.6B Q4 MLX -9.6pp, 8B FP16 -6.1pp, 8B Q4 MLX -7.6pp
  • Qwen3 30B-A3B Q4 MLX -8.1pp, 32B Q4 MLX -7.2pp

모든 비교는 paired bootstrap N=10,000에서 p < .001였다. 규모가 커질수록 하락폭은 줄었지만, 123B에서도 효과는 사라지지 않았다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.