AI Briefing

LLM 정렬(Alignment)은 마지막 레이어에 집중된다

Periphery Alignment: evidence that some LLM behaviors concentrate near the final layers

·2026.06.15 01:32

LLM의 안전성 및 유도(Sycophancy) 동작이 모델의 후반부 레이어에 집중되어 있다는 연구 결과가 발표되었습니다.

연구자는 모델의 **능력 생성(Capability production)**과 **행동 라우팅(Behavioral routing)**이 기능적으로 분리될 수 있다는 **'Two-Body Hypothesis'**를 제안합니다.

여러 소규모 Transformer 환경에서 실험한 결과, 안전성(Safety)아첨(Sycophancy) 관련 속성이 네트워크의 끝부분(96~97% 깊이)에서 정점(Peak)을 찍는 것을 확인했습니다. 이를 바탕으로 다음과 같은 실험을 수행했습니다.

  • Sparse intervention (희소 개입)
  • Late-layer safety fine-tuning (후반 레이어 안전성 미세 조정)
  • Layer-frozen GRPO (레이어 고정 GRPO)
  • Adapter merging (어댑터 병합)

연구의 핵심은 모델에 단 하나의 '정렬 레이어'가 존재하는 것이 아니라, **공간적으로 타겟팅된 정렬(Spatially targeted alignment)**이 테스트 가능하며 유용할 수 있다는 점을 시사합니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.