AI Briefing

AFM3 20B, MLP 20% 활성화

Special Architecture in AFM3 20B: Instruction Following Pruning

·2026.08.04 10:26

AFM3 20B는 프롬프트별로 활성 MLP 계층을 약 20%만 선택하는 MoE 모델이다.

AFM3 20B는 입력 프롬프트에 따라 활성화할 MLP 계층을 줄이는 Instruction Following Pruning 아키텍처를 제안한다.

  • 전체 MLP 계층 중 약 20%만 활성화해 추론 시 읽어야 할 가중치와 메모리 대역폭을 줄인다.
  • MoE 구조를 사용하지만 토큰별·계층별로 전문가를 전환하지 않고, 프롬프트 단위로 동일한 전문가 조합을 사용하도록 처음부터 학습했다.
  • 게시글은 FFN/MLP 전문가 가중치가 활성 파라미터의 약 3분의 2를 차지하므로, 희소성을 활용하면 활성 파라미터 대비 읽기 대역폭 효율을 높일 수 있다고 설명한다.
  • 비교 사례로 9B dense 모델을 3B 활성 모델로 줄였다고 언급한다.

입력에 따른 동적 프루닝은 긴 출력을 생성할 때 회복 지연이 발생할 가능성이 있어, 실제 서빙 성능과 품질에 대한 추가 검증이 중요하다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.