AI Briefing

오픈 LLM 최대 활성값 측정

Measuring Maximum Activations in Open Large Language Models

·2026.05.19 21:22

핵심 내용

오픈 LLM 27개 체크포인트의 최대 활성값이 구조와 학습 단계에 따라 크게 달랐다.

자세히 보기

27개 오픈 LLM 체크포인트의 global·layerwise maximum activation을 같은 파이프라인으로 다시 측정했다.

  • 측정 범위: 5,000개 멀티도메인 샘플과 패밀리별 토크나이저를 쓰고, embedding, hidden state, attention, MLP/MoE, SwiGLU gate, final norm에 동일한 훅을 걸었다.
  • 대상: 8개 오픈 패밀리의 dense, MoE, vision-language, intermediate-training, instruction-tuned 변형 27개를 비교했다.

글로벌 최대값은 같은 파라미터 규모에서도 거의 4자릿수 규모 차이를 보였다. Qwen3.5와 일부 MoE 체크포인트는 10^2~10^3 수준이었지만, Gemma3-27B-it는 약 7 x 10^5까지 치솟았다.

  • 스케일링: 패밀리 간, 세대 간 비교에서 단순한 단조 증가 관계는 성립하지 않았다.
  • MoE: 같은 규모의 dense 모델보다 피크가 14.0~23.4배 낮았다.
  • 위치: 24개 중 22개에서 글로벌 최대는 residual stream에서 관측됐다.

가벼운 INT-8 sanity check에서는 측정한 최대값이 activation-scale 선택에 따른 저비트 복원 오차와 함께 움직였다. 결론적으로 최대 활성값은 단순한 크기 부산물이 아니라 모델 패밀리·아키텍처·학습 단계에 묶인 속성이며, 저비트 배포 전에 함께 보고할 필요가 있다.

코드는 GitHub에 공개됐다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.