Multiverse, Ising 최적화 기반 LLM 블록 제거 논문 공개
Pruning LLMs Like a Physicist: Block Removal as an Ising Optimization Problem
핵심 내용
Multiverse Computing이 LLM 블록 제거를 Ising 최적화 문제로 변환해 성능 손실을 최소화하는 압축 기법을 공개했다.
자세히 보기
Multiverse Computing이 Transformer 블록 제거(depth pruning)를 Ising glass라는 물리학적 모델로 재정의한 새로운 LLM 압축 기법을 공개했다. 이 연구는 각 블록의 유지/제거 여부를 이진 변수로 설정하고, 손실 함수의 2차 Taylor 전개를 통해 생성된 Hessian 행렬을 기반으로 에너지 함수를 설계한다. 이 에너지는 프루닝된 모델의 벤치마크 성능을 예측하는 강력한 대리 지표(proxy)로 작용하여, 실제 벤치마킹 없이도 수많은 후보 조합을 효율적으로 평가할 수 있게 한다.
핵심 원리 및 효율성
연구진은 이 문제를 QUBO(Quadratic Unconstrained Binary Optimization) 형태로 변환하여, 양자-inspired 및 고전적 최적화 솔버(tabu search 등)를 활용해 저에너지 상태를 찾는다. 이 방식은 대규모 모델에서도 단일 GPU로 빠르게 수행 가능하며, Multiverse의 기존 압축 스택(양자화, SVD 등)과 호환된다.
성능 결과
- Llama-3.3-70B-Instruct: 80개 블록 중 40개 제거(50% 압축) 시 MMLU 점수 76.9를 기록, 기존 baseline(54.0) 대비 약 23 percentage points 향상되었다.
- Qwen3-14B: 12개 블록 제거 시에도 기존 방법 대비 경쟁력 있는 성능을 보였다.
- 하이브리드 모델 적용: NVIDIA-Nemotron-3-Nano(Mamba2, Attention, MoE 혼합)에서도 재학습 없이 적용 가능함을 입증했다.
특징 및 시사점
에너지가 성능의 완벽한 지표는 아니므로, 단일 지면 상태(ground state)가 항상 최선의 모델은 아니다. 따라서 연구진은 지면 상태뿐 아니라 저에너지 들뜬 상태(low-lying excited states)들을 함께 탐색하여 최적의 프루닝 구성을 찾는 방식을 제안한다. 코드는 GitHub에 오픈소스로 공개되었다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.