AI Briefing

Multiverse, Ising 최적화 기반 LLM 블록 제거 논문 공개

Pruning LLMs Like a Physicist: Block Removal as an Ising Optimization Problem

·2026.09.21 22:44

핵심 내용

Multiverse Computing이 LLM 블록 제거를 Ising 최적화 문제로 변환해 성능 손실을 최소화하는 압축 기법을 공개했다.

1 / 3

자세히 보기

Multiverse Computing이 Transformer 블록 제거(depth pruning)를 Ising glass라는 물리학적 모델로 재정의한 새로운 LLM 압축 기법을 공개했다. 이 연구는 각 블록의 유지/제거 여부를 이진 변수로 설정하고, 손실 함수의 2차 Taylor 전개를 통해 생성된 Hessian 행렬을 기반으로 에너지 함수를 설계한다. 이 에너지는 프루닝된 모델의 벤치마크 성능을 예측하는 강력한 대리 지표(proxy)로 작용하여, 실제 벤치마킹 없이도 수많은 후보 조합을 효율적으로 평가할 수 있게 한다.

핵심 원리 및 효율성

연구진은 이 문제를 QUBO(Quadratic Unconstrained Binary Optimization) 형태로 변환하여, 양자-inspired 및 고전적 최적화 솔버(tabu search 등)를 활용해 저에너지 상태를 찾는다. 이 방식은 대규모 모델에서도 단일 GPU로 빠르게 수행 가능하며, Multiverse의 기존 압축 스택(양자화, SVD 등)과 호환된다.

성능 결과

  • Llama-3.3-70B-Instruct: 80개 블록 중 40개 제거(50% 압축) 시 MMLU 점수 76.9를 기록, 기존 baseline(54.0) 대비 약 23 percentage points 향상되었다.
  • Qwen3-14B: 12개 블록 제거 시에도 기존 방법 대비 경쟁력 있는 성능을 보였다.
  • 하이브리드 모델 적용: NVIDIA-Nemotron-3-Nano(Mamba2, Attention, MoE 혼합)에서도 재학습 없이 적용 가능함을 입증했다.

특징 및 시사점

에너지가 성능의 완벽한 지표는 아니므로, 단일 지면 상태(ground state)가 항상 최선의 모델은 아니다. 따라서 연구진은 지면 상태뿐 아니라 저에너지 들뜬 상태(low-lying excited states)들을 함께 탐색하여 최적의 프루닝 구성을 찾는 방식을 제안한다. 코드는 GitHub에 오픈소스로 공개되었다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.