AI Briefing

ToMoE, 밀집 LLM을 MoE로 변환

[Paper] ToMoE: Converting Dense Large Language Models to Mixture-of-Experts through Dynamic Structural Pruning

·2026.08.24 22:54

핵심 내용

동적 구조적 프루닝을 통해 밀집 LLM을 MoE로 변환하여 성능 저하 없이 활성 파라미터를 줄이는 ToMoE 기법이 공개됐다.

자세히 보기

대규모 언어 모델(LLM)의 높은 계산 및 메모리 비용 문제를 해결하기 위해 ToMoE 기법이 제안되었다. 기존 구조적 프루닝 방식은 불필요한 파라미터를 영구적으로 제거해 성능 저하를 유발하는 반면, ToMoE는 동적 구조적 프루닝을 적용하여 파라미터를 삭제하지 않으면서도 활성 파라미터 수를 고정된 수준으로 유지한다.

이 방법은 MLP 레이어를 Mixture of Experts(MoE) 아키텍처로 변환하는 방식을 취하며, 미세 조정(fine-tuning) 없이도 기존 구조적 프루닝 기술보다 일관되게 우수한 성능을 보인다. Phi-2, LLaMA-2, LLaMA-3, Qwen-2.5 등 다양한 모델 계열에서 검증되었으며, 관련 논문은 ICML 2026에 채택되었다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.