하이브리드 LLM의 부상
Mamba 이후 하이브리드 LLM이 Transformer의 한계를 대체하고 있다.
Transformer는 여전히 표준 아키텍처지만, self-attention의 quadratic complexity와 커지는 KV-cache 때문에 긴 컨텍스트에서 비용이 급격히 늘어난다. 고정 컨텍스트 한계로 글로벌 정보를 놓치기 쉬워 chunking과 retrieval 같은 우회가 필요했다.
Mamba는 2023년 12월 Albert Gu와 Tri Dao가 제안한 selective **state-space model(SSM)**로, attention 없이도 linear-time inference와 5배 throughput 향상을 보여줬다. 입력 의존적 파라미터와 content-aware 계산을 통해 언어, 오디오, 유전체 같은 영역에서 강한 성능을 보이며 하이브리드 LLM의 출발점이 됐다.
이후 업계는 Mamba와 Transformer를 섞는 방향으로 빠르게 이동했다. Jamba는 attention과 Mamba를 1:7 비율로 섞고 MoE를 더해 256K 토큰 컨텍스트를 지원했고, Jamba 1.5는 398B total / 94B active 규모로 확장했다. MambaVision은 비전에서, Codestral Mamba와 Mamba-Llama는 코드·대화 모델에서 하이브리드 설계를 검증했다.
2025년에는 이 흐름이 더 분명해졌다. Falcon Mamba는 순수 Mamba 모델로 장문 추론에서 일정한 메모리와 처리량을 보였고, Nemotron-H, Bamba, Hunyuan TurboS, Phi-4-mini-flash-reasoning은 Mamba2와 attention, MoE, GMU 등을 조합해 더 빠른 추론과 긴 컨텍스트 대응을 노렸다. 핵심은 하이브리드와 SSM이 실험 단계를 넘어, 실제 배포 가능한 foundation model의 새 기본값으로 올라오고 있다는 점이다.
이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.
요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.