AI Briefing

TII, Falcon Mamba 7B 모델 공개

Welcome Falcon Mamba: The first strong attention-free 7B model

·2024.08.12 09:00

TII가 어텐션 메커니즘 없이도 높은 성능을 구현한 7B 규모의 Mamba 기반 모델을 공개했다.

TII(Technology Innovation Institute)가 기존 트랜스포머(Transformer)의 어텐션 메커니즘 한계를 극복하기 위해 설계된 Falcon Mamba 7B 모델을 공개했습니다. 이 모델은 순수 Mamba(State Space Model, SSM) 아키텍처를 기반으로 합니다.

주요 기술적 특징:

  • 시퀀스 확장성 및 효율성: 어텐션의 연산/메모리 비용 문제를 해결하여, 시퀀스 길이에 관계없이 일정한 토큰 생성 시간을 유지하며 임의의 길이의 시퀀스를 처리할 수 있습니다.
  • 메모리 최적화: 시퀀스 길이에 따른 메모리 증가 없이 작동하여, 단일 A10(24GB) GPU에서도 구동이 가능합니다.
  • 학습 안정성: Mamba 아키텍처에 추가적인 RMS normalization 레이어를 도입하여 대규모 학습 시의 안정성을 확보했습니다.

학습 및 성능 결과:

  • 데이터셋: RefinedWeb 및 고품질 기술/코드 데이터를 포함하여 약 5,500GT 토큰으로 학습되었습니다.
  • 벤치마크 성능: IFEval, BBH, MMLU-PRO 등 주요 지표에서 Llama 3, Mistral 등 기존 트랜스포머 기반 모델 및 하이브리드 모델과 대등하거나 우수한 성능을 기록하며, 순수 SSM 모델로서의 강력한 경쟁력을 입증했습니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.