AI Briefing

1,800개 언어 지원 mmBERT 공개

mmBERT: ModernBERT goes Multilingual

·2025.09.09 09:00

1,800개 이상의 언어를 지원하며 ModernBERT 아키텍처를 기반으로 한 차세대 다국어 인코더 mmBERT가 공개되었다.

mmBERT는 3T개 이상의 토큰을 사용하여 1,800개 이상의 언어로 학습된 최첨단 다국어 인코더 모델이다. ModernBERT 아키텍처를 기반으로 설계되어 매우 빠른 추론 속도를 자랑하며, 기존의 XLM-R을 능가하는 성능을 보여주는 최초의 다국어 모델이다.

주요 특징 및 혁신 사항:

  • 점진적 언어 포함 전략 (Progressive Language Inclusion): 학습 단계에 따라 언어 분포를 점진적으로 평탄화(flatter)하며 새로운 언어를 추가한다. 이를 통해 저자원 언어(low-resource languages)의 학습 효율을 극대화하면서도 전체적인 데이터 품질을 유지한다.
  • 3단계 학습 프로세스:
    1. Pre-training (2.3T tokens): 60개 언어 대상, 30% 마스크 비율.
    2. Mid-training (600B tokens): 110개 언어 확장, 컨텍스트 8192 토큰 확장, 15% 마스크 비율.
    3. Decay phase (100B tokens): 1,833개 전체 언어 포함, 5% 마스크 비율로 학습 마무리.
  • 역 마스크 비율 스케줄 (Inverse Mask Ratio Schedule): 학습이 진행됨에 따라 마스크 비율을 30% $\rightarrow$ 15% $\rightarrow$ 5%로 점진적으로 낮추어 효율적인 학습을 유도한다.
  • 아키텍처 및 토크나이저: ModernBERT의 구조를 계승하되, 다국어 대응력을 높이기 위해 Gemma 2 토크나이저를 사용한다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.