AI Briefing

1,800개 언어 지원 mmBERT 공개

mmBERT: ModernBERT goes Multilingual

·2025.09.09 09:00

핵심 내용

1,800개 이상의 언어를 지원하며 ModernBERT 아키텍처를 기반으로 한 차세대 다국어 인코더 mmBERT가 공개되었다.

자세히 보기

mmBERT는 3T개 이상의 토큰을 사용하여 1,800개 이상의 언어로 학습된 최첨단 다국어 인코더 모델이다. ModernBERT 아키텍처를 기반으로 설계되어 매우 빠른 추론 속도를 자랑하며, 기존의 XLM-R을 능가하는 성능을 보여주는 최초의 다국어 모델이다.

주요 특징 및 혁신 사항:

  • 점진적 언어 포함 전략 (Progressive Language Inclusion): 학습 단계에 따라 언어 분포를 점진적으로 평탄화(flatter)하며 새로운 언어를 추가한다. 이를 통해 저자원 언어(low-resource languages)의 학습 효율을 극대화하면서도 전체적인 데이터 품질을 유지한다.
  • 3단계 학습 프로세스:
    1. Pre-training (2.3T tokens): 60개 언어 대상, 30% 마스크 비율.
    2. Mid-training (600B tokens): 110개 언어 확장, 컨텍스트 8192 토큰 확장, 15% 마스크 비율.
    3. Decay phase (100B tokens): 1,833개 전체 언어 포함, 5% 마스크 비율로 학습 마무리.
  • 역 마스크 비율 스케줄 (Inverse Mask Ratio Schedule): 학습이 진행됨에 따라 마스크 비율을 30% $\rightarrow$ 15% $\rightarrow$ 5%로 점진적으로 낮추어 효율적인 학습을 유도한다.
  • 아키텍처 및 토크나이저: ModernBERT의 구조를 계승하되, 다국어 대응력을 높이기 위해 Gemma 2 토크나이저를 사용한다.

이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.

AI 처리 방식을 확인하거나, 요약 오류와 출처 표기 문제, 삭제 요청을 문의 · 건의로 알려주세요.