AI Briefing

openPangu-2.0-Flash 모델 공개

README_EN.md · openpangu/openPangu-2.0-Flash at main

·2026.07.01 19:27

Ascend 기반의 92B MoE 모델인 openPangu-2.0-Flash가 공개되었습니다.

openPangu-2.0-Flash는 Ascend 하드웨어에서 학습된 MoE(Mixture-of-Experts) 구조의 모델로, 전체 파라미터는 92B, 활성 파라미터는 6B입니다. 512k의 긴 컨텍스트 길이를 지원하며, 총 34T 토큰의 데이터로 사전 학습되었습니다.

주요 기술적 특징은 다음과 같습니다:

  • 효율적인 어텐션 구조: MLA(Multi-head Latent Attention)를 유지하면서, DSA(Dense Sparse Attention)와 SWA(Sliding Window Attention)를 1:2 비율로 결합하여 연산량과 메모리 사용량을 최적화했습니다.
  • 잔차 토폴로지 개선: 기존의 잔차 경로를 4-stream mHC 설계로 교체하여 표현의 다양성과 일반화 능력을 높였습니다.
  • 추론 가속화: 3개의 MTP(Multi-token Prediction) 헤드를 사용하여 단계별로 3개의 추가 토큰을 생성하는 Self-speculative decoding을 지원합니다.
  • 최적화 알고리즘: 빠른 수렴을 위해 Muon optimizer를 사용했습니다.

이 요약은 원문 이해를 돕기 위한 큐레이션입니다. 저작권은 원저작자에게 있으며, 정확한 내용과 맥락은 원문을 확인하세요.

요약 오류, 출처 표기 문제, 삭제 요청은 문의 · 건의로 알려주세요.