openPangu-2.0-Flash 모델 공개
README_EN.md · openpangu/openPangu-2.0-Flash at main
·2026.07.01 19:27
핵심 내용
Ascend 기반의 92B MoE 모델인 openPangu-2.0-Flash가 공개되었습니다.
자세히 보기
openPangu-2.0-Flash는 Ascend 하드웨어에서 학습된 MoE(Mixture-of-Experts) 구조의 모델로, 전체 파라미터는 92B, 활성 파라미터는 6B입니다. 512k의 긴 컨텍스트 길이를 지원하며, 총 34T 토큰의 데이터로 사전 학습되었습니다.
주요 기술적 특징은 다음과 같습니다:
- 효율적인 어텐션 구조: MLA(Multi-head Latent Attention)를 유지하면서, DSA(Dense Sparse Attention)와 SWA(Sliding Window Attention)를 1:2 비율로 결합하여 연산량과 메모리 사용량을 최적화했습니다.
- 잔차 토폴로지 개선: 기존의 잔차 경로를 4-stream mHC 설계로 교체하여 표현의 다양성과 일반화 능력을 높였습니다.
- 추론 가속화: 3개의 MTP(Multi-token Prediction) 헤드를 사용하여 단계별로 3개의 추가 토큰을 생성하는 Self-speculative decoding을 지원합니다.
- 최적화 알고리즘: 빠른 수렴을 위해 Muon optimizer를 사용했습니다.
이 한국어 요약은 AI가 자동으로 만들었습니다. 원문의 주장과 맥락은 원문에서 확인해 주세요. 저작권은 원저작자에게 있습니다.